Skip to content
AI Atlas
BenchmarkActivecategory · instruction-following

IFBench

precise instruction following with novel constraints

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPGX8Q1PSHHMPKC9R37H

Metric
accuracy · %
Direction
Higher is better
Results
450
Leader
grok-4-3-medium 83.33%

Score history · Trinity Large Thinking 1 row

Not enough history to chart — a single observation (56.26% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 56.26%aa_slug=trinity-large-thinking · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 450 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
401#401R1 Distill Llama 70BDeepSeek27.55%aa_slug=deepseek-r1-distill-llama-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
402#402nvidia-nemotron-nano-9b-v2NVIDIA27.14%aa_slug=nvidia-nemotron-nano-9b-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
403#403Molmo2-8BAllen Institute for AI26.94%aa_slug=molmo2-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
404#404qwen3-1.7b-instruct-reasoningAlibaba Group26.87%aa_slug=qwen3-1.7b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
405#405Ministral 3 3BMistral AI26.8%aa_slug=ministral-3-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
406#406minicpm-v4-6-1-3bOpenBMB26.73%aa_slug=minicpm-v4-6-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
407#407sarvam-30bSarvam26.46%aa_slug=sarvam-30b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
408#408Mistral Small 3Mistral AI26.39%aa_slug=mistral-small-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
409#409lfm2-8b-a1bLiquid AI26.26%aa_slug=lfm2-8b-a1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
410#410Llama-3.2-3BMeta AI26.19%aa_slug=llama-3-2-instruct-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
411#411granite-4-0-h-nano-1bIBM26.19%aa_slug=granite-4-0-h-nano-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
412#412nvidia-nemotron-nano-12b-v2-vlNVIDIA25.85%aa_slug=nvidia-nemotron-nano-12b-v2-vl · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
413#413apertus-70b-instructSwiss AI Initiative25.85%aa_slug=apertus-70b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
414#414llama-3-1-nemotron-nano-4b-reasoningNVIDIA25.51%aa_slug=llama-3-1-nemotron-nano-4b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
415#415exaone-4-0-1-2bLG AI Research25.31%aa_slug=exaone-4-0-1-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
416#416magistral-mediumMistral AI25.1%aa_slug=magistral-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
417#417Granite 4.0 MicroIBM24.76%aa_slug=granite-4-0-micro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
418#418magistral-smallMistral AI24.76%aa_slug=magistral-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
419#419llama-3-instruct-8bMeta AI24.56%aa_slug=llama-3-instruct-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
420#420olmo-2-7bAllen Institute for AI24.42%aa_slug=olmo-2-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
421#421qwen3-14b-instructAlibaba Group23.95%aa_slug=qwen3-14b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
422#422phi-3-miniMicrosoft23.88%aa_slug=phi-3-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
423#423ling-mini-2-0inclusionAI23.61%aa_slug=ling-mini-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
424#424Phi 4Microsoft23.54%aa_slug=phi-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
425#425Qwen3-0.6BQwen23.33%aa_slug=qwen3-0.6b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
426#426exaone-4-0-1-2b-reasoningLG AI Research22.99%aa_slug=exaone-4-0-1-2b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
427#427DeepSeek-R1-Distill-Qwen-32BDeepSeek22.93%aa_slug=deepseek-r1-distill-qwen-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
428#428Llama-3.2-1BMeta AI22.79%aa_slug=llama-3-2-instruct-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
429#429granite-3-3-8b-instructIBM22.45%aa_slug=granite-3-3-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
430#430apertus-8b-instructSwiss AI Initiative22.38%aa_slug=apertus-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
431#431deepseek-r1-distill-qwen-14bDeepSeek22.11%aa_slug=deepseek-r1-distill-qwen-14b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
432#432gemma-3n-e2bGoogle22.04%aa_slug=gemma-3n-e2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
433#433LFM2-1.2BLiquid AI21.97%aa_slug=lfm2-1-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
434#434qwen3-0.6b-instructAlibaba Group21.9%aa_slug=qwen3-0.6b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
435#435qwen3-5-0-8b-non-reasoningAlibaba Group21.56%aa_slug=qwen3-5-0-8b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
436#436Qwen3.5-0.8BQwen21.5%aa_slug=qwen3-5-0-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
437#437qwen3-1.7b-instructAlibaba Group21.09%aa_slug=qwen3-1.7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
438#438phi-4-miniMicrosoft21.09%aa_slug=phi-4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
439#439granite-4-0-nano-1bIBM20.54%aa_slug=granite-4-0-nano-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
440#440tiny-aya-globalCohere20.14%aa_slug=tiny-aya-global · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
441#441gemma-3-1bGoogle19.93%aa_slug=gemma-3-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
442#442Mistral 7BMistral AI19.93%aa_slug=mistral-7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
443#443DeepSeek-R1-0528-Qwen3-8BDeepSeek19.86%aa_slug=deepseek-r1-qwen3-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
444#444molmo-7b-dAllen Institute for AI19.66%aa_slug=molmo-7b-d · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
445#445lfm2-2-6bLiquid AI19.52%aa_slug=lfm2-2-6b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
446#446granite-4-0-h-350mIBM17.55%aa_slug=granite-4-0-h-350m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
447#447deepseek-r1-distill-llama-8bDeepSeek17.55%aa_slug=deepseek-r1-distill-llama-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
448#448granite-4-0-350mIBM15.92%aa_slug=granite-4-0-350m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
449#449DeepSeek-R1-Distill-Qwen-1.5BDeepSeek13.2%aa_slug=deepseek-r1-distill-qwen-1-5b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
450#450gemma-3-270mGoogle12.11%aa_slug=gemma-3-270m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.