Skip to content
AI Atlas
BenchmarkActivecategory · instruction-following

IFBench

precise instruction following with novel constraints

quality51

Updated 8 h ago · first seen 11 Sept 2026

bench_01M293SPGX8Q1PSHHMPKC9R37H

Metric
accuracy · %
Direction
Higher is better
Results
450
Leader
grok-4-3-medium 83.33%

Score history · nvidia-nemotron-3-nano-30b-a3b-reasoning 1 row

Not enough history to chart — a single observation (71.09% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 71.09%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 450 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101olmo-3-1-32b-thinkAllen Institute for AI65.99%aa_slug=olmo-3-1-32b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102gpt-5-4-lowOpenAI65.92%aa_slug=gpt-5-4-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103gpt-5-nano-mediumOpenAI65.92%aa_slug=gpt-5-nano-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104gpt-5-2-mediumOpenAI65.24%aa_slug=gpt-5-2-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105gpt-oss-20bOpenAI65.1%aa_slug=gpt-oss-20b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106gpt-5-4-mini-mediumOpenAI64.76%aa_slug=gpt-5-4-mini-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107k-exaoneLG AI Research64.69%aa_slug=k-exaone · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108Step 3.5 FlashStepFun64.56%aa_slug=step-3-5-flash-0202 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109gpt-5-4-nano-mediumOpenAI64.42%aa_slug=gpt-5-4-nano-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110gpt-5-6-terra-highOpenAI64.42%aa_slug=gpt-5-6-terra-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111Qwen3.6 35B A3BQwen64.35%aa_slug=qwen3-6-35b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112gpt-5-5-lowOpenAI64.35%aa_slug=gpt-5-5-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113mimo-v2-flash-reasoningXiaomi64.22%aa_slug=mimo-v2-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114deepseek-v3-2-specialeDeepSeek63.88%aa_slug=deepseek-v3-2-speciale · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115Claude Fable 5Anthropic63.47%aa_slug=claude-fable-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116nemotron-3-nano-omni-30b-a3bNVIDIA63.2%aa_slug=nemotron-3-nano-omni-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117Hy3 previewTencent63.13%aa_slug=hy3-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118Kimi K2.7 CodeMoonshot AI63.13%aa_slug=kimi-k2-7-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119k2-think-v2MBZUAI Institute of Foundation Models62.79%aa_slug=k2-think-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120Claude Opus 4.8Anthropic62.24%aa_slug=claude-opus-4-8 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121gpt-5-6-terra-mediumOpenAI62.18%aa_slug=gpt-5-6-terra-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122nova-2-0-omni-reasoning-lowAmazon Web Services61.77%aa_slug=nova-2-0-omni-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123apriel-v1-5-15b-thinkerServiceNow61.7%aa_slug=apriel-v1-5-15b-thinker · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124nova-2-0-lite-reasoning-lowAmazon Web Services61.22%aa_slug=nova-2-0-lite-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125GLM 5V TurboZ.ai (Zhipu AI)61.09%aa_slug=glm-5v-turbo · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126GLM 4.7 FlashZ.ai (Zhipu AI)60.82%aa_slug=glm-4-7-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127DeepSeek V3.2DeepSeek60.68%aa_slug=deepseek-v3-2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128qwen3-next-80b-a3b-reasoningAlibaba Group60.68%aa_slug=qwen3-next-80b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129k2-v2MBZUAI Institute of Foundation Models60.14%aa_slug=k2-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130gpt-5-6-terra-lowOpenAI59.66%aa_slug=gpt-5-6-terra-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131diffusiongemma-26b-a4bGoogle59.46%aa_slug=diffusiongemma-26b-a4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132qwen3-vl-32b-reasoningAlibaba Group59.39%aa_slug=qwen3-vl-32b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133Claude Opus 4.7Anthropic58.64%aa_slug=claude-opus-4-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134gpt-oss-120b-lowOpenAI58.3%aa_slug=gpt-oss-120b-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135nvidia-nemotron-3-nano-4bNVIDIA58.23%aa_slug=nvidia-nemotron-3-nano-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136claude-opus-4-5-thinkingAnthropic57.96%aa_slug=claude-opus-4-5-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137exaone-4-5-33bLG AI Research57.96%aa_slug=exaone-4-5-33b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138gpt-oss-20b-lowOpenAI57.82%aa_slug=gpt-oss-20b-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139solar-open-100b-reasoningUpstage57.69%aa_slug=solar-open-100b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140North Mini Code (free)Cohere57.55%aa_slug=north-mini-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141ling-2-6-flashinclusionAI57.41%aa_slug=ling-2-6-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142claude-4-5-sonnet-thinkingAnthropic57.28%aa_slug=claude-4-5-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143motif-2-12-7bMotif Technologies57.01%aa_slug=motif-2-12-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144deepseek-v3-1-terminus-reasoningDeepSeek57.01%aa_slug=deepseek-v3-1-terminus-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145ling-2-6-1tinclusionAI56.87%aa_slug=ling-2-6-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146claude-sonnet-4-6-adaptiveAnthropic56.6%aa_slug=claude-sonnet-4-6-adaptive · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147qwen3-vl-235b-a22b-reasoningAlibaba Group56.46%aa_slug=qwen3-vl-235b-a22b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
148#148Trinity Large ThinkingArcee AI56.26%aa_slug=trinity-large-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
149#149LFM2.5-8B-A1BLiquid AI55.65%aa_slug=lfm2-5-8b-a1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
150#150claude-4-1-opus-thinkingAnthropic55.44%aa_slug=claude-4-1-opus-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
151#151glm-5-non-reasoningZ.ai (Zhipu AI)55.17%aa_slug=glm-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
152#152k2-v2-mediumMBZUAI Institute of Foundation Models55.1%aa_slug=k2-v2-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
153#153gemini-3-flashGoogle55.1%aa_slug=gemini-3-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
154#154claude-4-sonnet-thinkingAnthropic54.69%aa_slug=claude-4-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
155#155tri-21b-think-v0-5Trillion Labs54.63%aa_slug=tri-21b-think-v0-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
156#156glm-4-7-non-reasoningZ.ai (Zhipu AI)54.63%aa_slug=glm-4-7-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
157#157falcon-h1r-7bTII UAE54.42%aa_slug=falcon-h1r-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
158#158claude-4-5-haiku-reasoningAnthropic54.29%aa_slug=claude-4-5-haiku-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
159#159DeepSeek V3.2 ExpDeepSeek54.15%aa_slug=deepseek-v3-2-reasoning-0925 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
160#160qwen3-max-thinking-previewAlibaba Group53.81%aa_slug=qwen3-max-thinking-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
161#161Claude Opus 4Anthropic53.74%aa_slug=claude-4-opus-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
162#162grok-4SpaceXAI53.67%aa_slug=grok-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
163#163mimo-v2-omniXiaomi53.54%aa_slug=mimo-v2-omni · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
164#164gemma-4-31b-non-reasoningGoogle53.47%aa_slug=gemma-4-31b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
165#165claude-opus-4-6-adaptiveAnthropic53.13%aa_slug=claude-opus-4-6-adaptive · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
166#166grok-4-1-fast-reasoningSpaceXAI52.72%aa_slug=grok-4-1-fast-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
167#167gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle52.59%aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
168#168jamba-reasoning-3bAI21 Labs52.45%aa_slug=jamba-reasoning-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
169#169gemini-2-5-flash-preview-09-2025-reasoningGoogle52.31%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
170#170nova-2-0-proAmazon Web Services52.04%aa_slug=nova-2-0-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
171#171glm-5-1-non-reasoningZ.ai (Zhipu AI)51.97%aa_slug=glm-5-1-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
172#172Qwen3.5-4BQwen51.97%aa_slug=qwen3-5-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
173#173qwen3-5-397b-a17b-non-reasoningAlibaba Group51.63%aa_slug=qwen3-5-397b-a17b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
174#174doubao-seed-codeByteDance51.43%aa_slug=doubao-seed-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
175#175Qwen3 235B A22B Instruct 2507Qwen51.22%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
176#176qwen3-5-omni-plusAlibaba Group51.16%aa_slug=qwen3-5-omni-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
177#177qwen3-5-122b-a10b-non-reasoningAlibaba Group50.82%aa_slug=qwen3-5-122b-a10b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
178#178qwen3-30b-a3b-2507-reasoningAlibaba Group50.68%aa_slug=qwen3-30b-a3b-2507-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
179#179grok-4-fast-reasoningSpaceXAI50.54%aa_slug=grok-4-fast-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
180#180gemini-2-5-flash-reasoningGoogle50.27%aa_slug=gemini-2-5-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
181#181step-3-vl-10bStepFun50.2%aa_slug=step-3-vl-10b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
182#182Gemini 2.5 Flash-LiteGoogle49.86%aa_slug=gemini-2-5-flash-lite-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
183#183qwen3-4b-2507-instruct-reasoningAlibaba Group49.8%aa_slug=qwen3-4b-2507-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
184#184gemini-3-pro-lowGoogle49.66%aa_slug=gemini-3-pro-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
185#185minicpm5-1bOpenBMB49.32%aa_slug=minicpm5-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
186#186grok-4.20-0309-non-reasoningxAI49.32%aa_slug=grok-4-20-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
187#187mi-dm-k-2-5-pro-dec28Korea Telecom49.32%aa_slug=mi-dm-k-2-5-pro-dec28 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
188#188olmo-3-32b-thinkAllen Institute for AI49.12%aa_slug=olmo-3-32b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
189#189DeepSeek V3DeepSeek49.05%aa_slug=deepseek-v3-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
190#190Gemini 2.5 ProGoogle48.71%aa_slug=gemini-2-5-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
191#191gpt-5-4-non-reasoningOpenAI48.44%aa_slug=gpt-5-4-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
192#192claude-3-7-sonnet-thinkingAnthropic48.3%aa_slug=claude-3-7-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
193#193Mistral Small 4Mistral AI48.16%aa_slug=mistral-small-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
194#194qwen3-max-previewAlibaba Group48.03%aa_slug=qwen3-max-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
195#195hy3-non-reasoningTencent47.96%aa_slug=hy3-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
196#196grok-4-20-0309-non-reasoningSpaceXAI47.82%aa_slug=grok-4-20-0309-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
197#197grok-4-3-non-reasoningSpaceXAI47.62%aa_slug=grok-4-3-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
198#198gpt-5-2-non-reasoningOpenAI47.41%aa_slug=gpt-5-2-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
199#199gemini-3-5-flash-minimalGoogle47.28%aa_slug=gemini-3-5-flash-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
200#200deepseek-v4-flash-0420-non-reasoningDeepSeek47.21%aa_slug=deepseek-v4-flash-0420-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.