Skip to content
AI Atlas
BenchmarkActivecategory · instruction-following

IFBench

precise instruction following with novel constraints

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPGX8Q1PSHHMPKC9R37H

Metric
accuracy · %
Direction
Higher is better
Results
450
Leader
grok-4-3-medium 83.33%

Score history · Claude Opus 4.7 1 row

Not enough history to chart — a single observation (58.64% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 58.64%aa_slug=claude-opus-4-7 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 450 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201tri-21b-think-previewTrillion Labs47.14%aa_slug=tri-21b-think-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202Llama 3.3 70BMeta AI47.07%aa_slug=llama-3-3-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203qwen3-5-27b-non-reasoningAlibaba Group46.94%aa_slug=qwen3-5-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204grok-3SpaceXAI46.94%aa_slug=grok-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205glm-4-7-flash-non-reasoningZ.ai (Zhipu AI)46.26%aa_slug=glm-4-7-flash-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206cogito-v2-1-reasoningDeep Cogito46.26%aa_slug=cogito-v2-1-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207gpt-5-5-non-reasoningOpenAI46.12%aa_slug=gpt-5-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208qwen3-235b-a22b-instruct-2507Alibaba Group46.05%aa_slug=qwen3-235b-a22b-instruct-2507 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209lfm2-24b-a2bLiquid AI45.85%aa_slug=lfm2-24b-a2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210grok-3-mini-reasoningSpaceXAI45.85%aa_slug=grok-3-mini-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211deepseek-v4-pro-0424-non-reasoningDeepSeek45.78%aa_slug=deepseek-v4-pro-0424-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212qwen3-6-27b-non-reasoningAlibaba Group45.71%aa_slug=qwen3-6-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213midm-250-pro-rsnsftKorea Telecom45.58%aa_slug=midm-250-pro-rsnsft · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214gpt-5-mini-minimalOpenAI45.58%aa_slug=gpt-5-mini-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215gpt-5-minimalOpenAI45.58%aa_slug=gpt-5-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216gemma-4-26b-a4b-non-reasoningGoogle45.44%aa_slug=gemma-4-26b-a4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217Claude Sonnet 4Anthropic45.37%aa_slug=claude-4-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218gemma-4-12b-non-reasoningGoogle45.17%aa_slug=gemma-4-12b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219qwen3-vl-30b-a3b-reasoningAlibaba Group45.1%aa_slug=qwen3-vl-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220gpt-5-chatgptOpenAI45.03%aa_slug=gpt-5-chatgpt · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221Claude Opus 4.6Anthropic44.63%aa_slug=claude-opus-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222ring-2-6-1tinclusionAI44.56%aa_slug=ring-2-6-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223ring-1tinclusionAI44.56%aa_slug=ring-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224qwen3-5-35b-a3b-non-reasoningAlibaba Group44.49%aa_slug=qwen3-5-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225Magistral Small 1.2Mistral AI44.35%aa_slug=magistral-small-2509 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226granite-4.1-30bIBM44.35%aa_slug=granite-4-1-30b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227kimi-k2-6-non-reasoningMoonshot AI44.29%aa_slug=kimi-k2-6-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228gemma-4-E4BGoogle44.22%aa_slug=gemma-4-e4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229Qwen3 MaxQwen44.15%aa_slug=qwen3-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230GLM 4.5Z.ai (Zhipu AI)44.08%aa_slug=glm-4.5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231Claude 3.7 SonnetAnthropic44.01%aa_slug=claude-3-7-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232LFM2.5-1.2B-InstructLiquid AI43.81%aa_slug=lfm2-5-1-2b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233kimi-k2-5-non-reasoningMoonshot AI43.67%aa_slug=kimi-k2-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234claude-opus-4-7-non-reasoningAnthropic43.61%aa_slug=claude-opus-4-7-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235gemini-2-5-flash-preview-09-2025Google43.54%aa_slug=gemini-2-5-flash-preview-09-2025 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236glm-4-6-reasoningZ.ai (Zhipu AI)43.4%aa_slug=glm-4-6-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237qwen3-omni-30b-a3b-reasoningAlibaba Group43.4%aa_slug=qwen3-omni-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238claude-4-opusAnthropic43.27%aa_slug=claude-4-opus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
239#239ring-flash-2-0inclusionAI43.27%aa_slug=ring-flash-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
240#240gpt-5-1-non-reasoningOpenAI43.2%aa_slug=gpt-5-1-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
241#241deepseek-v3-2-0925DeepSeek43.13%aa_slug=deepseek-v3-2-0925 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
242#242longcat-flash-liteLongCat43.06%aa_slug=longcat-flash-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
243#243gpt-4.1OpenAI42.99%aa_slug=gpt-4-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
244#244Claude Opus 4.5Anthropic42.99%aa_slug=claude-opus-4-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
245#245Magistral Medium 1.2Mistral AI42.99%aa_slug=magistral-medium-2509 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
246#246Llama 4 MaverickMeta AI42.99%aa_slug=llama-4-maverick · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
247#247Claude Haiku 3.5Anthropic42.79%aa_slug=claude-3-5-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
248#248mimo-v2-5-pro-non-reasoningXiaomi42.72%aa_slug=mimo-v2-5-pro-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
249#249Qwen3 VL 235B A22B InstructQwen42.65%aa_slug=qwen3-vl-235b-a22b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
250#250Claude Sonnet 4.5Anthropic42.65%aa_slug=claude-4-5-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
251#251claude-sonnet-4-6-non-reasoning-low-effortAnthropic42.38%aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
252#252jt-35b-flashChina Mobile42.04%aa_slug=jt-35b-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
253#253Claude Haiku 4.5Anthropic42.04%aa_slug=claude-4-5-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
254#254Seed-OSS-36B-InstructByteDance41.9%aa_slug=seed-oss-36b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
255#255lfm2-5-1-2b-thinkingLiquid AI41.84%aa_slug=lfm2-5-1-2b-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
256#256gemini-2-5-flash-lite-preview-09-2025Google41.84%aa_slug=gemini-2-5-flash-lite-preview-09-2025 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
257#257MiniMax-M1-80kMiniMax41.77%aa_slug=minimax-m1-80k · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
258#258Kimi K2 0905Moonshot AI41.7%aa_slug=kimi-k2-0905 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
259#259Olmo-3-7B-ThinkAllen Institute for AI41.5%aa_slug=olmo-3-7b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
260#260deepseek-v3-1-reasoningDeepSeek41.5%aa_slug=deepseek-v3-1-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
261#261qwen3-30b-a3b-instruct-reasoningAlibaba Group41.5%aa_slug=qwen3-30b-a3b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
262#262Kimi K2 0711Moonshot AI41.5%aa_slug=kimi-k2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
263#263Grok Build 0.1xAI41.36%aa_slug=grok-code-fast-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
264#264ernie-5-0-thinking-previewBaidu41.36%aa_slug=ernie-5-0-thinking-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
265#265MiniMax-M1-40kMiniMax41.22%aa_slug=minimax-m1-40k · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
266#266DeepSeek V3.1 TerminusDeepSeek41.22%aa_slug=deepseek-v3-1-terminus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
267#267Claude Sonnet 4.6Anthropic41.16%aa_slug=claude-sonnet-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
268#268nova-2-0-omniAmazon Web Services41.09%aa_slug=nova-2-0-omni · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
269#269DeepSeek V3 0324DeepSeek41.02%aa_slug=deepseek-v3-0324 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
270#270k2-v2-lowMBZUAI Institute of Foundation Models40.95%aa_slug=k2-v2-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
271#271Qwen3 14BQwen40.54%aa_slug=qwen3-14b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
272#272nova-2-0-liteAmazon Web Services40.54%aa_slug=nova-2-0-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
273#273gemma-4-e4b-non-reasoningGoogle40.54%aa_slug=gemma-4-e4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
274#274qwen3-coder-480b-a35b-instructAlibaba Group40.48%aa_slug=qwen3-coder-480b-a35b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
275#275Gemini 2.0 FlashGoogle40.2%aa_slug=gemini-2-0-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
276#276mimo-v2-flashXiaomi39.93%aa_slug=mimo-v2-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
277#277qwen3-vl-8b-reasoningAlibaba Group39.86%aa_slug=qwen3-vl-8b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
278#278Mistral Medium 3.1Mistral AI39.8%aa_slug=mistral-medium-3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
279#279Qwen3 Next 80B A3B InstructQwen39.66%aa_slug=qwen3-next-80b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
280#280k-exaone-non-reasoningLG AI Research39.59%aa_slug=k-exaone-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
281#281deepseek-r1DeepSeek39.59%aa_slug=deepseek-r1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
282#282Llama 4 ScoutMeta AI39.52%aa_slug=llama-4-scout · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
283#283llama-3-3-nemotron-super-49bNVIDIA39.46%aa_slug=llama-3-3-nemotron-super-49b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
284#284Mistral Medium 3Mistral AI39.25%aa_slug=mistral-medium-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
285#285Qwen3 VL 32B InstructQwen39.18%aa_slug=qwen3-vl-32b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
286#286olmo-3-1-32b-instructAllen Institute for AI39.18%aa_slug=olmo-3-1-32b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
287#287ernie-4-5-300b-a47bBaidu39.12%aa_slug=ernie-4-5-300b-a47b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
288#288Llama-3.1-405BMeta AI39.05%aa_slug=llama-3-1-instruct-405b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
289#289Gemini 2.5 FlashGoogle38.98%aa_slug=gemini-2-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
290#290deepseek-r1-0120DeepSeek38.98%aa_slug=deepseek-r1-0120 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
291#291gpt-5-4-mini-non-reasoningOpenAI38.84%aa_slug=gpt-5-4-mini-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
292#292QwQ-32BAlibaba Group38.78%aa_slug=qwq-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
293#293qwen3-235b-a22b-instruct-reasoningAlibaba Group38.71%aa_slug=qwen3-235b-a22b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
294#294granite-4.1-8bIBM38.64%aa_slug=granite-4-1-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
295#295gpt-4.1-miniOpenAI38.3%aa_slug=gpt-4-1-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
296#296llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA38.16%aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
297#297llama-3-3-nemotron-super-49b-reasoningNVIDIA38.1%aa_slug=llama-3-3-nemotron-super-49b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
298#298olmo-2-32bAllen Institute for AI38.1%aa_slug=olmo-2-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
299#299nova-proAmazon Web Services38.1%aa_slug=nova-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
300#300Devstral 2Mistral AI38.1%aa_slug=devstral-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.