Skip to content
AI Atlas
BenchmarkActivecategory · instruction-following

IFBench

precise instruction following with novel constraints

quality51

Updated 6 h ago · first seen 11 Sept 2026

bench_01M293SPGX8Q1PSHHMPKC9R37H

Metric
accuracy · %
Direction
Higher is better
Results
450
Leader
grok-4-3-medium 83.33%

Score history · gpt-5-6-sol 1 row

Not enough history to chart — a single observation (72.65% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 72.65%aa_slug=gpt-5-6-sol · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 450 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
1#1grok-4-3-mediumSpaceXAI83.33%aa_slug=grok-4-3-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
2#2grok-4-20-0309SpaceXAI82.93%aa_slug=grok-4-20-0309 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
3#3MiniMax M3MiniMax82.86%aa_slug=minimax-m3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
4#4Nemotron 3 UltraNVIDIA81.36%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
5#5Grok 4.3xAI81.29%aa_slug=grok-4-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
6#6Grok 4.20xAI81.22%aa_slug=grok-4-20 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
7#7grok-4-3-lowSpaceXAI80.95%aa_slug=grok-4-3-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
8#8Qwen3.7 MaxQwen80.54%aa_slug=qwen3-7-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
9#9nemotron-cascade-2-30b-a3bNVIDIA80.41%aa_slug=nemotron-cascade-2-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
10#10MiMo-V2.5-ProXiaomi79.86%aa_slug=mimo-v2-5-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
11#11nova-2-0-pro-reasoning-lowAmazon Web Services79.59%aa_slug=nova-2-0-pro-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
12#12deepseek-v4-flash-0420DeepSeek79.18%aa_slug=deepseek-v4-flash-0420 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
13#13nova-2-0-pro-reasoning-mediumAmazon Web Services79.05%aa_slug=nova-2-0-pro-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
14#14Qwen3.5 397B A17BQwen78.78%aa_slug=qwen3-5-397b-a17b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
15#15Gemini 3 Flash PreviewGoogle77.96%aa_slug=gemini-3-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
16#16Qwen 3.7 PlusQwen77.96%aa_slug=qwen3-7-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
17#17GPT-5.2-CodexOpenAI77.62%aa_slug=gpt-5-2-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
18#18gemini-3-1-flash-lite-previewGoogle77.21%aa_slug=gemini-3-1-flash-lite-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
19#19Gemini 3.1 Pro PreviewGoogle77.14%aa_slug=gemini-3-1-pro-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
20#20Qwen3.6 Max PreviewQwen76.6%aa_slug=qwen3-6-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
21#21deepseek-v4-pro-0424DeepSeek76.46%aa_slug=deepseek-v4-pro-0424 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
22#22Gemini 3.5 FlashGoogle76.33%aa_slug=gemini-3-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
23#23GLM 5.1Z.ai (Zhipu AI)76.26%aa_slug=glm-5-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
24#24Kimi K2.6Moonshot AI75.99%aa_slug=kimi-k2-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
25#25gpt-5.4-nanoOpenAI75.92%aa_slug=gpt-5-4-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
26#26muse-sparkMeta AI75.92%aa_slug=muse-spark · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
27#27gpt-5.5OpenAI75.85%aa_slug=gpt-5-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
28#28MiniMax M2.7MiniMax75.71%aa_slug=minimax-m2-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
29#29Qwen3.5-122B-A10BQwen75.71%aa_slug=qwen3-5-122b-a10b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
30#30Qwen3.5-27BQwen75.58%aa_slug=qwen3-5-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
31#31Gemma 4 31BGoogle75.58%aa_slug=gemma-4-31b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
32#32gpt-5-miniOpenAI75.44%aa_slug=gpt-5-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
33#33gpt-5.2OpenAI75.44%aa_slug=gpt-5-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
34#34gpt-5.3-codexOpenAI75.37%aa_slug=gpt-5-3-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
35#35Qwen3.6 PlusQwen75.17%aa_slug=qwen3-6-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
36#36gemini-3-5-flash-mediumGoogle74.56%aa_slug=gemini-3-5-flash-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
37#37GPT-5-CodexOpenAI74.15%aa_slug=gpt-5-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
38#38command-a-plusCohere73.95%aa_slug=command-a-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
39#39gpt-5.4OpenAI73.95%aa_slug=gpt-5-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
40#40gemma-4-12BGoogle73.54%aa_slug=gemma-4-12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
41#41deepseek-v4-flash-0420-highDeepSeek73.47%aa_slug=deepseek-v4-flash-0420-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
42#42Z.ai GLM 5.2Z.ai (Zhipu AI)73.33%aa_slug=glm-5-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
43#43gpt-5.4-miniOpenAI73.27%aa_slug=gpt-5-4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
44#44GLM 5 TurboZ.ai (Zhipu AI)73.2%aa_slug=glm-5-turbo · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
45#45gpt-5OpenAI73.06%aa_slug=gpt-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
46#46gpt-5.1OpenAI72.86%aa_slug=gpt-5-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
47#47gpt-5-6-solOpenAI72.65%aa_slug=gpt-5-6-sol · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
48#48Qwen3.5-35B-A3BQwen72.52%aa_slug=qwen3-5-35b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
49#49Gemma 4 26B A4BGoogle72.45%aa_slug=gemma-4-26b-a4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
50#50GLM 5Z.ai (Zhipu AI)72.31%aa_slug=glm-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
51#51MiniMax M2MiniMax72.31%aa_slug=minimax-m2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
52#52mimo-v2-0206Xiaomi71.84%aa_slug=mimo-v2-0206 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
53#53MiniMax M2.5MiniMax71.63%aa_slug=minimax-m2-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
54#54gpt-5-5-highOpenAI71.63%aa_slug=gpt-5-5-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
55#55Nemotron 3 SuperNVIDIA71.5%aa_slug=nvidia-nemotron-3-super-120b-a12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
56#56gpt-5-5-instant-05-26OpenAI71.5%aa_slug=gpt-5-5-instant-05-26 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
57#57o3OpenAI71.43%aa_slug=o3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
58#58deepseek-v4-pro-0424-highDeepSeek71.29%aa_slug=deepseek-v4-pro-0424-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
59#59gpt-5.6-terraOpenAI71.22%aa_slug=gpt-5-6-terra · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
60#60Solar Pro 3Upstage71.2%aa_slug=solar-pro-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
61#61gpt-5-mini-mediumOpenAI71.16%aa_slug=gpt-5-mini-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
62#62nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA71.09%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
63#63gpt-5-6-sol-xhighOpenAI71.02%aa_slug=gpt-5-6-sol-xhigh · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
64#64gpt-5-5-mediumOpenAI70.95%aa_slug=gpt-5-5-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
65#65Qwen3 Max ThinkingQwen70.75%aa_slug=qwen3-max-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
66#66nova-2-0-lite-reasoningAmazon Web Services70.75%aa_slug=nova-2-0-lite-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
67#67gpt-5 (medium)OpenAI70.61%aa_slug=gpt-5-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
68#68gemini-3-proGoogle70.41%aa_slug=gemini-3-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
69#69o1OpenAI70.34%aa_slug=o1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
70#70Kimi K2.5Moonshot AI70.2%aa_slug=kimi-k2-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
71#71GPT-5.1-CodexOpenAI70%aa_slug=gpt-5-1-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
72#72MiniMax M2.1MiniMax69.86%aa_slug=minimax-m2-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
73#73Mercury 2Inception69.8%aa_slug=mercury-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
74#74gpt-5-6-sol-mediumOpenAI69.59%aa_slug=gpt-5-6-sol-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
75#75gpt-5-6-sol-highOpenAI69.18%aa_slug=gpt-5-6-sol-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
76#76apriel-v1-6-15b-thinkerServiceNow69.12%aa_slug=apriel-v1-6-15b-thinker · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
77#77gpt-oss-120bOpenAI68.98%aa_slug=gpt-oss-120b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
78#78mimo-v2-proXiaomi68.84%aa_slug=mimo-v2-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
79#79Mistral Medium 3.5Mistral AI68.78%aa_slug=mistral-medium-3-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
80#80o4-miniOpenAI68.71%aa_slug=o4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
81#81nova-2-0-lite-reasoning-mediumAmazon Web Services68.5%aa_slug=nova-2-0-lite-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
82#82kat-coder-pro-v1KwaiKAT68.37%aa_slug=kat-coder-pro-v1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
83#83Kimi K2 ThinkingMoonshot AI68.1%aa_slug=kimi-k2-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
84#84GLM 4.7Z.ai (Zhipu AI)67.89%aa_slug=glm-4-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
85#85GPT-5.1-Codex MiniOpenAI67.89%aa_slug=gpt-5-1-codex-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
86#86gpt-5-nanoOpenAI67.55%aa_slug=gpt-5-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
87#87Qwen3.6 27BQwen67.55%aa_slug=qwen3-6-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
88#88mimo-v2-omni-0327Xiaomi67.35%aa_slug=mimo-v2-omni-0327 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
89#89Step 3.7 FlashStepFun67.28%aa_slug=step-3-7-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
90#90MiMo-V2.5Xiaomi67.14%aa_slug=mimo-v2-5-0424 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
91#91o3 Mini HighOpenAI67.14%aa_slug=o3-mini-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
92#92Qwen3.5-9BQwen66.73%aa_slug=qwen3-5-9b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
93#93KAT-Coder-Pro V2Kwaipilot66.67%aa_slug=kat-coder-pro-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
94#94gpt-5 (low)OpenAI66.6%aa_slug=gpt-5-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
95#95step-3-5-flashStepFun66.53%aa_slug=step-3-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
96#96gpt-5-6-sol-lowOpenAI66.53%aa_slug=gpt-5-6-sol-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
97#97hypernova-60bMultiverse Computing66.46%aa_slug=hypernova-60b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
98#98gpt-5-6-terra-xhighOpenAI66.26%aa_slug=gpt-5-6-terra-xhigh · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
99#99nex-n2-proNex AGI66.19%aa_slug=nex-n2-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
100#100nova-2-0-omni-reasoning-mediumAmazon Web Services66.19%aa_slug=nova-2-0-omni-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.