Skip to content
AI Atlas
BenchmarkActivecategory · instruction-followingfamily · ifeval · variant IFBench

IFBench

precise instruction following with novel constraints

data quality51

Updated 1 h ago · first seen 11 Sept 2026

Metric
accuracy · %
Current results
898
Models
334
Current leader
Grok 4.3 83.3%

Score history · o3-mini 2 rows

Score history for o3-mini0%20%40%60%80%Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26
  • o3-mini
  • 67.14%aa_slug=o3-mini-high · evaluator=Artificial Analysis · index_version=4.3 · reasoning_effort=high12 Sept 2026
  • 67.14%aa_slug=o3-mini-high · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=o3-mini-high11 Sept 2026

Back to the leaderboard

Frontier over time · accuracy · evaluator=Artificial Analysis

6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 83.3%Grok 4.3 xAI Independent11 Sept 2026
  2. 81.3%Grok 4.3 xAI Independent11 Sept 2026
  3. 81.2%Grok 4.20 xAI Independent11 Sept 2026
  4. 81.0%Grok 4.3 xAI Independent11 Sept 2026
  5. 73.5%gemma-4-12B Google Independent11 Sept 2026
  6. 45.9%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 333 models

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Grok 4.3ClosedxAI · Grok · best of 4 rows83.3%Independentreasoning_effortmediumleaderobs. 11 Sept 2026artificialanalysis.aiT2History
2grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 2 rows82.9%Independentgroup defaultsPartially comparable-0.40 ptobs. 11 Sept 2026artificialanalysis.aiT2History
3MiniMax-M3Open weightsMiniMax · MiniMax82.9%Independentgroup defaultsPartially comparable-0.47 ptobs. 11 Sept 2026artificialanalysis.aiT2History
4Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 381.4%Independentgroup defaultsPartially comparable-1.97 ptobs. 11 Sept 2026artificialanalysis.aiT2History
5Grok 4.20ClosedxAI · Grok81.2%Independentgroup defaultsPartially comparable-2.11 ptobs. 11 Sept 2026artificialanalysis.aiT2History
6Qwen3.7 MaxClosedQwen · Qwen3.780.5%Independentgroup defaultsPartially comparable-2.79 ptobs. 11 Sept 2026artificialanalysis.aiT2History
7nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron80.4%Independentgroup defaultsPartially comparable-2.92 ptobs. 11 Sept 2026artificialanalysis.aiT2History
8MiMo-V2.5-ProOpen weightsXiaomi · best of 2 rows79.9%Independentgroup defaultsPartially comparable-3.47 ptobs. 11 Sept 2026artificialanalysis.aiT2History
9nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 3 rows79.6%Independentreasoningonreasoning_effortlowPartially comparable-3.74 ptobs. 11 Sept 2026artificialanalysis.aiT2History
10deepseek-v4-flash-0420Open weightsDeepSeek · DeepSeek79.2%Independentgroup defaultsPartially comparable-4.15 ptobs. 11 Sept 2026artificialanalysis.aiT2History
11Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 2 rows78.8%Independentgroup defaultsPartially comparable-4.55 ptobs. 11 Sept 2026artificialanalysis.aiT2History
12Gemini 3 Flash PreviewClosedGoogle · Gemini 378.0%Independentgroup defaultsPartially comparable-5.37 ptobs. 11 Sept 2026artificialanalysis.aiT2History
12Qwen 3.7 PlusClosedQwen · Qwen3.778.0%Independentgroup defaultsPartially comparable-5.37 ptobs. 11 Sept 2026artificialanalysis.aiT2History
14GPT-5.2-CodexClosedOpenAI · GPT 5.277.6%Independentgroup defaultsPartially comparable-5.71 ptobs. 11 Sept 2026artificialanalysis.aiT2History
15Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.177.2%Independentgroup defaultsPartially comparable-6.12 ptobs. 11 Sept 2026artificialanalysis.aiT2History
16Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.177.1%Independentgroup defaultsPartially comparable-6.19 ptobs. 11 Sept 2026artificialanalysis.aiT2History
17Qwen3.6 Max PreviewClosedQwen · Qwen3.676.6%Independentgroup defaultsPartially comparable-6.73 ptobs. 11 Sept 2026artificialanalysis.aiT2History
18deepseek-v4-pro-0424Open weightsDeepSeek · DeepSeek76.5%Independentgroup defaultsPartially comparable-6.87 ptobs. 11 Sept 2026artificialanalysis.aiT2History
19Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 3 rows76.3%Independentgroup defaultsPartially comparable-7.00 ptobs. 11 Sept 2026artificialanalysis.aiT2History
20GLM 5.1Open weightsZ.ai (Zhipu AI) · GLM5.1 · best of 2 rows76.3%Independentgroup defaultsPartially comparable-7.07 ptobs. 11 Sept 2026artificialanalysis.aiT2History
21Kimi K2.6Open weightsMoonshot AI · Kimi · best of 2 rows76.0%Independentgroup defaultsPartially comparable-7.34 ptobs. 11 Sept 2026artificialanalysis.aiT2History
22gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows75.9%Independentgroup defaultsPartially comparable-7.41 ptobs. 11 Sept 2026artificialanalysis.aiT2History
22muse-sparkClosedMeta AI75.9%Independentgroup defaultsPartially comparable-7.41 ptobs. 11 Sept 2026artificialanalysis.aiT2History
24gpt-5.5ClosedOpenAI · GPT 5.5 · best of 5 rows75.8%Independentgroup defaultsPartially comparable-7.48 ptobs. 11 Sept 2026artificialanalysis.aiT2History
25MiniMax M2.7Open weightsMiniMax · MiniMax75.7%Independentgroup defaultsPartially comparable-7.62 ptobs. 11 Sept 2026artificialanalysis.aiT2History
25Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 2 rows75.7%Independentgroup defaultsPartially comparable-7.62 ptobs. 11 Sept 2026artificialanalysis.aiT2History
27Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 2 rows75.6%Independentgroup defaultsPartially comparable-7.75 ptobs. 11 Sept 2026artificialanalysis.aiT2History
27Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 2 rows75.6%Independentgroup defaultsPartially comparable-7.75 ptobs. 11 Sept 2026artificialanalysis.aiT2History
29gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows75.4%Independentgroup defaultsPartially comparable-7.89 ptobs. 11 Sept 2026artificialanalysis.aiT2History
29gpt-5.2ClosedOpenAI · GPT 5.2 · best of 3 rows75.4%Independentgroup defaultsPartially comparable-7.89 ptobs. 11 Sept 2026artificialanalysis.aiT2History
31gpt-5.3-codexClosedOpenAI · GPT 5.375.4%Independentgroup defaultsPartially comparable-7.96 ptobs. 11 Sept 2026artificialanalysis.aiT2History
32Qwen3.6 PlusClosedQwen · Qwen3.675.2%Independentgroup defaultsPartially comparable-8.16 ptobs. 11 Sept 2026artificialanalysis.aiT2History
33GPT-5-CodexClosedOpenAI · GPT 574.2%Independentgroup defaultsPartially comparable-9.18 ptobs. 11 Sept 2026artificialanalysis.aiT2History
34command-a-plusOpen weightsCohere · Command74.0%Independentgroup defaultsPartially comparable-9.38 ptobs. 11 Sept 2026artificialanalysis.aiT2History
34gpt-5.4ClosedOpenAI · GPT 5.4 · best of 3 rows74.0%Independentgroup defaultsPartially comparable-9.38 ptobs. 11 Sept 2026artificialanalysis.aiT2History
36gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows73.5%Independentgroup defaultsPartially comparable-9.79 ptobs. 11 Sept 2026artificialanalysis.aiT2History
37deepseek-v4-flash-0420-highOpen weightsDeepSeek · DeepSeek73.5%Independentgroup defaultsPartially comparable-9.86 ptobs. 11 Sept 2026artificialanalysis.aiT2History
38Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.273.3%Independentgroup defaultsPartially comparable-10.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
39gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 3 rows73.3%Independentgroup defaultsPartially comparable-10.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
40GLM 5 TurboClosedZ.ai (Zhipu AI) · GLM573.2%Independentgroup defaultsPartially comparable-10.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
41gpt-5ClosedOpenAI · GPT 5 · best of 4 rows73.1%Independentgroup defaultsPartially comparable-10.3 ptobs. 11 Sept 2026artificialanalysis.aiT2History
42gpt-5.1ClosedOpenAI · GPT 5.1 · best of 2 rows72.9%Independentgroup defaultsPartially comparable-10.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
43gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 5 rows72.7%Independentgroup defaultsPartially comparable-10.7 ptobs. 11 Sept 2026artificialanalysis.aiT2History
44Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 2 rows72.5%Independentgroup defaultsPartially comparable-10.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
45Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows72.5%Independentgroup defaultsPartially comparable-10.9 ptobs. 11 Sept 2026artificialanalysis.aiT2History
46GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 2 rows72.3%Independentgroup defaultsPartially comparable-11.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
46MiniMax M2Open weightsMiniMax · MiniMax72.3%Independentgroup defaultsPartially comparable-11.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
48mimo-v2-0206Open weightsXiaomi71.8%Independentgroup defaultsPartially comparable-11.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
49MiniMax M2.5Open weightsMiniMax · MiniMax71.6%Independentgroup defaultsPartially comparable-11.7 ptobs. 11 Sept 2026artificialanalysis.aiT2History
50Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 371.5%Independentgroup defaultsPartially comparable-11.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
50gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.571.5%Independentgroup defaultsPartially comparable-11.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
52o3ClosedOpenAI · OpenAI o-series71.4%Independentgroup defaultsPartially comparable-11.9 ptobs. 11 Sept 2026artificialanalysis.aiT2History
53deepseek-v4-pro-0424-highOpen weightsDeepSeek · DeepSeek71.3%Independentgroup defaultsPartially comparable-12.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
54gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 5 rows71.2%Independentgroup defaultsPartially comparable-12.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
55Solar Pro 3ClosedUpstage · Solar71.2%Independentgroup defaultsPartially comparable-12.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
56Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows71.1%IndependentreasoningonPartially comparable-12.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
57Qwen3 MaxClosedQwen · Qwen3 · best of 2 rows70.8%IndependentreasoningonPartially comparable-12.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
57nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows70.8%IndependentreasoningonPartially comparable-12.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
59gemini-3-proClosedGoogle · Gemini 3 · best of 2 rows70.4%Independentgroup defaultsPartially comparable-12.9 ptobs. 11 Sept 2026artificialanalysis.aiT2History
60o1ClosedOpenAI · OpenAI o-series70.3%Independentgroup defaultsPartially comparable-13.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
61Kimi K2.5Open weightsMoonshot AI · Kimi · best of 2 rows70.2%Independentgroup defaultsPartially comparable-13.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
62GPT-5.1-CodexClosedOpenAI · GPT 5.170%Independentgroup defaultsPartially comparable-13.3 ptobs. 11 Sept 2026artificialanalysis.aiT2History
63MiniMax M2.1Open weightsMiniMax · MiniMax69.9%Independentgroup defaultsPartially comparable-13.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
64Mercury 2ClosedInception69.8%Independentgroup defaultsPartially comparable-13.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
65apriel-v1-6-15b-thinkerOpen weightsServiceNow69.1%Independentgroup defaultsPartially comparable-14.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
66gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows69.0%Independentgroup defaultsPartially comparable-14.3 ptobs. 11 Sept 2026artificialanalysis.aiT2History
67mimo-v2-proClosedXiaomi68.8%Independentgroup defaultsPartially comparable-14.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
68Mistral Medium 3.5Open weightsMistral AI · Mistral68.8%Independentgroup defaultsPartially comparable-14.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
69o4-miniClosedOpenAI · OpenAI o-series68.7%Independentgroup defaultsPartially comparable-14.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
70kat-coder-pro-v1ClosedKwaiKAT68.4%Independentgroup defaultsPartially comparable-15.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
71Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi68.1%Independentgroup defaultsPartially comparable-15.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
72GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows67.9%Independentgroup defaultsPartially comparable-15.4 ptobs. 11 Sept 2026artificialanalysis.aiT2History
72GPT-5.1-Codex MiniClosedOpenAI · GPT 5.167.9%Independentgroup defaultsPartially comparable-15.4 ptobs. 11 Sept 2026artificialanalysis.aiT2History
74Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 2 rows67.5%Independentgroup defaultsPartially comparable-15.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
74gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows67.5%Independentgroup defaultsPartially comparable-15.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
76mimo-v2-omni-0327ClosedXiaomi67.3%Independentgroup defaultsPartially comparable-16.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
77Step 3.7 FlashOpen weightsStepFun · Step3.767.3%Independentgroup defaultsPartially comparable-16.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
78MiMo-V2.5Open weightsXiaomi67.1%Independentgroup defaultsPartially comparable-16.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
78o3-miniClosedOpenAI · OpenAI o-series67.1%Independentreasoning_efforthighPartially comparable-16.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
80Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 2 rows66.7%Independentgroup defaultsPartially comparable-16.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
81KAT-Coder-Pro V2ClosedKwaipilot66.7%Independentgroup defaultsPartially comparable-16.7 ptobs. 11 Sept 2026artificialanalysis.aiT2History
82Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 2 rows66.5%Independentgroup defaultsPartially comparable-16.8 ptobs. 11 Sept 2026artificialanalysis.aiT2History
83hypernova-60bOpen weightsMultiverse Computing66.5%Independentgroup defaultsPartially comparable-16.9 ptobs. 11 Sept 2026artificialanalysis.aiT2History
84nex-n2-proOpen weightsNex AGI66.2%Independentgroup defaultsPartially comparable-17.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
84nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 3 rows66.2%Independentreasoningonreasoning_effortmediumPartially comparable-17.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
86olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 2 rows66.0%IndependentreasoningonPartially comparable-17.3 ptobs. 11 Sept 2026artificialanalysis.aiT2History
87gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows65.1%Independentgroup defaultsPartially comparable-18.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
88k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows64.7%Independentgroup defaultsPartially comparable-18.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
89Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 2 rows64.3%Independentgroup defaultsPartially comparable-19.0 ptobs. 11 Sept 2026artificialanalysis.aiT2History
90mimo-v2-flashOpen weightsXiaomi · best of 2 rows64.2%IndependentreasoningonPartially comparable-19.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
91deepseek-v3-2-specialeOpen weightsDeepSeek · DeepSeek63.9%Independentgroup defaultsPartially comparable-19.4 ptobs. 11 Sept 2026artificialanalysis.aiT2History
92Claude Fable 5ClosedAnthropic · Claude63.5%Independentgroup defaultsPartially comparable-19.9 ptobs. 11 Sept 2026artificialanalysis.aiT2History
93nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 363.2%Independentgroup defaultsPartially comparable-20.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
94Hy3 previewOpen weightsTencent63.1%Independentgroup defaultsPartially comparable-20.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
94Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi63.1%Independentgroup defaultsPartially comparable-20.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
96k2-think-v2Open weightsMBZUAI Institute of Foundation Models62.8%Independentgroup defaultsPartially comparable-20.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History
97Claude Opus 4.8ClosedAnthropic · Claude62.2%Independentgroup defaultsPartially comparable-21.1 ptobs. 11 Sept 2026artificialanalysis.aiT2History
98apriel-v1-5-15b-thinkerOpen weightsServiceNow61.7%Independentgroup defaultsPartially comparable-21.6 ptobs. 11 Sept 2026artificialanalysis.aiT2History
99GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM561.1%Independentgroup defaultsPartially comparable-22.2 ptobs. 11 Sept 2026artificialanalysis.aiT2History
100GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows60.8%Independentgroup defaultsPartially comparable-22.5 ptobs. 11 Sept 2026artificialanalysis.aiT2History

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →