IFBench
precise instruction following with novel constraints
Updated 1 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 898
- Models
- 334
- Current leader
- Grok 4.3 83.3%
Score history · gpt-5.4-mini 3 rows
Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.
- 64.76%aa_slug=gpt-5-4-mini-medium · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=gpt-5-4-mini-medium11 Sept 2026
- 38.84%aa_slug=gpt-5-4-mini-non-reasoning · evaluator=Artificial Analysis · reasoning=off · index_version=4.311 Sept 2026
- 73.27%aa_slug=gpt-5-4-mini · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · evaluator=Artificial Analysis
6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 83.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.2%Grok 4.20 xAI Independent11 Sept 2026
- 81.0%Grok 4.3 xAI Independent11 Sept 2026
- 73.5%gemma-4-12B Google Independent11 Sept 2026
- 45.9%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 334 models · trust independent-evaluator
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | Grok 4.3ClosedxAI · Grok · best of 8 rows | 83.3% | Independent | reasoning_effortmedium | leader | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 2 | grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 4 rows | 82.9% | Independent | reasoningon | Partially comparable-0.40 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 3 | MiniMax-M3Open weightsMiniMax · MiniMax · best of 2 rows | 82.9% | Independent | reasoningon | Partially comparable-0.47 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 81.4% | Independent | reasoningon | Partially comparable-1.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | Grok 4.20ClosedxAI · Grok · best of 3 rows | 81.2% | Independent | reasoningon | Partially comparable-2.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 6 | Qwen3.7 MaxClosedQwen · Qwen3.7 · best of 2 rows | 80.5% | Independent | reasoningon | Partially comparable-2.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 7 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron · best of 2 rows | 80.4% | Independent | reasoningon | Partially comparable-2.92 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | MiMo-V2.5-ProOpen weightsXiaomi · best of 4 rows | 79.9% | Independent | reasoningon | Partially comparable-3.47 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 6 rows | 79.6% | Independent | reasoningonreasoning_effortlow | Partially comparable-3.74 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | deepseek-v4-flash-0420Open weightsDeepSeek · DeepSeek · best of 4 rows | 79.2% | Independent | reasoning_effortmax | Partially comparable-4.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 11 | Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 4 rows | 78.8% | Independent | reasoningon | Partially comparable-4.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | Gemini 3 Flash PreviewClosedGoogle · Gemini 3 | 78.0% | Independent | group defaults | Partially comparable-5.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | Qwen 3.7 PlusClosedQwen · Qwen3.7 · best of 2 rows | 78.0% | Independent | reasoningon | Partially comparable-5.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | gemini-3-flashClosedGoogle · Gemini 3 · best of 3 rows | 78.0% | Independent | reasoningon | Partially comparable-5.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 15 | GPT-5.2-CodexClosedOpenAI · GPT 5.2 · best of 2 rows | 77.6% | Independent | reasoning_effortxhigh | Partially comparable-5.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 16 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 77.2% | Independent | reasoningon | Partially comparable-6.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 17 | Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 77.1% | Independent | reasoningon | Partially comparable-6.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Qwen3.6 Max PreviewClosedQwen · Qwen3.6 · best of 2 rows | 76.6% | Independent | reasoningon | Partially comparable-6.73 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 19 | deepseek-v4-pro-0424Open weightsDeepSeek · DeepSeek · best of 4 rows | 76.5% | Independent | reasoning_effortmax | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 20 | Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 6 rows | 76.3% | Independent | reasoningon | Partially comparable-7.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 21 | GLM 5.1Open weightsZ.ai (Zhipu AI) · GLM5.1 · best of 4 rows | 76.3% | Independent | reasoningon | Partially comparable-7.07 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | Kimi K2.6Open weightsMoonshot AI · Kimi · best of 4 rows | 76.0% | Independent | reasoningon | Partially comparable-7.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 23 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 6 rows | 75.9% | Independent | reasoning_effortxhigh | Partially comparable-7.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 23 | muse-sparkClosedMeta AI · best of 2 rows | 75.9% | Independent | reasoningon | Partially comparable-7.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 25 | gpt-5.5ClosedOpenAI · GPT 5.5 · best of 10 rows | 75.8% | Independent | reasoning_effortxhigh | Partially comparable-7.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | MiniMax M2.7Open weightsMiniMax · MiniMax · best of 2 rows | 75.7% | Independent | reasoningon | Partially comparable-7.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 4 rows | 75.7% | Independent | reasoningon | Partially comparable-7.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 28 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 4 rows | 75.6% | Independent | reasoningon | Partially comparable-7.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 28 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 4 rows | 75.6% | Independent | reasoningon | Partially comparable-7.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 30 | gpt-5-miniClosedOpenAI · GPT 5 · best of 6 rows | 75.4% | Independent | reasoning_efforthigh | Partially comparable-7.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 30 | gpt-5.2ClosedOpenAI · GPT 5.2 · best of 6 rows | 75.4% | Independent | reasoning_effortxhigh | Partially comparable-7.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | gpt-5.3-codexClosedOpenAI · GPT 5.3 · best of 2 rows | 75.4% | Independent | reasoning_effortxhigh | Partially comparable-7.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 33 | Qwen3.6 PlusClosedQwen · Qwen3.6 · best of 2 rows | 75.2% | Independent | reasoningon | Partially comparable-8.16 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 34 | GPT-5-CodexClosedOpenAI · GPT 5 · best of 2 rows | 74.2% | Independent | reasoning_efforthigh | Partially comparable-9.18 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | command-a-plusOpen weightsCohere · Command · best of 2 rows | 74.0% | Independent | reasoningon | Partially comparable-9.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | gpt-5.4ClosedOpenAI · GPT 5.4 · best of 6 rows | 74.0% | Independent | reasoning_effortxhigh | Partially comparable-9.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 37 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 4 rows | 73.5% | Independent | reasoningon | Partially comparable-9.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | deepseek-v4-flash-0420-highOpen weightsDeepSeek · DeepSeek | 73.5% | Independent | group defaults | Partially comparable-9.86 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 39 | Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.2 · best of 2 rows | 73.3% | Independent | reasoning_effortmax | Partially comparable-10.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 6 rows | 73.3% | Independent | reasoning_effortxhigh | Partially comparable-10.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 41 | GLM 5 TurboClosedZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 73.2% | Independent | reasoningon | Partially comparable-10.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 42 | gpt-5ClosedOpenAI · GPT 5 · best of 8 rows | 73.1% | Independent | reasoning_efforthigh | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 43 | gpt-5.1ClosedOpenAI · GPT 5.1 · best of 4 rows | 72.9% | Independent | reasoning_efforthigh | Partially comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 44 | gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 10 rows | 72.7% | Independent | reasoning_effortmax | Partially comparable-10.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 4 rows | 72.5% | Independent | reasoningon | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 46 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 72.5% | Independent | reasoningon | Partially comparable-10.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 47 | GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 4 rows | 72.3% | Independent | reasoningon | Partially comparable-11.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 47 | MiniMax M2Open weightsMiniMax · MiniMax · best of 2 rows | 72.3% | Independent | reasoningon | Partially comparable-11.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 49 | mimo-v2-0206Open weightsXiaomi · best of 2 rows | 71.8% | Independent | reasoningon | Partially comparable-11.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | MiniMax M2.5Open weightsMiniMax · MiniMax · best of 2 rows | 71.6% | Independent | reasoningon | Partially comparable-11.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 51 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 71.5% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 51 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 · best of 2 rows | 71.5% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | o3ClosedOpenAI · OpenAI o-series · best of 2 rows | 71.4% | Independent | reasoningon | Partially comparable-11.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 54 | deepseek-v4-pro-0424-highOpen weightsDeepSeek · DeepSeek | 71.3% | Independent | group defaults | Partially comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 10 rows | 71.2% | Independent | reasoning_effortmax | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 56 | Solar Pro 3ClosedUpstage · Solar · best of 2 rows | 71.2% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 57 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 4 rows | 71.1% | Independent | reasoningon | Partially comparable-12.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 58 | Qwen3 MaxClosedQwen · Qwen3 · best of 4 rows | 70.8% | Independent | reasoningon | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 58 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 8 rows | 70.8% | Independent | reasoningonreasoning_efforthigh | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | gemini-3-proClosedGoogle · Gemini 3 · best of 4 rows | 70.4% | Independent | reasoning_efforthigh | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 61 | o1ClosedOpenAI · OpenAI o-series · best of 2 rows | 70.3% | Independent | reasoningon | Partially comparable-13.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 62 | Kimi K2.5Open weightsMoonshot AI · Kimi · best of 4 rows | 70.2% | Independent | reasoningon | Partially comparable-13.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 63 | GPT-5.1-CodexClosedOpenAI · GPT 5.1 · best of 2 rows | 70% | Independent | reasoning_efforthigh | Partially comparable-13.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | MiniMax M2.1Open weightsMiniMax · MiniMax · best of 2 rows | 69.9% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 65 | Mercury 2ClosedInception · best of 2 rows | 69.8% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | apriel-v1-6-15b-thinkerOpen weightsServiceNow · best of 2 rows | 69.1% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 67 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 4 rows | 69.0% | Independent | reasoning_efforthigh | Partially comparable-14.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | mimo-v2-proClosedXiaomi · best of 2 rows | 68.8% | Independent | reasoningon | Partially comparable-14.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 69 | Mistral Medium 3.5Open weightsMistral AI · Mistral · best of 2 rows | 68.8% | Independent | reasoningon | Partially comparable-14.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 70 | o4-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 68.7% | Independent | reasoning_efforthigh | Partially comparable-14.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | kat-coder-pro-v1ClosedKwaiKAT · best of 2 rows | 68.4% | Independent | reasoningoff | Partially comparable-15.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 72 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi · best of 2 rows | 68.1% | Independent | reasoningon | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows | 67.9% | Independent | reasoningon | Partially comparable-15.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 · best of 2 rows | 67.9% | Independent | reasoning_efforthigh | Partially comparable-15.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 4 rows | 67.5% | Independent | reasoningon | Partially comparable-15.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 6 rows | 67.5% | Independent | reasoning_efforthigh | Partially comparable-15.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 77 | mimo-v2-omni-0327ClosedXiaomi · best of 2 rows | 67.3% | Independent | reasoningon | Partially comparable-16.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | Step 3.7 FlashOpen weightsStepFun · Step3.7 · best of 2 rows | 67.3% | Independent | reasoningon | Partially comparable-16.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | MiMo-V2.5Open weightsXiaomi · best of 2 rows | 67.1% | Independent | reasoningon | Partially comparable-16.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 67.1% | Independent | reasoning_efforthigh | Partially comparable-16.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 81 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 4 rows | 66.7% | Independent | reasoningon | Partially comparable-16.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 82 | KAT-Coder-Pro V2ClosedKwaipilot · best of 2 rows | 66.7% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 4 rows | 66.5% | Independent | reasoningon | Partially comparable-16.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 84 | hypernova-60bOpen weightsMultiverse Computing · best of 2 rows | 66.5% | Independent | reasoning_efforthigh | Partially comparable-16.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | nex-n2-proOpen weightsNex AGI · best of 2 rows | 66.2% | Independent | reasoningon | Partially comparable-17.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 6 rows | 66.2% | Independent | reasoningonreasoning_effortmedium | Partially comparable-17.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 87 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 3 rows | 66.0% | Independent | reasoningon | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 4 rows | 65.1% | Independent | reasoning_efforthigh | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 89 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 4 rows | 64.7% | Independent | reasoningon | Partially comparable-18.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 90 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 4 rows | 64.3% | Independent | reasoningon | Partially comparable-19.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 91 | mimo-v2-flashOpen weightsXiaomi · best of 4 rows | 64.2% | Independent | reasoningon | Partially comparable-19.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 92 | deepseek-v3-2-specialeOpen weightsDeepSeek · DeepSeek · best of 2 rows | 63.9% | Independent | reasoningon | Partially comparable-19.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | Claude Fable 5ClosedAnthropic · Claude · best of 2 rows | 63.5% | Independent | reasoningon | Partially comparable-19.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 94 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 63.2% | Independent | reasoningon | Partially comparable-20.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | Hy3Open weightsTencent · best of 3 rows | 63.1% | Independent | reasoningon | Partially comparable-20.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | Hy3 previewOpen weightsTencent | 63.1% | Independent | group defaults | Partially comparable-20.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi · best of 2 rows | 63.1% | Independent | reasoningon | Partially comparable-20.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 98 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models · best of 2 rows | 62.8% | Independent | reasoningon | Partially comparable-20.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 99 | Claude Opus 4.8ClosedAnthropic · Claude · best of 2 rows | 62.2% | Independent | reasoning_effortmax | Partially comparable-21.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | apriel-v1-5-15b-thinkerOpen weightsServiceNow · best of 2 rows | 61.7% | Independent | reasoningon | Partially comparable-21.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →