IFBench
precise instruction following with novel constraints
Updated 3 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 898
- Models
- 334
- Current leader
- Grok 4.3 83.3%
Score history · Qwen3 Next 80B A3B Instruct 4 rows
- Qwen3 Next 80B A3B Instruct
- 39.66%aa_slug=qwen3-next-80b-a3b-instruct · evaluator=Artificial Analysis · reasoning=off · index_version=4.312 Sept 2026
- 60.68%aa_slug=qwen3-next-80b-a3b-reasoning · evaluator=Artificial Analysis · reasoning=on · index_version=4.312 Sept 2026
- 39.66%aa_slug=qwen3-next-80b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 60.68%aa_slug=qwen3-next-80b-a3b-reasoning · evaluator=Artificial Analysis · reasoning=on · index_version=4.311 Sept 2026
Frontier over time · accuracy · evaluator=Artificial Analysis
6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 83.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.2%Grok 4.20 xAI Independent11 Sept 2026
- 81.0%Grok 4.3 xAI Independent11 Sept 2026
- 73.5%gemma-4-12B Google Independent11 Sept 2026
- 45.9%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 334 models · trust independent-evaluator
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 101 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 61.1% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 102 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows | 60.8% | Independent | reasoningon | Partially comparable-0.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 5 rows | 60.7% | Independent | reasoningon | Partially comparable-0.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | DeepSeek V3.2Open weightsDeepSeek · DeepSeek-V3 | 60.7% | Independent | group defaults | Partially comparable-0.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 60.7% | Independent | reasoningon | Partially comparable-0.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 6 rows | 60.1% | Independent | reasoning_efforthigh | Partially comparable-0.95 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | diffusiongemma-26b-a4bOpen weightsGoogle · best of 2 rows | 59.5% | Independent | reasoningon | Partially comparable-1.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 59.4% | Independent | reasoningon | Partially comparable-1.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | Claude Opus 4.7ClosedAnthropic · Claude · best of 4 rows | 58.6% | Independent | reasoning_effortmax | Partially comparable-2.45 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 58.2% | Independent | reasoningon | Partially comparable-2.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | Claude Opus 4.5ClosedAnthropic · Claude · best of 4 rows | 58.0% | Independent | reasoningon | Partially comparable-3.13 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 · best of 2 rows | 58.0% | Independent | reasoningon | Partially comparable-3.13 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | solar-open-100b-reasoningOpen weightsUpstage · Solar · best of 2 rows | 57.7% | Independent | reasoningon | Partially comparable-3.40 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | North Mini Code (free)Open weightsCohere · best of 2 rows | 57.5% | Independent | reasoningon | Partially comparable-3.54 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | ling-2-6-flashOpen weightsinclusionAI · best of 2 rows | 57.4% | Independent | reasoningoff | Partially comparable-3.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 4 rows | 57.3% | Independent | reasoningon | Partially comparable-3.81 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 4 rows | 57.0% | Independent | reasoningon | Partially comparable-4.08 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | motif-2-12-7bClosedMotif Technologies · best of 2 rows | 57.0% | Independent | reasoningon | Partially comparable-4.08 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | ling-2-6-1tOpen weightsinclusionAI · best of 2 rows | 56.9% | Independent | reasoningoff | Partially comparable-4.22 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 5 rows | 56.6% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-4.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 56.5% | Independent | reasoningon | Partially comparable-4.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | Trinity Large ThinkingOpen weightsArcee AI · best of 2 rows | 56.3% | Independent | reasoningon | Partially comparable-4.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | LFM2.5-8B-A1BOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 55.6% | Independent | reasoningon | Partially comparable-5.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | Claude Opus 4.1ClosedAnthropic · Claude · best of 2 rows | 55.4% | Independent | reasoningon | Partially comparable-5.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 125 | Claude Sonnet 4ClosedAnthropic · Claude · best of 4 rows | 54.7% | Independent | reasoningon | Partially comparable-6.40 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | tri-21b-think-v0-5Open weightsTrillion Labs · best of 2 rows | 54.6% | Independent | reasoningon | Partially comparable-6.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | falcon-h1r-7bOpen weightsTII UAE · Falcon · best of 2 rows | 54.4% | Independent | reasoningon | Partially comparable-6.67 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 4 rows | 54.3% | Independent | reasoningon | Partially comparable-6.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 129 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 · best of 3 rows | 54.1% | Independent | reasoningon | Partially comparable-6.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 53.8% | Independent | reasoningon | Partially comparable-7.28 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | Claude Opus 4ClosedAnthropic · Claude | 53.7% | Independent | group defaults | Partially comparable-7.35 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | claude-4-opusClosedAnthropic · Claude 4 · best of 3 rows | 53.7% | Independent | reasoningon | Partially comparable-7.35 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 133 | grok-4ClosedSpaceXAI · Grok 4 · best of 2 rows | 53.7% | Independent | reasoningon | Partially comparable-7.42 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | mimo-v2-omniClosedXiaomi · best of 2 rows | 53.5% | Independent | reasoningon | Partially comparable-7.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Claude Opus 4.6ClosedAnthropic · Claude · best of 4 rows | 53.1% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-7.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 4 rows | 52.7% | Independent | reasoningon | Partially comparable-8.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 5 rows | 52.6% | Independent | reasoningon | Partially comparable-8.50 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 3 rows | 52.6% | Independent | reasoningon | Partially comparable-8.50 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | jamba-reasoning-3bOpen weightsAI21 Labs · Jamba · best of 2 rows | 52.5% | Independent | reasoningon | Partially comparable-8.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 140 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 6 rows | 52.3% | Independent | reasoningon | Partially comparable-8.78 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 4 rows | 52.0% | Independent | reasoningon | Partially comparable-9.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | doubao-seed-codeClosedByteDance · Seed · best of 2 rows | 51.4% | Independent | reasoningon | Partially comparable-9.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 4 rows | 51.2% | Independent | reasoningon | Partially comparable-9.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 · best of 2 rows | 51.2% | Independent | reasoningoff | Partially comparable-9.93 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 145 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 4 rows | 50.7% | Independent | reasoningon | Partially comparable-10.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 4 rows | 50.5% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 50.3% | Independent | reasoningon | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | step-3-vl-10bOpen weightsStepFun · Step3 · best of 2 rows | 50.2% | Independent | reasoningon | Partially comparable-10.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | qwen3-4b-2507-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 49.8% | Independent | reasoningon | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 49.3% | Independent | group defaults | Partially comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom · best of 2 rows | 49.3% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | minicpm5-1bOpen weightsOpenBMB · best of 4 rows | 49.3% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows | 49.1% | Independent | reasoningon | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 · best of 2 rows | 48.7% | Independent | reasoningon | Partially comparable-12.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 155 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 4 rows | 48.3% | Independent | reasoningon | Partially comparable-12.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | Mistral Small 4Open weightsMistral AI · Mistral · best of 4 rows | 48.2% | Independent | reasoningon | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 157 | qwen3-max-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 48.0% | Independent | reasoningoff | Partially comparable-13.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek · DeepSeek | 47.2% | Independent | group defaults | Partially comparable-13.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | tri-21b-think-previewOpen weightsTrillion Labs · best of 2 rows | 47.1% | Independent | reasoningon | Partially comparable-14.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | Llama 3.3 70BOpen weightsMeta AI · Llama 3.3 · best of 2 rows | 47.1% | Independent | reasoningoff | Partially comparable-14.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 161 | grok-3ClosedSpaceXAI · Grok 3 · best of 2 rows | 46.9% | Independent | reasoningoff | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito · best of 2 rows | 46.3% | Independent | reasoningon | Partially comparable-14.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 163 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 · best of 2 rows | 45.9% | Independent | reasoningonreasoning_efforthigh | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 163 | lfm2-24b-a2bOpen weightsLiquid AI · LFM2 · best of 2 rows | 45.9% | Independent | reasoningoff | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek · DeepSeek | 45.8% | Independent | group defaults | Partially comparable-15.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | midm-250-pro-rsnsftClosedKorea Telecom · best of 2 rows | 45.6% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 167 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 45.1% | Independent | reasoningon | Partially comparable-16.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | gpt-5-chatgptClosedOpenAI · GPT 5 · best of 2 rows | 45.0% | Independent | reasoningoff | Partially comparable-16.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | ring-1tOpen weightsinclusionAI · best of 2 rows | 44.6% | Independent | reasoningon | Partially comparable-16.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | ring-2-6-1tOpen weightsinclusionAI · best of 2 rows | 44.6% | Independent | reasoningon | Partially comparable-16.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 171 | Magistral Small 1.2Open weightsMistral AI · Magistral · best of 2 rows | 44.4% | Independent | reasoningon | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 171 | granite-4.1-30bOpen weightsIBM · Granite 4.1 · best of 2 rows | 44.4% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | gemma-4-E4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 44.2% | Independent | reasoningon | Partially comparable-16.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 44.1% | Independent | reasoningon | Partially comparable-17.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | LFM2.5-1.2B-InstructOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 43.8% | Independent | reasoningoff | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 4 rows | 43.4% | Independent | reasoningon | Partially comparable-17.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 43.4% | Independent | reasoningon | Partially comparable-17.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | ring-flash-2-0Open weightsinclusionAI · best of 2 rows | 43.3% | Independent | reasoningon | Partially comparable-17.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 43.1% | Independent | group defaults | Partially comparable-18.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | longcat-flash-liteOpen weightsLongCat · best of 2 rows | 43.1% | Independent | reasoningoff | Partially comparable-18.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 · best of 2 rows | 43.0% | Independent | reasoningoff | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Magistral Medium 1.2ClosedMistral AI · Magistral · best of 2 rows | 43.0% | Independent | reasoningon | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | gpt-4.1ClosedOpenAI · GPT 4.1 · best of 2 rows | 43.0% | Independent | reasoningoff | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | Claude Haiku 3.5ClosedAnthropic · Claude · best of 2 rows | 42.8% | Independent | reasoningoff | Partially comparable-18.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 185 | jt-35b-flashClosedChina Mobile · best of 2 rows | 42.0% | Independent | reasoningoff | Partially comparable-19.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed · best of 2 rows | 41.9% | Independent | reasoningon | Partially comparable-19.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | lfm2-5-1-2b-thinkingOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 41.8% | Independent | reasoningon | Partially comparable-19.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 188 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax · best of 2 rows | 41.8% | Independent | reasoningon | Partially comparable-19.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | Kimi K2 0905Open weightsMoonshot AI · Kimi · best of 2 rows | 41.7% | Independent | reasoningoff | Partially comparable-19.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 4 rows | 41.5% | Independent | reasoningon | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | Kimi K2 0711Open weightsMoonshot AI · Kimi · best of 2 rows | 41.5% | Independent | reasoningoff | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | Olmo-3-7B-ThinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows | 41.5% | Independent | reasoningon | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 41.5% | Independent | reasoningon | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | Grok Build 0.1ClosedxAI · Grok · best of 2 rows | 41.4% | Independent | reasoningon | Partially comparable-19.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 · best of 2 rows | 41.4% | Independent | reasoningon | Partially comparable-19.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax · best of 2 rows | 41.2% | Independent | reasoningon | Partially comparable-19.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 41.0% | Independent | reasoningoff | Partially comparable-20.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Qwen3 14BOpen weightsQwen · Qwen3 | 40.5% | Independent | group defaults | Partially comparable-20.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | qwen3-14b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows | 40.5% | Independent | reasoningon | Partially comparable-20.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder · best of 2 rows | 40.5% | Independent | reasoningoff | Partially comparable-20.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →