Updated 3 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,217
- Models
- 453
- Current leader
- Claude Fable 5.1 59.1%
Frontier over time · accuracy · evaluator=Artificial Analysis
9 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 59.1%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 58.7%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 55.9%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 55.5%Claude Fable 5 Anthropic Independent11 Sept 2026
- 53.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 52.7%gpt-6-astra OpenAI Independent11 Sept 2026
- 51.3%Claude Opus 5 Anthropic Independent11 Sept 2026
- 11.0%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 453 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 101 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 4 rows | 24.5% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 102 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 4 rows | 23.9% | Independent | reasoningon | Partially comparable-0.56 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi · best of 2 rows | 23.8% | Independent | reasoningon | Partially comparable-0.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | Ling 3.0 FlashOpen weightsinclusionAI · best of 2 rows | 23.7% | Independent | reasoningon | Partially comparable-0.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 4 rows | 23.6% | Independent | reasoningon | Partially comparable-0.84 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | MiniMax M2.1Open weightsMiniMax · MiniMax · best of 2 rows | 23.2% | Independent | reasoningon | Partially comparable-1.30 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 4 rows | 23.1% | Independent | reasoningon | Partially comparable-1.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | mimo-v2-flashOpen weightsXiaomi · best of 4 rows | 22.9% | Independent | reasoningon | Partially comparable-1.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | mimo-v2-omni-0327ClosedXiaomi · best of 2 rows | 22.6% | Independent | reasoningon | Partially comparable-1.90 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 · best of 2 rows | 22.5% | Independent | reasoningon | Partially comparable-1.95 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 4 rows | 22.2% | Independent | reasoningon | Partially comparable-2.23 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | mimo-v2-0206Open weightsXiaomi · best of 2 rows | 22.1% | Independent | reasoningon | Partially comparable-2.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | mimo-v2-omniClosedXiaomi · best of 2 rows | 22.1% | Independent | reasoningon | Partially comparable-2.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | Ling 3.0 Flash VLOpen weightsinclusionAI · best of 2 rows | 22.0% | Independent | reasoningon | Partially comparable-2.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | Muse Glimmer 30BOpen weightsMeta AI · best of 2 rows | 22.0% | Independent | reasoning_efforthigh | Partially comparable-2.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 · best of 2 rows | 21.6% | Independent | reasoningon | Partially comparable-2.88 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | ring-2-6-1tOpen weightsinclusionAI · best of 2 rows | 21.6% | Independent | reasoningon | Partially comparable-2.88 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 118 | gpt-5-miniClosedOpenAI · GPT 5 · best of 6 rows | 21.5% | Independent | reasoning_efforthigh | Partially comparable-3.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | Step 3.7 FlashOpen weightsStepFun · Step3.7 · best of 2 rows | 21.4% | Independent | reasoningon | Partially comparable-3.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 4 rows | 21.0% | Independent | reasoningon | Partially comparable-3.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 20.8% | Independent | reasoningon | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | MiniMax M2.5Open weightsMiniMax · MiniMax · best of 2 rows | 20.5% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | o3ClosedOpenAI · OpenAI o-series · best of 2 rows | 20.1% | Independent | reasoningon | Partially comparable-4.42 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | gemini-2-5-pro-05-06ClosedGoogle · Gemini 2.5 · best of 2 rows | 19.9% | Independent | reasoningon | Partially comparable-4.54 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | gpt-5-5-instant-06-26ClosedOpenAI · GPT 5.5 · best of 2 rows | 19.9% | Independent | reasoningon | Partially comparable-4.54 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 4 rows | 19.6% | Independent | reasoning_efforthigh | Partially comparable-4.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 19.3% | Independent | reasoningon | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 4 rows | 19.3% | Independent | reasoningon | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 129 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 4 rows | 19.1% | Independent | reasoningon | Partially comparable-5.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.5 · best of 2 rows | 18.8% | Independent | reasoningon | Partially comparable-5.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | quasar-438bClosedMultiverse Computing · best of 2 rows | 18.7% | Independent | reasoning_effortmax | Comparable-5.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | k-exaone-2-0-0803Open weightsLG AI Research · EXAONE 2.0 · best of 2 rows | 18.6% | Independent | reasoningon | Partially comparable-5.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 133 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 · best of 2 rows | 18.5% | Independent | reasoning_efforthigh | Partially comparable-5.98 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | gemini-2-5-pro-03-25ClosedGoogle · Gemini 2.5 · best of 2 rows | 18.0% | Independent | reasoningon | Partially comparable-6.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 4 rows | 17.8% | Independent | reasoningon | Partially comparable-6.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | jt-4-1-flash-236b-a21bClosedChina Mobile · best of 2 rows | 17.8% | Independent | reasoningoff | Partially comparable-6.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | g9v3-39a5bOpen weightsAI9Stars · best of 2 rows | 17.5% | Independent | reasoningon | Partially comparable-7.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 138 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 17.2% | Independent | reasoningon | Partially comparable-7.28 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 17.1% | Independent | reasoningon | Partially comparable-7.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | Mercury 2ClosedInception · best of 2 rows | 17.1% | Independent | reasoningon | Partially comparable-7.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | hypernova-60bOpen weightsMultiverse Computing · best of 2 rows | 16.6% | Independent | reasoning_efforthigh | Partially comparable-7.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | o4-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 16.5% | Independent | reasoning_efforthigh | Partially comparable-7.93 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 4 rows | 16.4% | Independent | reasoningon | Partially comparable-8.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | KAT-Coder-Pro V2ClosedKwaipilot · best of 2 rows | 16.1% | Independent | reasoningoff | Partially comparable-8.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 145 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 4 rows | 15.9% | Independent | reasoningon | Partially comparable-8.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | Trinity Large ThinkingOpen weightsArcee AI · best of 2 rows | 15.8% | Independent | reasoningon | Partially comparable-8.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 · best of 2 rows | 15.8% | Independent | reasoningon | Partially comparable-8.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 4 rows | 15.7% | Independent | reasoningon | Partially comparable-8.81 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 4 rows | 14.9% | Independent | reasoningon | Partially comparable-9.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 · best of 3 rows | 14.9% | Independent | reasoningon | Partially comparable-9.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 · best of 2 rows | 14.9% | Independent | reasoningoff | Partially comparable-9.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 152 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 4 rows | 14.5% | Independent | reasoningon | Partially comparable-10.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 4 rows | 14.3% | Independent | reasoningon | Partially comparable-10.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | doubao-seed-codeClosedByteDance · Seed · best of 2 rows | 14.1% | Independent | reasoningon | Partially comparable-10.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 155 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 4 rows | 13.9% | Independent | reasoningon | Partially comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 6 rows | 13.8% | Independent | reasoningon | Partially comparable-10.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 157 | Mistral Medium 3.5Open weightsMistral AI · Mistral · best of 2 rows | 13.8% | Independent | reasoningon | Partially comparable-10.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | MiniMax M2Open weightsMiniMax · MiniMax · best of 2 rows | 13.7% | Independent | reasoningon | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 · best of 2 rows | 13.3% | Independent | reasoningon | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | intellect-3Open weightsPrime Intellect · best of 2 rows | 13.1% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 161 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 13.0% | Independent | reasoningon | Partially comparable-11.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 · best of 2 rows | 12.9% | Independent | reasoningon | Partially comparable-11.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 163 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 12.7% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 12.6% | Independent | reasoningon | Partially comparable-11.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | Claude Opus 4.1ClosedAnthropic · Claude · best of 2 rows | 12.5% | Independent | reasoningon | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Claude Opus 4ClosedAnthropic · Claude | 12.3% | Independent | group defaults | Partially comparable-12.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | claude-4-opusClosedAnthropic · Claude 4 · best of 3 rows | 12.3% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 12.1% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | apriel-v1-5-15b-thinkerOpen weightsServiceNow · best of 2 rows | 12.1% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | gemini-2-5-flash-reasoning-04-2025ClosedGoogle · Gemini 2.5 · best of 3 rows | 12.1% | Independent | reasoningon | Partially comparable-12.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 171 | o3-miniClosedOpenAI · OpenAI o-series · best of 4 rows | 12.0% | Independent | reasoning_efforthigh | Partially comparable-12.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito · best of 2 rows | 12% | Independent | reasoningon | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron · best of 2 rows | 12% | Independent | reasoningon | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | command-a-plusOpen weightsCohere · Command · best of 2 rows | 12.0% | Independent | reasoningon | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 11.9% | Independent | reasoningon | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 8 rows | 11.6% | Independent | reasoningonreasoning_efforthigh | Partially comparable-12.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 177 | exaone-4-0-32bOpen weightsLG AI Research · EXAONE 4.0 · best of 4 rows | 11.4% | Independent | reasoningon | Partially comparable-13.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 4 rows | 11.4% | Independent | reasoningon | Partially comparable-13.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | granite-4.2-30bOpen weightsIBM · Granite 4.2 · best of 2 rows | 11.2% | Independent | reasoningon | Partially comparable-13.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | ring-1tOpen weightsinclusionAI · best of 2 rows | 11.1% | Independent | reasoningon | Partially comparable-13.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | North Mini Code (free)Open weightsCohere · best of 2 rows | 11.1% | Independent | reasoningon | Partially comparable-13.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | sarvam-105bOpen weightsSarvam · best of 2 rows | 11.0% | Independent | reasoning_efforthigh | Partially comparable-13.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 183 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 · best of 2 rows | 11.0% | Independent | reasoningonreasoning_efforthigh | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | falcon-h1r-7bOpen weightsTII UAE · Falcon · best of 2 rows | 11.0% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 4 rows | 11.0% | Independent | reasoning_efforthigh | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | qwen3-235b-a22b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 11.0% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | Hermes 4 405BOpen weightsNous Research · Hermes 4 | 10.9% | Independent | group defaults | Partially comparable-13.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | hermes-4-llama-3-1-405bOpen weightsNous Research · Llama 3.1 · best of 3 rows | 10.9% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | nanbeige4-1-3bOpen weightsNanbeige · best of 2 rows | 10.9% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | diffusiongemma-26b-a4bOpen weightsGoogle · best of 2 rows | 10.8% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | step-3-vl-10bOpen weightsStepFun · Step3 · best of 2 rows | 10.8% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | apriel-v1-6-15b-thinkerOpen weightsServiceNow · best of 2 rows | 10.8% | Independent | reasoningon | Partially comparable-13.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 193 | Claude Sonnet 4ClosedAnthropic · Claude · best of 4 rows | 10.7% | Independent | reasoningon | Partially comparable-13.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | NVIDIA Nemotron 3.5 Lightning 30B A3BOpen weightsNVIDIA · Nemotron 3.5 · best of 2 rows | 10.6% | Independent | reasoningon | Partially comparable-13.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 195 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 6 rows | 10.5% | Independent | reasoning_efforthigh | Partially comparable-13.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | solar-open-100b-reasoningOpen weightsUpstage · Solar · best of 2 rows | 10.4% | Independent | reasoningon | Partially comparable-14.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 4 rows | 10.4% | Independent | reasoningon | Partially comparable-14.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Magistral Medium 1.2ClosedMistral AI · Magistral · best of 2 rows | 10.3% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Solar Pro 3ClosedUpstage · Solar · best of 2 rows | 10.3% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 4 rows | 10.3% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →