GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 5 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Score history · solar-pro-2 5 rows
- solar-pro-2
- 56.06%aa_slug=solar-pro-2 · variant=Diamond · evaluator=Artificial Analysis · reasoning=off12 Sept 2026
- 57.78%aa_slug=solar-pro-2-preview-reasoning · variant=Diamond · evaluator=Artificial Analysis · reasoning=on12 Sept 2026
- 68.69%aa_slug=solar-pro-2-reasoning · variant=Diamond · evaluator=Artificial Analysis · reasoning=on12 Sept 2026
- 56.06%aa_slug=solar-pro-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 68.69%aa_slug=solar-pro-2-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · reasoning=on11 Sept 2026
Frontier over time · accuracy · variant=GPQA Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent11 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent11 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent11 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent11 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent11 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent11 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 459 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 101 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 | 84.7% | Independent | group defaults | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 101 | mimo-v2-flashOpen weightsXiaomi · best of 2 rows | 84.7% | Independent | reasoningon | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 2 rows | 84.5% | Independent | group defaults | Partially comparable-0.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | jt-4-1-flash-236b-a21bClosedChina Mobile | 84.5% | Independent | group defaults | Partially comparable-0.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | o3-proClosedOpenAI · OpenAI o-series | 84.5% | Independent | group defaults | Partially comparable-0.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 | 84.4% | Independent | group defaults | Partially comparable-0.21 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 2 rows | 84.2% | Independent | group defaults | Partially comparable-0.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 2 rows | 84.1% | Independent | group defaults | Partially comparable-0.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | DeepSeek V3.2Open weightsDeepSeek · DeepSeek-V3 | 84.0% | Independent | group defaults | Partially comparable-0.61 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.5 | 83.8% | Independent | group defaults | Partially comparable-0.81 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi | 83.8% | Independent | group defaults | Partially comparable-0.81 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | GPT-5-CodexClosedOpenAI · GPT 5 | 83.7% | Independent | group defaults | Partially comparable-0.91 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | gemini-2-5-pro-03-25ClosedGoogle · Gemini 2.5 | 83.6% | Independent | group defaults | Partially comparable-1.01 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | Muse Glimmer 30BOpen weightsMeta AI | 83.5% | Independent | group defaults | Partially comparable-1.11 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | mimo-v2-0206Open weightsXiaomi | 83.5% | Independent | group defaults | Partially comparable-1.11 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 2 rows | 83.4% | Independent | reasoningon | Partially comparable-1.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | motif-3Open weightsMotif Technologies | 83.4% | Independent | group defaults | Partially comparable-1.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 118 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 2 rows | 83.1% | Independent | group defaults | Partially comparable-1.52 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | MiniMax M2.1Open weightsMiniMax · MiniMax | 83.0% | Independent | group defaults | Partially comparable-1.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | jt-35b-flashClosedChina Mobile | 82.9% | Independent | group defaults | Partially comparable-1.72 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | k-exaone-2-0-0803Open weightsLG AI Research · EXAONE 2.0 | 82.9% | Independent | group defaults | Partially comparable-1.72 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows | 82.8% | Independent | group defaults | Partially comparable-1.82 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | mimo-v2-omniClosedXiaomi | 82.8% | Independent | group defaults | Partially comparable-1.82 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | o3ClosedOpenAI · OpenAI o-series | 82.7% | Independent | group defaults | Partially comparable-1.92 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 125 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 | 82.6% | Independent | group defaults | Partially comparable-2.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | gpt-5-5-instant-06-26ClosedOpenAI · GPT 5.5 | 82.3% | Independent | group defaults | Partially comparable-2.33 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 | 82.2% | Independent | group defaults | Partially comparable-2.43 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | gemini-2-5-pro-05-06ClosedGoogle · Gemini 2.5 | 82.2% | Independent | group defaults | Partially comparable-2.43 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 129 | GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 82.0% | Independent | group defaults | Partially comparable-2.63 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows | 81.7% | Independent | group defaults | Partially comparable-2.93 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 | 81.3% | Independent | group defaults | Partially comparable-3.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 | 81.3% | Independent | group defaults | Partially comparable-3.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 133 | gemini-3-flashClosedGoogle · Gemini 3 | 81.2% | Independent | group defaults | Partially comparable-3.44 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | ernie-4-5-300b-a47bOpen weightsBaidu · ERNIE 4.5 | 81.1% | Independent | group defaults | Partially comparable-3.54 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 81.1% | Independent | reasoningon | Partially comparable-3.54 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 | 80.9% | Independent | group defaults | Partially comparable-3.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | Step 3.7 FlashOpen weightsStepFun · Step3.7 | 80.9% | Independent | group defaults | Partially comparable-3.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 138 | Claude Opus 4.1ClosedAnthropic · Claude | 80.9% | Independent | reasoningon | Partially comparable-3.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 2 rows | 80.6% | Independent | group defaults | Partially comparable-4.04 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 140 | g9v3-39a5bOpen weightsAI9Stars | 80.5% | Independent | group defaults | Partially comparable-4.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 | 80% | Independent | group defaults | Partially comparable-4.65 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 | 79.7% | Independent | group defaults | Partially comparable-4.95 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | Claude Opus 4ClosedAnthropic · Claude | 79.6% | Independent | group defaults | Partially comparable-5.05 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 | 79.4% | Independent | group defaults | Partially comparable-5.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 145 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 79.3% | Independent | reasoningon | Partially comparable-5.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 2 rows | 79.2% | Independent | reasoningon | Partially comparable-5.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 79.2% | Independent | group defaults | Partially comparable-5.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 | 79.1% | Independent | group defaults | Partially comparable-5.56 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 79.0% | Independent | reasoningon | Partially comparable-5.66 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 2 rows | 79.0% | Independent | group defaults | Partially comparable-5.66 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 78.5% | Independent | reasoningonreasoning_effortmedium | Partially comparable-6.17 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 152 | o4-miniClosedOpenAI · OpenAI o-series | 78.4% | Independent | group defaults | Partially comparable-6.27 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows | 78.3% | Independent | group defaults | Partially comparable-6.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 | 78.2% | Independent | group defaults | Partially comparable-6.47 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows | 78.2% | Independent | group defaults | Partially comparable-6.47 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 78.0% | Independent | reasoningon | Partially comparable-6.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | LongCat 2.0Open weightsMeituan | 78.0% | Independent | group defaults | Partially comparable-6.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 77.9% | Independent | reasoningon | Partially comparable-6.77 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 77.7% | Independent | reasoningon | Partially comparable-6.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | MiniMax M2Open weightsMiniMax · MiniMax | 77.7% | Independent | group defaults | Partially comparable-6.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 | 77.7% | Independent | group defaults | Partially comparable-6.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 77.6% | Independent | group defaults | Partially comparable-7.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 | 77.6% | Independent | group defaults | Partially comparable-7.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | ring-1tOpen weightsinclusionAI | 77.4% | Independent | group defaults | Partially comparable-7.28 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 77.3% | Independent | reasoning_efforthigh | Partially comparable-7.38 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 2 rows | 77.2% | Independent | reasoningon | Partially comparable-7.48 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 77.2% | Independent | reasoningon | Partially comparable-7.48 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 2 rows | 77.1% | Independent | group defaults | Partially comparable-7.58 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | Mercury 2ClosedInception | 77.0% | Independent | group defaults | Partially comparable-7.68 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | Mistral Small 4Open weightsMistral AI · Mistral · best of 2 rows | 76.9% | Independent | group defaults | Partially comparable-7.78 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 171 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito | 76.8% | Independent | group defaults | Partially comparable-7.88 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | Kimi K2 0905Open weightsMoonshot AI · Kimi | 76.7% | Independent | group defaults | Partially comparable-7.98 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 76.6% | Independent | group defaults | Partially comparable-8.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | o1 PreviewClosedOpenAI · OpenAI o-series | 76.5% | Independent | group defaults | Partially comparable-8.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | doubao-seed-codeClosedByteDance · Seed | 76.4% | Independent | group defaults | Partially comparable-8.29 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | kat-coder-pro-v1ClosedKwaiKAT | 76.4% | Independent | group defaults | Partially comparable-8.29 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | qwen3-max-previewClosedAlibaba Group · Qwen3 | 76.4% | Independent | group defaults | Partially comparable-8.29 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | command-a-plusOpen weightsCohere · Command | 76.1% | Independent | group defaults | Partially comparable-8.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | intellect-3Open weightsPrime Intellect | 76.1% | Independent | group defaults | Partially comparable-8.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 76.0% | Independent | reasoningonreasoning_effortmedium | Partially comparable-8.69 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 75.9% | Independent | reasoningon | Partially comparable-8.79 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron | 75.8% | Independent | group defaults | Partially comparable-8.89 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 183 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 75.7% | Independent | reasoningon | Partially comparable-8.99 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 183 | North Mini Code (free)Open weightsCohere | 75.7% | Independent | group defaults | Partially comparable-8.99 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 185 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows | 75.3% | Independent | group defaults | Partially comparable-9.40 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Trinity Large ThinkingOpen weightsArcee AI | 75.2% | Independent | group defaults | Partially comparable-9.50 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | ling-2-6-1tOpen weightsinclusionAI | 75.2% | Independent | group defaults | Partially comparable-9.50 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 188 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 2 rows | 75.0% | Independent | group defaults | Partially comparable-9.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | Mistral Medium 3.5Open weightsMistral AI · Mistral | 74.8% | Independent | group defaults | Partially comparable-9.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA · Llama · best of 2 rows | 74.8% | Independent | reasoningon | Partially comparable-9.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 191 | o1ClosedOpenAI · OpenAI o-series | 74.8% | Independent | group defaults | Partially comparable-9.90 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | NVIDIA Nemotron 3.5 Lightning 30B A3BOpen weightsNVIDIA · Nemotron 3.5 | 74.3% | Independent | group defaults | Partially comparable-10.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 193 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 | 74.2% | Independent | group defaults | Partially comparable-10.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | Magistral Medium 1.2ClosedMistral AI · Magistral | 73.9% | Independent | group defaults | Partially comparable-10.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | exaone-4-0-32bOpen weightsLG AI Research · EXAONE 4.0 · best of 2 rows | 73.9% | Independent | reasoningon | Partially comparable-10.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 73.8% | Independent | group defaults | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | sarvam-105bOpen weightsSarvam | 73.8% | Independent | group defaults | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Qwen3 Coder NextOpen weightsQwen · Qwen3 | 73.7% | Independent | group defaults | Partially comparable-10.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 199 | ling-3-0-tinyOpen weightsinclusionAI | 73.4% | Independent | group defaults | Partially comparable-11.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 | 73.3% | Independent | group defaults | Partially comparable-11.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →