GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 3 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Frontier over time · accuracy · variant=Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent12 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent12 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent12 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent12 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent12 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 440 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 100 | jt-4-1-flash-236b-a21bClosedChina Mobile | 84.5% | Independent | reasoningoff | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | o3-proClosedOpenAI · OpenAI o-series | 84.5% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 | 84.4% | Independent | reasoningon | Partially comparable-0.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 2 rows | 84.2% | Independent | reasoningon | Partially comparable-0.31 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 2 rows | 84.1% | Independent | reasoningon | Partially comparable-0.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 3 rows | 84.0% | Independent | reasoningon | Partially comparable-0.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.5 | 83.8% | Independent | reasoningon | Partially comparable-0.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi | 83.8% | Independent | reasoningon | Partially comparable-0.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | GPT-5-CodexClosedOpenAI · GPT 5 | 83.7% | Independent | reasoning_efforthigh | Partially comparable-0.81 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | gemini-2-5-pro-03-25ClosedGoogle · Gemini 2.5 | 83.6% | Independent | reasoningon | Partially comparable-0.91 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | Muse Glimmer 30BOpen weightsMeta AI | 83.5% | Independent | reasoning_efforthigh | Partially comparable-1.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | mimo-v2-0206Open weightsXiaomi | 83.5% | Independent | reasoningon | Partially comparable-1.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 2 rows | 83.4% | Independent | reasoningon | Partially comparable-1.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | motif-3Open weightsMotif Technologies | 83.4% | Independent | reasoningon | Partially comparable-1.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 2 rows | 83.1% | Independent | reasoningon | Partially comparable-1.42 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | MiniMax M2.1Open weightsMiniMax · MiniMax | 83.0% | Independent | reasoningon | Partially comparable-1.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | jt-35b-flashClosedChina Mobile | 82.9% | Independent | reasoningoff | Partially comparable-1.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | k-exaone-2-0-0803Open weightsLG AI Research · EXAONE 2.0 | 82.9% | Independent | reasoningon | Partially comparable-1.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows | 82.8% | Independent | reasoning_efforthigh | Partially comparable-1.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | mimo-v2-omniClosedXiaomi | 82.8% | Independent | reasoningon | Partially comparable-1.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | o3ClosedOpenAI · OpenAI o-series | 82.7% | Independent | reasoningon | Partially comparable-1.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 | 82.6% | Independent | reasoningoff | Partially comparable-1.92 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | gpt-5-5-instant-06-26ClosedOpenAI · GPT 5.5 | 82.3% | Independent | reasoningon | Partially comparable-2.23 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 | 82.2% | Independent | reasoningon | Partially comparable-2.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | gemini-2-5-pro-05-06ClosedGoogle · Gemini 2.5 | 82.2% | Independent | reasoningon | Partially comparable-2.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 82.0% | Independent | reasoningon | Partially comparable-2.53 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows | 81.7% | Independent | reasoning_effortxhigh | Comparable-2.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 | 81.3% | Independent | reasoning_efforthigh | Partially comparable-3.24 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 | 81.3% | Independent | reasoningon | Partially comparable-3.24 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | ernie-4-5-300b-a47bOpen weightsBaidu · ERNIE 4.5 | 81.1% | Independent | reasoningoff | Partially comparable-3.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 81.1% | Independent | reasoningonreasoning_efforthigh | Partially comparable-3.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 | 80.9% | Independent | reasoningon | Partially comparable-3.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | Step 3.7 FlashOpen weightsStepFun · Step3.7 | 80.9% | Independent | reasoningon | Partially comparable-3.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | Claude Opus 4.1ClosedAnthropic · Claude | 80.9% | Independent | reasoningon | Partially comparable-3.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 2 rows | 80.6% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | g9v3-39a5bOpen weightsAI9Stars | 80.5% | Independent | reasoningon | Partially comparable-4.04 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 | 80% | Independent | reasoningon | Partially comparable-4.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 138 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 79.7% | Independent | reasoningon | Partially comparable-4.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | claude-4-opusClosedAnthropic · Claude 4 · best of 2 rows | 79.6% | Independent | reasoningon | Partially comparable-4.95 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 140 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 | 79.4% | Independent | reasoningon | Partially comparable-5.16 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 4 rows | 79.3% | Independent | reasoningon | Partially comparable-5.26 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 2 rows | 79.2% | Independent | reasoningon | Partially comparable-5.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 79.2% | Independent | reasoningon | Partially comparable-5.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 | 79.1% | Independent | reasoningonreasoning_efforthigh | Partially comparable-5.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 145 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 2 rows | 79.0% | Independent | reasoningon | Partially comparable-5.56 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 78.5% | Independent | reasoningonreasoning_effortmedium | Partially comparable-6.07 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | o4-miniClosedOpenAI · OpenAI o-series | 78.4% | Independent | reasoning_efforthigh | Partially comparable-6.17 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows | 78.3% | Independent | reasoningon | Partially comparable-6.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 | 78.2% | Independent | reasoningon | Partially comparable-6.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows | 78.2% | Independent | reasoning_efforthigh | Partially comparable-6.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 78.0% | Independent | reasoningon | Partially comparable-6.57 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | LongCat 2.0Open weightsMeituan | 78.0% | Independent | reasoningon | Partially comparable-6.57 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 77.9% | Independent | reasoningon | Partially comparable-6.67 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 77.7% | Independent | reasoningon | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | MiniMax M2Open weightsMiniMax · MiniMax | 77.7% | Independent | reasoningon | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 | 77.7% | Independent | reasoningon | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 157 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 | 77.6% | Independent | reasoningon | Partially comparable-6.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | ring-1tOpen weightsinclusionAI | 77.4% | Independent | reasoningon | Partially comparable-7.18 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 77.3% | Independent | reasoning_efforthigh | Partially comparable-7.28 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 2 rows | 77.2% | Independent | reasoningon | Partially comparable-7.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 77.2% | Independent | reasoningon | Partially comparable-7.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 2 rows | 77.1% | Independent | reasoningon | Partially comparable-7.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 163 | Mercury 2ClosedInception | 77.0% | Independent | reasoningon | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | Mistral Small 4Open weightsMistral AI · Mistral · best of 2 rows | 76.9% | Independent | reasoningon | Partially comparable-7.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito | 76.8% | Independent | reasoningon | Partially comparable-7.78 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Kimi K2 0905Open weightsMoonshot AI · Kimi | 76.7% | Independent | reasoningoff | Partially comparable-7.88 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 167 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 76.6% | Independent | reasoningoff | Partially comparable-7.98 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | o1 PreviewClosedOpenAI · OpenAI o-series | 76.5% | Independent | reasoningon | Partially comparable-8.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | doubao-seed-codeClosedByteDance · Seed | 76.4% | Independent | reasoningon | Partially comparable-8.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | kat-coder-pro-v1ClosedKwaiKAT | 76.4% | Independent | reasoningoff | Partially comparable-8.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | qwen3-max-previewClosedAlibaba Group · Qwen3 | 76.4% | Independent | reasoningoff | Partially comparable-8.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | command-a-plusOpen weightsCohere · Command | 76.1% | Independent | reasoningon | Partially comparable-8.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | intellect-3Open weightsPrime Intellect | 76.1% | Independent | reasoningon | Partially comparable-8.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 76.0% | Independent | reasoningonreasoning_effortmedium | Partially comparable-8.59 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 75.9% | Independent | reasoningon | Partially comparable-8.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron | 75.8% | Independent | reasoningon | Partially comparable-8.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 177 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 75.7% | Independent | reasoningon | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 177 | North Mini Code (free)Open weightsCohere | 75.7% | Independent | reasoningon | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows | 75.3% | Independent | reasoningon | Partially comparable-9.30 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | Trinity Large ThinkingOpen weightsArcee AI | 75.2% | Independent | reasoningon | Partially comparable-9.40 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | ling-2-6-1tOpen weightsinclusionAI | 75.2% | Independent | reasoningoff | Partially comparable-9.40 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | Mistral Medium 3.5Open weightsMistral AI · Mistral | 74.8% | Independent | reasoningon | Partially comparable-9.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA · Llama · best of 2 rows | 74.8% | Independent | reasoningon | Partially comparable-9.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | o1ClosedOpenAI · OpenAI o-series | 74.8% | Independent | reasoningon | Partially comparable-9.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 185 | NVIDIA Nemotron 3.5 Lightning 30B A3BOpen weightsNVIDIA · Nemotron 3.5 | 74.3% | Independent | reasoningon | Partially comparable-10.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 | 74.2% | Independent | reasoningoff | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | Magistral Medium 1.2ClosedMistral AI · Magistral | 73.9% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | exaone-4-0-32bOpen weightsLG AI Research · EXAONE 4.0 · best of 2 rows | 73.9% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | sarvam-105bOpen weightsSarvam | 73.8% | Independent | reasoning_efforthigh | Partially comparable-10.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | Qwen3 Coder NextOpen weightsQwen · Qwen3 | 73.7% | Independent | reasoningoff | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 191 | ling-3-0-tinyOpen weightsinclusionAI | 73.4% | Independent | reasoningon | Partially comparable-11.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 | 73.3% | Independent | reasoningon | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 73.3% | Independent | reasoningon | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | apriel-v1-6-15b-thinkerOpen weightsServiceNow | 73.3% | Independent | reasoningon | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | hypernova-60bOpen weightsMultiverse Computing | 73.3% | Independent | reasoning_efforthigh | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | quasar-438bClosedMultiverse Computing | 73.2% | Independent | reasoning_effortmax | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | llama-3-1-nemotron-ultra-253b-v1-reasoningOpen weightsNVIDIA · Llama 3.1 | 72.8% | Independent | reasoningon | Partially comparable-11.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Grok Build 0.1ClosedxAI · Grok | 72.7% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | hermes-4-llama-3-1-405bOpen weightsNous Research · Llama 3.1 · best of 2 rows | 72.7% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed | 72.6% | Independent | reasoningon | Partially comparable-11.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →