GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 5 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Score history · jamba-1-7-large 2 rows
- jamba-1-7-large
- 38.99%aa_slug=jamba-1-7-large · variant=Diamond · evaluator=Artificial Analysis · reasoning=off12 Sept 2026
- 38.99%aa_slug=jamba-1-7-large · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · variant=Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent12 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent12 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent12 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent12 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent12 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 440 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | gpt-6-astraClosedOpenAI · GPT 6 · best of 5 rows | 96.3% | Independent | reasoning_effortxhigh | leader | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 2 | Gemini 3.8 FlashClosedGoogle · Gemini 3.8 · best of 3 rows | 95.3% | Independent | reasoning_efforthigh | Partially comparable-1.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 3 | Grok 4.6ClosedxAI · Grok · best of 4 rows | 95.0% | Independent | reasoning_efforthigh | Partially comparable-1.31 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Gemini 3.7 FlashClosedGoogle · Gemini 3.7 · best of 3 rows | 94.5% | Independent | reasoning_efforthigh | Partially comparable-1.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.1 | 94.1% | Independent | reasoningon | Partially comparable-2.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | Muse Spark 1.3ClosedMeta AI · best of 2 rows | 94.1% | Independent | reasoning_effortxhigh | Comparable-2.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 6 rows | 94.1% | Independent | reasoning_effortmax | Partially comparable-2.12 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | Claude Fable 5.1ClosedAnthropic · Claude · best of 5 rows | 93.7% | Independent | reasoning_effortmax | Partially comparable-2.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | Claude Opus 5ClosedAnthropic · Claude · best of 5 rows | 93.7% | Independent | reasoning_efforthigh | Partially comparable-2.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | Kimi K3Open weightsMoonshot AI · Kimi · best of 2 rows | 93.5% | Independent | reasoning_effortmax | Partially comparable-2.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | Qwen3.8 2.4T A95BOpen weightsQwen · Qwen3.8 | 93.5% | Independent | reasoningon | Partially comparable-2.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | gpt-5.5ClosedOpenAI · GPT 5.5 · best of 5 rows | 93.5% | Independent | reasoning_effortxhigh | Comparable-2.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 13 | Grok 4.5ClosedxAI · Grok | 93.1% | Independent | reasoning_efforthigh | Partially comparable-3.13 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | MiniMax-M3Open weightsMiniMax · MiniMax | 92.9% | Independent | reasoningon | Partially comparable-3.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 15 | Gemini 3.6 FlashClosedGoogle · Gemini 3.6 | 92.8% | Independent | reasoningon | Partially comparable-3.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 15 | deepseek-v4-proClosedDeepSeek · V4 | 92.8% | Independent | reasoning_effortmax | Partially comparable-3.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 17 | Qwen 3.8 MaxClosedQwen · Qwen3.8 | 92.7% | Independent | reasoningon | Partially comparable-3.53 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Claude Fable 5ClosedAnthropic · Claude | 92.6% | Independent | reasoningon | Partially comparable-3.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 19 | gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 6 rows | 92.5% | Independent | reasoning_effortmax | Partially comparable-3.73 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 20 | agnes-3-0-flashClosedSapiens AI | 92.4% | Independent | reasoningon | Partially comparable-3.84 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 21 | Qwen3.7 MaxClosedQwen · Qwen3.7 | 92.3% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 21 | Qwen3.8 FlashOpen weightsQwen · Qwen3.8 | 92.3% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 23 | Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 3 rows | 92.2% | Independent | reasoningon | Partially comparable-4.04 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | Claude Opus 4.8ClosedAnthropic · Claude | 92.0% | Independent | reasoning_effortmax | Partially comparable-4.24 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | gpt-5.4ClosedOpenAI · GPT 5.4 · best of 3 rows | 92.0% | Independent | reasoning_effortxhigh | Comparable-4.24 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.3 | 91.7% | Independent | reasoning_effortmax | Partially comparable-4.54 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 27 | gpt-5.3-codexClosedOpenAI · GPT 5.3 | 91.5% | Independent | reasoning_effortxhigh | Comparable-4.74 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 28 | Claude Opus 4.7ClosedAnthropic · Claude · best of 2 rows | 91.4% | Independent | reasoning_effortmax | Partially comparable-4.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | deepseek-v4-flash-visionClosedDeepSeek · DeepSeek | 91.3% | Independent | reasoning_effortmax | Partially comparable-4.95 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 30 | GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.3 | 91.2% | Independent | reasoningon | Partially comparable-5.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | Claude Sonnet 5ClosedAnthropic · Claude · best of 2 rows | 91.1% | Independent | reasoning_effortmax | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | Grok 4.20ClosedxAI · Grok · best of 2 rows | 91.1% | Independent | reasoningon | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | Kimi K2.6Open weightsMoonshot AI · Kimi · best of 2 rows | 91.1% | Independent | reasoningon | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | gpt-5.6-lunaClosedOpenAI · GPT 5.6 · best of 6 rows | 91.1% | Independent | reasoning_effortmax | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | deepseek-v4-flashOpen weightsDeepSeek · DeepSeek | 90.8% | Independent | reasoning_effortmax | Partially comparable-5.45 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | gemini-3-proClosedGoogle · Gemini 3 · best of 2 rows | 90.8% | Independent | reasoning_efforthigh | Partially comparable-5.45 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 37 | Qwen3.8 27BOpen weightsQwen · Qwen3.8 · best of 4 rows | 90.5% | Independent | reasoning_effortxhigh | Comparable-5.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 37 | agnes-2-5-pro-betaClosedSapiens AI | 90.5% | Independent | reasoningon | Partially comparable-5.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 37 | deepseek-v4-pro-0424Open weightsDeepSeek · DeepSeek · best of 3 rows | 90.5% | Independent | reasoning_efforthigh | Partially comparable-5.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | Muse Spark 1.2ClosedMeta AI | 90.4% | Independent | reasoning_effortxhigh | Comparable-5.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 41 | gpt-5.2ClosedOpenAI · GPT 5.2 · best of 3 rows | 90.3% | Independent | reasoning_effortxhigh | Comparable-5.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 42 | Grok 4.3ClosedxAI · Grok · best of 4 rows | 90.1% | Independent | reasoning_efforthigh | Partially comparable-6.16 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 43 | Qwen 3.7 PlusClosedQwen · Qwen3.7 | 90% | Independent | reasoningon | Partially comparable-6.26 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 44 | GPT-5.2-CodexClosedOpenAI · GPT 5.2 | 89.9% | Independent | reasoning_effortxhigh | Comparable-6.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Muse Spark 1.1ClosedMeta AI | 89.8% | Independent | reasoning_effortxhigh | Comparable-6.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | gemini-3-flashClosedGoogle · Gemini 3 · best of 2 rows | 89.8% | Independent | reasoningon | Partially comparable-6.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 47 | Hy3Open weightsTencent · best of 3 rows | 89.7% | Independent | reasoningon | Partially comparable-6.56 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 48 | Claude Opus 4.6ClosedAnthropic · Claude · best of 2 rows | 89.6% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-6.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 48 | Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi | 89.6% | Independent | reasoningon | Partially comparable-6.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | Inkling SmallOpen weightsThinking Machines | 89.5% | Independent | reasoningon | Partially comparable-6.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.2 · best of 2 rows | 89.5% | Independent | reasoning_effortmax | Partially comparable-6.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | grok-build-0-1-06-16ClosedSpaceXAI · Grok | 89.5% | Independent | reasoningon | Partially comparable-6.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | deepseek-v4-flash-0420Open weightsDeepSeek · DeepSeek · best of 3 rows | 89.4% | Independent | reasoning_effortmax | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 54 | Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 2 rows | 89.3% | Independent | reasoningon | Partially comparable-6.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | nex-n2-proOpen weightsNex AGI | 89.2% | Independent | reasoningon | Partially comparable-7.07 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 56 | Solar Pro 4ClosedUpstage · Solar | 89.1% | Independent | reasoningon | Partially comparable-7.17 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 57 | Qwen3.6 Max PreviewClosedQwen · Qwen3.6 | 88.8% | Independent | reasoningon | Partially comparable-7.47 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 58 | grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 2 rows | 88.5% | Independent | reasoningon | Partially comparable-7.78 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 59 | muse-sparkClosedMeta AI | 88.4% | Independent | reasoningon | Partially comparable-7.88 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | Qwen3.6 PlusClosedQwen · Qwen3.6 | 88.2% | Independent | reasoningon | Partially comparable-8.08 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 61 | Kimi K2.5Open weightsMoonshot AI · Kimi · best of 2 rows | 87.9% | Independent | reasoningon | Partially comparable-8.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 62 | grok-4ClosedSpaceXAI · Grok 4 | 87.7% | Independent | reasoningon | Partially comparable-8.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 63 | agnes-2-5-pro-alphaOpen weightsSapiens AI | 87.6% | Independent | reasoningon | Partially comparable-8.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 3 rows | 87.5% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-8.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 3 rows | 87.5% | Independent | reasoning_effortxhigh | Comparable-8.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | MiniMax M2.7Open weightsMiniMax · MiniMax | 87.4% | Independent | reasoningon | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 67 | gpt-5.1ClosedOpenAI · GPT 5.1 · best of 2 rows | 87.3% | Independent | reasoning_efforthigh | Partially comparable-8.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 67 | k2-horizon-375b-a23bOpen weightsMBZUAI Institute of Foundation Models | 87.3% | Independent | reasoningon | Partially comparable-8.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 69 | InklingOpen weightsThinking Machines | 87.2% | Independent | reasoningon | Partially comparable-9.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 70 | deepseek-v3-2-specialeOpen weightsDeepSeek · DeepSeek | 87.1% | Independent | reasoningon | Partially comparable-9.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | mimo-v2-proClosedXiaomi | 87.0% | Independent | reasoningon | Partially comparable-9.29 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 72 | motif-0714ClosedMotif Technologies | 86.9% | Independent | reasoningon | Partially comparable-9.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | GLM 5.1Open weightsZ.ai (Zhipu AI) · GLM5.1 · best of 2 rows | 86.8% | Independent | reasoningon | Partially comparable-9.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 74 | Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 3 | 86.7% | Independent | reasoningon | Partially comparable-9.59 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | Claude Opus 4.5ClosedAnthropic · Claude · best of 2 rows | 86.6% | Independent | reasoningon | Partially comparable-9.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | MiMo-V2.5-ProOpen weightsXiaomi · best of 2 rows | 86.6% | Independent | reasoningon | Partially comparable-9.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 77 | apodex-1-1ClosedApodex | 86.4% | Independent | reasoningon | Partially comparable-9.90 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | Ling 3.0 Flash VLOpen weightsinclusionAI | 86.2% | Independent | reasoningon | Partially comparable-10.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | Qwen3 MaxClosedQwen · Qwen3 · best of 2 rows | 86.1% | Independent | reasoningon | Partially comparable-10.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 80 | GPT-5.1-CodexClosedOpenAI · GPT 5.1 | 86.0% | Independent | reasoning_efforthigh | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 81 | GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 85.9% | Independent | reasoningon | Partially comparable-10.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 82 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 2 rows | 85.8% | Independent | reasoningon | Partially comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 2 rows | 85.7% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 2 rows | 85.7% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | a-x-k2Open weightsSK Telecom | 85.7% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | ring-2-6-1tOpen weightsinclusionAI | 85.7% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | solar-open2-250bOpen weightsUpstage · Solar | 85.7% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | KAT-Coder-Pro V2ClosedKwaipilot | 85.5% | Independent | reasoningoff | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | Ling 3.0 FlashOpen weightsinclusionAI | 85.5% | Independent | reasoningon | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | mimo-v2-omni-0327ClosedXiaomi | 85.5% | Independent | reasoningon | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 91 | gpt-5ClosedOpenAI · GPT 5 · best of 4 rows | 85.3% | Independent | reasoning_efforthigh | Partially comparable-10.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 92 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 2 rows | 85.3% | Independent | reasoningon | Partially comparable-11.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | MiMo-V2.5Open weightsXiaomi | 85.0% | Independent | reasoningon | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | nanbeige4-1-3bOpen weightsNanbeige | 85.0% | Independent | reasoningon | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | MiniMax M2.5Open weightsMiniMax · MiniMax | 84.8% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 96 | GLM 5 TurboClosedZ.ai (Zhipu AI) · GLM5 | 84.8% | Independent | reasoningon | Partially comparable-11.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 96 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 2 rows | 84.8% | Independent | reasoningon | Partially comparable-11.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 98 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 | 84.7% | Independent | reasoningon | Partially comparable-11.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 98 | mimo-v2-flashOpen weightsXiaomi · best of 2 rows | 84.7% | Independent | reasoningon | Partially comparable-11.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 2 rows | 84.5% | Independent | reasoningon | Partially comparable-11.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →