GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 4 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Frontier over time · accuracy · variant=Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent12 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent12 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent12 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent12 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent12 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 440 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 200 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 72.6% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 202 | ring-flash-2-0Open weightsinclusionAI | 72.5% | Independent | reasoningon | Partially comparable-0.10 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 203 | Solar Pro 3ClosedUpstage · Solar | 72.4% | Independent | reasoningon | Partially comparable-0.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 204 | midm-250-pro-rsnsftClosedKorea Telecom | 72.2% | Independent | reasoningon | Partially comparable-0.41 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 205 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 72.0% | Independent | reasoningon | Partially comparable-0.61 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 71.9% | Independent | reasoningon | Partially comparable-0.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | ling-1tOpen weightsinclusionAI | 71.9% | Independent | reasoningoff | Partially comparable-0.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 208 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 71.3% | Independent | reasoningon | Partially comparable-1.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 208 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models | 71.3% | Independent | reasoningon | Partially comparable-1.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 210 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 3 rows | 70.9% | Independent | reasoningon | Partially comparable-1.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 211 | deepseek-r1-0120Open weightsDeepSeek · DeepSeek | 70.8% | Independent | reasoningon | Partially comparable-1.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 212 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 2 rows | 70.7% | Independent | reasoningon | Partially comparable-1.92 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 213 | minicpm5-2bOpen weightsOpenBMB | 70.2% | Independent | reasoningon | Partially comparable-2.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 214 | gemini-2.0-flash-thinking-exp-01-21ClosedGoogle · Gemini 2.0 | 70.1% | Independent | reasoningon | Partially comparable-2.53 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 214 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom | 70.1% | Independent | reasoningon | Partially comparable-2.53 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 216 | qwen3-235b-a22b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 70% | Independent | reasoningon | Partially comparable-2.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 217 | hermes-4-llama-3-1-70bOpen weightsNous Research · Llama 3.1 · best of 2 rows | 69.9% | Independent | reasoningon | Partially comparable-2.73 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 218 | gemini-2-5-flash-reasoning-04-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 69.8% | Independent | reasoningon | Partially comparable-2.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 219 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax | 69.7% | Independent | reasoningon | Partially comparable-2.93 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 220 | motif-2-12-7bClosedMotif Technologies | 69.5% | Independent | reasoningon | Partially comparable-3.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 221 | grok-3ClosedSpaceXAI · Grok 3 | 69.3% | Independent | reasoningoff | Partially comparable-3.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 222 | step-3-vl-10bOpen weightsStepFun · Step3 | 69.0% | Independent | reasoningon | Partially comparable-3.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 223 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows | 68.8% | Independent | reasoning_efforthigh | Partially comparable-3.84 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 224 | solar-pro-2ClosedUpstage · Solar · best of 3 rows | 68.7% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 225 | gpt-5-chatgptClosedOpenAI · GPT 5 | 68.6% | Independent | reasoningoff | Partially comparable-4.04 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 226 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 68.4% | Independent | reasoningon | Partially comparable-4.25 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 227 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax | 68.2% | Independent | reasoningon | Partially comparable-4.45 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 228 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 3 rows | 68.1% | Independent | reasoning_efforthigh | Partially comparable-4.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 229 | Mistral Large 3Open weightsMistral AI · Mistral | 68.0% | Independent | reasoningoff | Partially comparable-4.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 230 | magistral-mediumClosedMistral AI · Magistral | 67.9% | Independent | reasoningon | Partially comparable-4.75 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 231 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows | 67.6% | Independent | reasoning_efforthigh | Partially comparable-5.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 231 | jt-miniClosedChina Mobile | 67.6% | Independent | reasoningoff | Partially comparable-5.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 233 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 2 rows | 67.2% | Independent | reasoningon | Partially comparable-5.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 234 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 | 67.1% | Independent | reasoningoff | Partially comparable-5.56 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 235 | diffusiongemma-26b-a4bOpen weightsGoogle | 66.9% | Independent | reasoningon | Partially comparable-5.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 236 | qwen3-32b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 66.8% | Independent | reasoningon | Partially comparable-5.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 237 | qwen3-4b-2507-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 66.7% | Independent | reasoningon | Partially comparable-5.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 238 | gpt-4.1ClosedOpenAI · GPT 4.1 | 66.6% | Independent | reasoningoff | Partially comparable-6.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 239 | gpt-4.1-miniClosedOpenAI · GPT 4.1 | 66.4% | Independent | reasoningoff | Partially comparable-6.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 240 | Magistral Small 1.2Open weightsMistral AI · Magistral | 66.3% | Independent | reasoningon | Partially comparable-6.37 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 241 | falcon-h1r-7bOpen weightsTII UAE · Falcon | 66.1% | Independent | reasoningon | Partially comparable-6.57 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | ling-flash-2-0Open weightsinclusionAI | 65.7% | Independent | reasoningoff | Partially comparable-6.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | solar-open-100b-reasoningOpen weightsUpstage · Solar | 65.7% | Independent | reasoningon | Partially comparable-6.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 244 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 65.5% | Independent | reasoningoff | Partially comparable-7.18 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 244 | gpt-4o-chatgpt-03-25ClosedOpenAI · GPT 4 | 65.5% | Independent | reasoningoff | Partially comparable-7.18 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 246 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 | 65.0% | Independent | reasoningoff | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 247 | granite-4.2-30bOpen weightsIBM · Granite 4.2 | 64.4% | Independent | reasoningon | Partially comparable-8.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 248 | llama-3-3-nemotron-super-49bOpen weightsNVIDIA · Llama 3.3 · best of 2 rows | 64.3% | Independent | reasoningon | Partially comparable-8.29 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 249 | magistral-smallOpen weightsMistral AI · Magistral | 64.1% | Independent | reasoningon | Partially comparable-8.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 250 | gemini-2.0-flash-expClosedGoogle · Gemini 2.0 | 63.6% | Independent | reasoningoff | Partially comparable-8.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 250 | longcat-flash-liteOpen weightsLongCat | 63.6% | Independent | reasoningoff | Partially comparable-8.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 252 | sarvam-30bOpen weightsSarvam | 63.3% | Independent | reasoning_efforthigh | Partially comparable-9.30 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 253 | Granite 4.2 8BOpen weightsIBM · Granite 4.2 | 63.1% | Independent | reasoningon | Partially comparable-9.50 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 253 | celeris-1ClosedCeleris | 63.1% | Independent | reasoningoff | Partially comparable-9.50 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 255 | Gemini 2.0 FlashClosedGoogle · Gemini 2.0 | 62.3% | Independent | reasoningoff | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 255 | SonarClosedPerplexity AI · Sonar · best of 2 rows | 62.3% | Independent | reasoningon | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 257 | gemini-2-0-pro-experimental-02-05ClosedGoogle · Gemini 2.0 | 62.2% | Independent | reasoningoff | Partially comparable-10.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 258 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 61.8% | Independent | reasoningoff | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 259 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 61.6% | Independent | reasoningon | Partially comparable-11.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 260 | DeepSeek-R1-Distill-Qwen-32BOpen weightsDeepSeek · Qwen | 61.5% | Independent | reasoningon | Partially comparable-11.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 260 | hyperclova-x-seed-think-32bOpen weightsNaver · Seed | 61.5% | Independent | reasoningon | Partially comparable-11.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 262 | DeepSeek-R1-0528-Qwen3-8BOpen weightsDeepSeek · Qwen3 | 61.2% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 263 | olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 | 61.0% | Independent | reasoningon | Partially comparable-11.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 264 | qwen3-14b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 60.4% | Independent | reasoningon | Partially comparable-12.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 265 | o1-miniClosedOpenAI · OpenAI o-series | 60.3% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | tri-21b-think-v0-5Open weightsTrillion Labs | 60.1% | Independent | reasoningon | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 267 | claude-35-sonnetClosedAnthropic · Claude 35 | 59.9% | Independent | reasoningoff | Partially comparable-12.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 268 | Devstral 2Open weightsMistral AI · Devstral 2 | 59.4% | Independent | reasoningoff | Partially comparable-13.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 269 | QwQ-32BOpen weightsAlibaba Group · Qwen | 59.3% | Independent | reasoningon | Partially comparable-13.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 269 | ling-2-6-flashOpen weightsinclusionAI | 59.3% | Independent | reasoningoff | Partially comparable-13.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 271 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 2 rows | 59.1% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 272 | gemini-1-5-proClosedGoogle · Gemini 1.5 | 58.9% | Independent | reasoningoff | Partially comparable-13.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 272 | qwen3-8b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 58.9% | Independent | reasoningon | Partially comparable-13.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 274 | Mistral Medium 3.1ClosedMistral AI · Mistral | 58.8% | Independent | reasoningoff | Partially comparable-13.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 275 | Llama 4 ScoutOpen weightsMeta AI · Llama 4 | 58.7% | Independent | reasoningoff | Partially comparable-13.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 275 | qwen-2-5-maxClosedAlibaba Group · Qwen | 58.7% | Independent | reasoningoff | Partially comparable-13.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 277 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 58.1% | Independent | reasoningon | Partially comparable-14.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 278 | Qwen3 VL 8B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 57.9% | Independent | reasoningon | Partially comparable-14.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 279 | Mistral Medium 3ClosedMistral AI · Mistral | 57.8% | Independent | reasoningoff | Partially comparable-14.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 279 | Sonar ProClosedPerplexity AI · Sonar | 57.8% | Independent | reasoningoff | Partially comparable-14.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 281 | gemma-4-E4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 57.6% | Independent | reasoningon | Partially comparable-15.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 282 | Phi 4Open weightsMicrosoft · Phi4 | 57.5% | Independent | reasoningoff | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 283 | Ministral 3 14BOpen weightsMistral AI · Ministral 3 | 57.2% | Independent | reasoningoff | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 283 | nvidia-nemotron-nano-12b-v2-vlOpen weightsNVIDIA · Nemotron · best of 2 rows | 57.2% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 285 | NVIDIA-Nemotron-Nano-9B-v2Open weightsNVIDIA · Nemotron · best of 2 rows | 57.0% | Independent | reasoningon | Partially comparable-15.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 286 | nova-premierClosedAmazon Web Services · Nova | 56.9% | Independent | reasoningoff | Partially comparable-15.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | ling-mini-2-0Open weightsinclusionAI | 56.2% | Independent | reasoningoff | Partially comparable-16.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 288 | claude-35-sonnet-june-24ClosedAnthropic · Claude 35 | 56.0% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 289 | granite-4.2-3bOpen weightsIBM · Granite 4.2 | 55.9% | Independent | reasoningon | Partially comparable-16.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 290 | LFM2.5-2.6B (free)Open weightsLiquid AI · LFM2.5 | 55.8% | Independent | reasoningon | Partially comparable-16.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | QwQ-32B-PreviewOpen weightsAlibaba Group · Qwen | 55.7% | Independent | reasoningon | Partially comparable-17.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 292 | solar-pro-2-previewClosedUpstage · Solar | 54.4% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 293 | gpt-4oClosedOpenAI · GPT 4 | 54.3% | Independent | reasoningoff | Partially comparable-18.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 294 | gemini-2-0-flash-lite-previewClosedGoogle · Gemini 2.0 | 54.2% | Independent | reasoningoff | Partially comparable-18.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 295 | tri-21b-think-previewOpen weightsTrillion Labs | 53.8% | Independent | reasoningon | Partially comparable-18.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 296 | gemini-2-0-flash-lite-001ClosedGoogle · Gemini 2.0 | 53.5% | Independent | reasoningoff | Partially comparable-19.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 297 | Devstral Small 2Open weightsMistral AI · Devstral | 53.2% | Independent | reasoningoff | Partially comparable-19.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 298 | Reka Flash 3Open weightsrekaai | 52.9% | Independent | reasoningon | Partially comparable-19.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 299 | Command AOpen weightsCohere · Command | 52.7% | Independent | reasoningoff | Partially comparable-19.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 300 | GPT-4o (2024-05-13)ClosedOpenAI · GPT 4 | 52.6% | Independent | reasoningoff | Partially comparable-20.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →