GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 5 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Frontier over time · accuracy · variant=Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent12 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent12 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent12 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent12 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent12 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent12 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 440 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 301 | qwen3-4b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 52.2% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 302 | GPT-4o (2024-08-06)ClosedOpenAI · GPT 4 | 52.1% | Independent | reasoningoff | Partially comparable-0.10 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 303 | Olmo-3-7B-ThinkOpen weightsAllen Institute for AI · OLMo 3 | 51.6% | Independent | reasoningon | Partially comparable-0.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 303 | Qwen3 Coder 30B A3B InstructOpen weightsQwen · Qwen3 | 51.6% | Independent | reasoningoff | Partially comparable-0.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 303 | tulu3-405bOpen weightsAllen Institute for AI | 51.6% | Independent | reasoningoff | Partially comparable-0.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | Llama-3.1-405BRestricted weightsMeta AI · Llama 3.1 | 51.5% | Independent | reasoningoff | Partially comparable-0.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | exaone-4-0-1-2bOpen weightsLG AI Research · EXAONE 4.0 · best of 2 rows | 51.5% | Independent | reasoningon | Partially comparable-0.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 308 | LFM2.5-8B-A1BOpen weightsLiquid AI · LFM2.5 | 51.3% | Independent | reasoningon | Partially comparable-0.91 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 308 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 | 51.3% | Independent | reasoningon | Partially comparable-0.91 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 310 | gpt-4.1-nanoClosedOpenAI · GPT 4.1 | 51.2% | Independent | reasoningoff | Partially comparable-1.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 311 | gpt-4o-chatgptClosedOpenAI · GPT 4 | 51.1% | Independent | reasoningoff | Partially comparable-1.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 312 | grok-2Open weightsxAI · Grok 2 | 51.0% | Independent | reasoningoff | Partially comparable-1.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | Mistral Small 3.2Open weightsMistral AI · Mistral | 50.5% | Independent | reasoningoff | Partially comparable-1.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | Pixtral LargeOpen weightsMistral AI · Pixtral | 50.5% | Independent | reasoningoff | Partially comparable-1.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 315 | nova-proClosedAmazon Web Services · Nova | 49.9% | Independent | reasoningoff | Partially comparable-2.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | Llama 3.3 70BOpen weightsMeta AI · Llama 3.3 | 49.8% | Independent | reasoningoff | Partially comparable-2.42 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 317 | Qwen3-VL-4B-InstructOpen weightsQwen · Qwen3 · best of 2 rows | 49.4% | Independent | reasoningon | Partially comparable-2.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 318 | devstral-mediumClosedMistral AI · Devstral | 49.2% | Independent | reasoningoff | Partially comparable-3.03 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 319 | Qwen2.5 72B InstructOpen weightsQwen · Qwen2.5 | 49.1% | Independent | reasoningoff | Partially comparable-3.13 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 320 | claude-3-opusClosedAnthropic · Claude 3 | 48.9% | Independent | reasoningoff | Partially comparable-3.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 321 | mistral-large-2Open weightsMistral AI · Mistral | 48.6% | Independent | reasoningoff | Partially comparable-3.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 322 | deepseek-r1-distill-qwen-14bOpen weightsDeepSeek · Qwen | 48.4% | Independent | reasoningon | Partially comparable-3.84 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 323 | granite-4.1-30bOpen weightsIBM · Granite 4.1 | 48.1% | Independent | reasoningoff | Partially comparable-4.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 324 | lfm2-24b-a2bOpen weightsLiquid AI · LFM2 | 47.4% | Independent | reasoningoff | Partially comparable-4.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 325 | Mistral Large 2.0Open weightsMistral AI · Mistral | 47.2% | Independent | reasoningoff | Partially comparable-5.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 326 | Ministral 3 8BOpen weightsMistral AI · Ministral 3 | 47.1% | Independent | reasoningoff | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 326 | grok-betaClosedSpaceXAI · Grok | 47.1% | Independent | reasoningoff | Partially comparable-5.15 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 328 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 | 46.9% | Independent | reasoningon | Partially comparable-5.35 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 329 | qwen2.5-32b-instructOpen weightsAlibaba Group · Qwen2.5 | 46.6% | Independent | reasoningoff | Partially comparable-5.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 330 | llama-3-1-nemotron-instruct-70bOpen weightsNVIDIA · Llama 3.1 | 46.5% | Independent | reasoningoff | Partially comparable-5.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 331 | gemini-1-5-flashClosedGoogle · Gemini 1.5 | 46.3% | Independent | reasoningoff | Partially comparable-5.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 332 | Mistral Small 3Open weightsMistral AI · Mistral | 46.2% | Independent | reasoningoff | Partially comparable-6.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 333 | Qwen3.5-2BOpen weightsQwen · Qwen3.5 · best of 2 rows | 45.6% | Independent | reasoningon | Partially comparable-6.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 334 | Mistral Small 3.1Open weightsMistral AI · Mistral | 45.4% | Independent | reasoningoff | Partially comparable-6.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 335 | g9v3-3bOpen weightsAI9Stars | 43.8% | Independent | reasoningon | Partially comparable-8.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 336 | Devstral Small 1.0Open weightsMistral AI · Devstral | 43.4% | Independent | reasoningoff | Partially comparable-8.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 337 | gemma-4-E2BOpen weightsGoogle · Gemma 4 · best of 2 rows | 43.3% | Independent | reasoningon | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 337 | granite-4.1-8bOpen weightsIBM · Granite 4.1 | 43.3% | Independent | reasoningoff | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 337 | nova-liteClosedAmazon Web Services · Nova | 43.3% | Independent | reasoningoff | Partially comparable-8.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 340 | llama-3-2-instruct-90b-visionOpen weightsMeta AI · Llama 3.2 | 43.2% | Independent | reasoningoff | Partially comparable-8.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 341 | Gemma 3 27BOpen weightsGoogle · Gemma 3 | 42.8% | Independent | reasoningoff | Partially comparable-9.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 342 | jamba-1-5-largeOpen weightsAI21 Labs · Jamba 1.5 | 42.7% | Independent | reasoningoff | Partially comparable-9.49 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 343 | gpt-4o-miniClosedOpenAI · GPT 4 | 42.6% | Independent | reasoningoff | Partially comparable-9.59 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | Molmo2-8BOpen weightsAllen Institute for AI | 42.5% | Independent | reasoningoff | Partially comparable-9.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 345 | Mistral SabaClosedMistral AI · Mistral | 42.4% | Independent | reasoningoff | Partially comparable-9.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 346 | deepseek-v2-5Open weightsDeepSeek · DeepSeek | 42.3% | Independent | reasoningoff | Partially comparable-9.90 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 347 | Qwen2.5 Coder 32B InstructOpen weightsQwen · Qwen2.5 | 41.7% | Independent | reasoningoff | Partially comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 348 | granite-4-0-h-smallOpen weightsIBM · Granite 4.0 | 41.6% | Independent | reasoningoff | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 348 | sarvam-m-reasoningOpen weightsSarvam | 41.6% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | devstral-smallOpen weightsMistral AI · Devstral | 41.4% | Independent | reasoningoff | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 351 | Kimi-Linear-48B-A3B-InstructOpen weightsMoonshot AI · Kimi | 41.2% | Independent | reasoningoff | Partially comparable-11.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 352 | qwen-turboClosedAlibaba Group · Qwen | 41.0% | Independent | reasoningoff | Partially comparable-11.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 353 | Llama-3.1-70BOpen weightsMeta AI · Llama 3.1 | 40.9% | Independent | reasoningoff | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 354 | Claude Haiku 3.5ClosedAnthropic · Claude | 40.8% | Independent | reasoningoff | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 354 | llama-3-1-nemotron-nano-4b-reasoningOpen weightsNVIDIA · Llama 3.1 | 40.8% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 356 | R1 Distill Llama 70BOpen weightsDeepSeek · Llama | 40.2% | Independent | reasoningon | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 357 | Hermes 3 70B InstructOpen weightsNous Research · Hermes 3 | 40.1% | Independent | reasoningoff | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | Olmo-3-7B-InstructOpen weightsAllen Institute for AI · OLMo 3 | 40% | Independent | reasoningoff | Partially comparable-12.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | claude-3-sonnetClosedAnthropic · Claude 3 | 40% | Independent | reasoningoff | Partially comparable-12.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 360 | jamba-1-7-largeOpen weightsAI21 Labs · Jamba 1.7 | 39.0% | Independent | reasoningoff | Partially comparable-13.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 361 | jamba-1-6-largeOpen weightsAI21 Labs · Jamba 1.6 | 38.7% | Independent | reasoningoff | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 362 | deephermes-3-mistral-24b-previewOpen weightsNous Research · Mistral | 38.2% | Independent | reasoningoff | Partially comparable-14.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 363 | mistral-smallOpen weightsMistral AI · Mistral | 38.1% | Independent | reasoningoff | Partially comparable-14.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 364 | llama-3-instruct-70bOpen weightsMeta AI · Llama 3 | 37.9% | Independent | reasoningoff | Partially comparable-14.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 365 | Claude 3 HaikuClosedAnthropic · Claude | 37.4% | Independent | reasoningoff | Partially comparable-14.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 366 | gemini-1-5-pro-may-2024ClosedGoogle · Gemini 1.5 | 37.1% | Independent | reasoningoff | Partially comparable-15.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 366 | qwen2-72b-instructOpen weightsAlibaba Group · Qwen2 | 37.1% | Independent | reasoningoff | Partially comparable-15.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 368 | gemini-1-5-flash-8bClosedGoogle · Gemini 1.5 | 35.9% | Independent | reasoningoff | Partially comparable-16.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 369 | Ministral 3 3BOpen weightsMistral AI · Ministral 3 | 35.8% | Independent | reasoningoff | Partially comparable-16.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 369 | nova-microClosedAmazon Web Services · Nova | 35.8% | Independent | reasoningoff | Partially comparable-16.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 371 | qwen3-1.7b-instructOpen weightsAlibaba Group · Qwen3.1 · best of 2 rows | 35.6% | Independent | reasoningon | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 372 | Mistral LargeClosedMistral AI · Mistral | 35.0% | Independent | reasoningoff | Partially comparable-17.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | Gemma 3 12BOpen weightsGoogle · Gemma 3 | 35.0% | Independent | reasoningoff | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | gpt-4ClosedOpenAI · GPT 4 | 35.0% | Independent | reasoningoff | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | mistral-mediumClosedMistral AI · Mistral | 35.0% | Independent | reasoningoff | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 376 | claude-2ClosedAnthropic · Claude 2 | 34.4% | Independent | reasoningoff | Partially comparable-17.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 376 | lfm2-8b-a1bOpen weightsLiquid AI · LFM2 | 34.4% | Independent | reasoningoff | Partially comparable-17.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | Qwen2.5-Coder-7BOpen weightsQwen · Qwen2.5 | 33.9% | Independent | reasoningoff | Partially comparable-18.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | lfm2-5-1-2b-thinkingOpen weightsLiquid AI · LFM2.5 | 33.9% | Independent | reasoningon | Partially comparable-18.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 380 | granite-3-3-8b-instructOpen weightsIBM · Granite 3.3 | 33.8% | Independent | reasoningoff | Partially comparable-18.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 381 | Granite 4.0 MicroOpen weightsIBM · Granite 4.0 | 33.6% | Independent | reasoningoff | Partially comparable-18.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 382 | jamba-reasoning-3bOpen weightsAI21 Labs · Jamba | 33.3% | Independent | reasoningon | Partially comparable-18.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 383 | Mixtral 8x22BOpen weightsMistral AI · Mixtral 8 | 33.2% | Independent | reasoningoff | Partially comparable-19.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 384 | dbrxOpen weightsDatabricks | 33.1% | Independent | reasoningoff | Partially comparable-19.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 384 | phi-4-miniOpen weightsMicrosoft · Phi4 | 33.1% | Independent | reasoningoff | Partially comparable-19.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 386 | claude-instantClosedAnthropic · Claude | 33.0% | Independent | reasoningoff | Partially comparable-19.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 387 | olmo-2-32bOpen weightsAllen Institute for AI · OLMo 2 | 32.8% | Independent | reasoningoff | Partially comparable-19.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 388 | lfm-40bClosedLiquid AI · LFM | 32.7% | Independent | reasoningoff | Partially comparable-19.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 388 | llama-2-chat-70bOpen weightsMeta AI · Llama 2 | 32.7% | Independent | reasoningoff | Partially comparable-19.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 390 | LFM2.5-1.2B-InstructOpen weightsLiquid AI · LFM2.5 | 32.6% | Independent | reasoningoff | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 391 | gemini-1-5-flash-may-2024ClosedGoogle · Gemini 1.5 | 32.4% | Independent | reasoningoff | Partially comparable-19.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 392 | command-r-plus-04-2024Open weightsCohere · Command | 32.3% | Independent | reasoningoff | Partially comparable-19.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 393 | jamba-1-7-miniOpen weightsAI21 Labs · Jamba 1.7 | 32.2% | Independent | reasoningoff | Partially comparable-20.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 394 | llama-2-chat-13bOpen weightsMeta AI · Llama 2 | 32.1% | Independent | reasoningoff | Partially comparable-20.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 395 | claude-21ClosedAnthropic · Claude 21 | 31.9% | Independent | reasoningoff | Partially comparable-20.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 395 | deepseek-coder-v2-liteOpen weightsDeepSeek · DeepSeek | 31.9% | Independent | reasoningoff | Partially comparable-20.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 395 | phi-3-miniOpen weightsMicrosoft · Phi3 | 31.9% | Independent | reasoningoff | Partially comparable-20.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 398 | phi-4-multimodalOpen weightsMicrosoft · Phi4 | 31.5% | Independent | reasoningoff | Partially comparable-20.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 399 | granite-4.1-3bOpen weightsIBM · Granite 4.1 | 31.4% | Independent | reasoningoff | Partially comparable-20.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 400 | lfm2-2-6bOpen weightsLiquid AI · LFM2.2 | 30.6% | Independent | reasoningoff | Partially comparable-21.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →