GPQA Diamond
graduate-level science questions — the 198-question Diamond subset (expert-validated, non-expert-failed)
Updated 7 h ago · first seen 12 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,227
- Models
- 459
- Current leader
- gpt-6-astra 96.3%
Score history · Muse Glimmer 30B 2 rows
- Muse Glimmer 30B
- 83.54%aa_slug=muse-glimmer · variant=Diamond · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 83.54%aa_slug=muse-glimmer · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · variant=GPQA Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra OpenAI Independent11 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent11 Sept 2026
- 95.0%gpt-6-astra OpenAI Independent11 Sept 2026
- 93.9%gpt-6-astra OpenAI Independent11 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent11 Sept 2026
- 91.9%Claude Opus 5 Anthropic Independent11 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 459 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 200 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 73.3% | Independent | reasoningon | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | apriel-v1-6-15b-thinkerOpen weightsServiceNow | 73.3% | Independent | group defaults | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | hypernova-60bOpen weightsMultiverse Computing | 73.3% | Independent | group defaults | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 204 | quasar-438bClosedMultiverse Computing | 73.2% | Independent | group defaults | Partially comparable-0.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 205 | llama-3-1-nemotron-ultra-253b-v1-reasoningOpen weightsNVIDIA · Llama 3.1 | 72.8% | Independent | group defaults | Partially comparable-0.50 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | Grok Build 0.1ClosedxAI · Grok | 72.7% | Independent | group defaults | Partially comparable-0.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | Hermes 4 405BOpen weightsNous Research · Hermes 4 | 72.7% | Independent | group defaults | Partially comparable-0.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 208 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed | 72.6% | Independent | group defaults | Partially comparable-0.70 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 208 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 72.6% | Independent | reasoningon | Partially comparable-0.70 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 210 | ring-flash-2-0Open weightsinclusionAI | 72.5% | Independent | group defaults | Partially comparable-0.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 211 | Solar Pro 3ClosedUpstage · Solar | 72.4% | Independent | group defaults | Partially comparable-0.91 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 212 | midm-250-pro-rsnsftClosedKorea Telecom | 72.2% | Independent | group defaults | Partially comparable-1.11 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 213 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 72.0% | Independent | reasoningon | Partially comparable-1.31 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 214 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 71.9% | Independent | group defaults | Partially comparable-1.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 214 | ling-1tOpen weightsinclusionAI | 71.9% | Independent | group defaults | Partially comparable-1.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 216 | deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek · DeepSeek | 71.7% | Independent | group defaults | Partially comparable-1.61 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 217 | deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek · DeepSeek | 71.6% | Independent | group defaults | Partially comparable-1.71 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 218 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 71.3% | Independent | group defaults | Partially comparable-2.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 218 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models | 71.3% | Independent | group defaults | Partially comparable-2.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 220 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 70.9% | Independent | reasoningon | Partially comparable-2.42 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 221 | deepseek-r1-0120Open weightsDeepSeek · DeepSeek | 70.8% | Independent | group defaults | Partially comparable-2.52 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 222 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 2 rows | 70.7% | Independent | reasoningon | Partially comparable-2.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 223 | minicpm5-2bOpen weightsOpenBMB | 70.2% | Independent | group defaults | Partially comparable-3.13 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 224 | claude-4-opusClosedAnthropic · Claude 4 | 70.1% | Independent | group defaults | Partially comparable-3.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 224 | gemini-2.0-flash-thinking-exp-01-21ClosedGoogle · Gemini 2.0 | 70.1% | Independent | group defaults | Partially comparable-3.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 224 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom | 70.1% | Independent | group defaults | Partially comparable-3.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 227 | qwen3-235b-a22b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 70% | Independent | reasoningon | Partially comparable-3.33 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 228 | Hermes-4-70BRestricted weightsNous Research · Hermes 4 | 69.9% | Independent | group defaults | Partially comparable-3.43 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 229 | gemini-2-5-flash-reasoning-04-2025ClosedGoogle · Gemini 2.5 | 69.8% | Independent | group defaults | Partially comparable-3.53 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 230 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax | 69.7% | Independent | group defaults | Partially comparable-3.63 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 231 | motif-2-12-7bClosedMotif Technologies | 69.5% | Independent | group defaults | Partially comparable-3.84 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 232 | grok-3ClosedSpaceXAI · Grok 3 | 69.3% | Independent | group defaults | Partially comparable-4.04 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 233 | step-3-vl-10bOpen weightsStepFun · Step3 | 69.0% | Independent | group defaults | Partially comparable-4.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 234 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows | 68.8% | Independent | group defaults | Partially comparable-4.54 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 235 | solar-pro-2ClosedUpstage · Solar · best of 2 rows | 68.7% | Independent | reasoningon | Partially comparable-4.64 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 236 | gpt-5-chatgptClosedOpenAI · GPT 5 | 68.6% | Independent | group defaults | Partially comparable-4.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 237 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 68.4% | Independent | group defaults | Partially comparable-4.95 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 238 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax | 68.2% | Independent | group defaults | Partially comparable-5.15 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 239 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 3 rows | 68.1% | Independent | group defaults | Partially comparable-5.25 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 240 | Mistral Large 3Open weightsMistral AI · Mistral | 68.0% | Independent | group defaults | Partially comparable-5.35 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 241 | magistral-mediumClosedMistral AI · Magistral | 67.9% | Independent | group defaults | Partially comparable-5.45 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows | 67.6% | Independent | group defaults | Partially comparable-5.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | jt-miniClosedChina Mobile | 67.6% | Independent | group defaults | Partially comparable-5.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 244 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 2 rows | 67.2% | Independent | reasoningon | Partially comparable-6.16 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 245 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 | 67.1% | Independent | group defaults | Partially comparable-6.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 246 | diffusiongemma-26b-a4bOpen weightsGoogle | 66.9% | Independent | group defaults | Partially comparable-6.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 247 | Qwen3 32BOpen weightsQwen · Qwen3 | 66.8% | Independent | group defaults | Partially comparable-6.56 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 248 | qwen3-4b-2507-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 66.7% | Independent | reasoningon | Partially comparable-6.66 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 249 | gpt-4.1ClosedOpenAI · GPT 4.1 | 66.6% | Independent | group defaults | Partially comparable-6.76 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 250 | gpt-4.1-miniClosedOpenAI · GPT 4.1 | 66.4% | Independent | group defaults | Partially comparable-6.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 251 | Magistral Small 1.2Open weightsMistral AI · Magistral | 66.3% | Independent | group defaults | Partially comparable-7.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 252 | falcon-h1r-7bOpen weightsTII UAE · Falcon | 66.1% | Independent | group defaults | Partially comparable-7.27 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 253 | ling-flash-2-0Open weightsinclusionAI | 65.7% | Independent | group defaults | Partially comparable-7.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 253 | solar-open-100b-reasoningOpen weightsUpstage · Solar | 65.7% | Independent | group defaults | Partially comparable-7.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 255 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 65.5% | Independent | group defaults | Partially comparable-7.88 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 255 | gpt-4o-chatgpt-03-25ClosedOpenAI · GPT 4 | 65.5% | Independent | group defaults | Partially comparable-7.88 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 257 | granite-4.2-30bOpen weightsIBM · Granite 4.2 | 64.4% | Independent | group defaults | Partially comparable-8.89 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 258 | llama-3-3-nemotron-super-49bOpen weightsNVIDIA · Llama 3.3 · best of 2 rows | 64.3% | Independent | reasoningon | Partially comparable-8.99 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 259 | magistral-smallOpen weightsMistral AI · Magistral | 64.1% | Independent | group defaults | Partially comparable-9.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 260 | gemini-2.0-flash-expClosedGoogle · Gemini 2.0 | 63.6% | Independent | group defaults | Partially comparable-9.69 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 260 | longcat-flash-liteOpen weightsLongCat | 63.6% | Independent | group defaults | Partially comparable-9.69 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 262 | sarvam-30bOpen weightsSarvam | 63.3% | Independent | group defaults | Partially comparable-10.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 263 | Granite 4.2 8BOpen weightsIBM · Granite 4.2 | 63.1% | Independent | group defaults | Partially comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 263 | celeris-1ClosedCeleris | 63.1% | Independent | group defaults | Partially comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 265 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 2 rows | 62.5% | Independent | group defaults | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | Gemini 2.0 FlashClosedGoogle · Gemini 2.0 | 62.3% | Independent | group defaults | Partially comparable-11.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | SonarClosedPerplexity AI · Sonar · best of 2 rows | 62.3% | Independent | reasoningon | Partially comparable-11.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 268 | gemini-2-0-pro-experimental-02-05ClosedGoogle · Gemini 2.0 | 62.2% | Independent | group defaults | Partially comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 269 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 61.8% | Independent | group defaults | Partially comparable-11.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 270 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 61.6% | Independent | reasoningon | Partially comparable-11.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 271 | DeepSeek-R1-Distill-Qwen-32BOpen weightsDeepSeek · Qwen | 61.5% | Independent | group defaults | Partially comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 271 | hyperclova-x-seed-think-32bOpen weightsNaver · Seed | 61.5% | Independent | group defaults | Partially comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 273 | DeepSeek-R1-0528-Qwen3-8BOpen weightsDeepSeek · Qwen3 | 61.2% | Independent | group defaults | Partially comparable-12.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 274 | olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 | 61.0% | Independent | group defaults | Partially comparable-12.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 275 | Qwen3 14BOpen weightsQwen · Qwen3 | 60.4% | Independent | group defaults | Partially comparable-12.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 276 | o1-miniClosedOpenAI · OpenAI o-series | 60.3% | Independent | group defaults | Partially comparable-13.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 277 | tri-21b-think-v0-5Open weightsTrillion Labs | 60.1% | Independent | group defaults | Partially comparable-13.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 278 | claude-35-sonnetClosedAnthropic · Claude 35 | 59.9% | Independent | group defaults | Partially comparable-13.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 279 | Devstral 2Open weightsMistral AI · Devstral 2 | 59.4% | Independent | group defaults | Partially comparable-13.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 279 | gemini-2-5-flash-04-2025ClosedGoogle · Gemini 2.5 | 59.4% | Independent | group defaults | Partially comparable-13.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 281 | QwQ-32BOpen weightsAlibaba Group · Qwen | 59.3% | Independent | group defaults | Partially comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 281 | ling-2-6-flashOpen weightsinclusionAI | 59.3% | Independent | group defaults | Partially comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 283 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 2 rows | 59.1% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 284 | Qwen3 8BOpen weightsQwen · Qwen3 | 58.9% | Independent | group defaults | Partially comparable-14.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 284 | gemini-1-5-proClosedGoogle · Gemini 1.5 | 58.9% | Independent | group defaults | Partially comparable-14.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 286 | Mistral Medium 3.1ClosedMistral AI · Mistral | 58.8% | Independent | group defaults | Partially comparable-14.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | Llama 4 ScoutRestricted weightsMeta AI · Llama 4 | 58.7% | Independent | group defaults | Partially comparable-14.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | qwen-2-5-maxClosedAlibaba Group · Qwen | 58.7% | Independent | group defaults | Partially comparable-14.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 289 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 58.1% | Independent | group defaults | Partially comparable-15.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 290 | Qwen3 VL 8B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 57.9% | Independent | reasoningon | Partially comparable-15.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | Mistral Medium 3ClosedMistral AI · Mistral | 57.8% | Independent | group defaults | Partially comparable-15.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | Sonar ProClosedPerplexity AI · Sonar | 57.8% | Independent | group defaults | Partially comparable-15.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | solar-pro-2-previewClosedUpstage · Solar · best of 2 rows | 57.8% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 294 | gemma-4-E4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 57.6% | Independent | group defaults | Partially comparable-15.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 295 | Phi 4Open weightsMicrosoft · Phi4 | 57.5% | Independent | group defaults | Partially comparable-15.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 296 | Ministral 3 14BOpen weightsMistral AI · Ministral 3 | 57.2% | Independent | group defaults | Partially comparable-16.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 296 | nvidia-nemotron-nano-12b-v2-vlOpen weightsNVIDIA · Nemotron · best of 2 rows | 57.2% | Independent | reasoningon | Partially comparable-16.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 298 | NVIDIA-Nemotron-Nano-9B-v2Open weightsNVIDIA · Nemotron · best of 2 rows | 57.0% | Independent | group defaults | Partially comparable-16.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 299 | nova-premierClosedAmazon Web Services · Nova | 56.9% | Independent | group defaults | Partially comparable-16.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 300 | ling-mini-2-0Open weightsinclusionAI | 56.2% | Independent | group defaults | Partially comparable-17.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →