Updated 3 min ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 614
- Models
- 607
- Current leader
- —
Score history · qwen3-vl-8b-reasoning 1 row
Not enough history to chart — a single observation (57.88% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 57.88%aa_slug=qwen3-vl-8b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · variant=GPQA Diamond · evaluator=Artificial Analysis
9 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 96.3%gpt-6-astra-xhigh OpenAI Independent11 Sept 2026
- 96.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 95.3%Gemini 3.8 Flash Google Independent11 Sept 2026
- 95.0%gpt-6-astra-high OpenAI Independent11 Sept 2026
- 93.9%gpt-6-astra-medium OpenAI Independent11 Sept 2026
- 93.5%Kimi K3 Moonshot AI Independent11 Sept 2026
- 91.9%claude-opus-5-medium Anthropic Independent11 Sept 2026
- 79.1%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 607 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 301 | deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek | 71.7% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 302 | deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek | 71.6% | Independent | group defaults | Comparable-0.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 303 | gemma-4-26b-a4b-non-reasoningOpen weightsGoogle | 71.4% | Independent | group defaults | Comparable-0.31 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 304 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 71.3% | Independent | group defaults | Comparable-0.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 304 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models | 71.3% | Independent | group defaults | Comparable-0.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | Qwen3 VL 235B A22B InstructOpen weightsQwen | 71.2% | Independent | group defaults | Comparable-0.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | gpt-5-2-non-reasoningClosedOpenAI | 71.2% | Independent | group defaults | Comparable-0.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | qwen3-5-4b-non-reasoningOpen weightsAlibaba Group | 71.2% | Independent | group defaults | Comparable-0.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 309 | gemini-2-5-flash-lite-preview-09-2025-reasoningClosedGoogle | 70.9% | Independent | group defaults | Comparable-0.81 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 310 | deepseek-r1-0120Open weightsDeepSeek | 70.8% | Independent | group defaults | Comparable-0.91 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 311 | qwen3-30b-a3b-2507-reasoningOpen weightsAlibaba Group | 70.7% | Independent | group defaults | Comparable-1.01 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 312 | minicpm5-2bOpen weightsOpenBMB | 70.2% | Independent | group defaults | Comparable-1.52 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | claude-4-opusClosedAnthropic | 70.1% | Independent | group defaults | Comparable-1.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | gemini-2.0-flash-thinking-exp-01-21ClosedGoogle | 70.1% | Independent | group defaults | Comparable-1.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom | 70.1% | Independent | group defaults | Comparable-1.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | qwen3-235b-a22b-instruct-reasoningOpen weightsAlibaba Group | 70% | Independent | group defaults | Comparable-1.72 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 317 | Hermes-4-70BOpen weightsNous Research | 69.9% | Independent | group defaults | Comparable-1.82 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 317 | nova-2-0-omni-reasoning-lowClosedAmazon Web Services | 69.9% | Independent | group defaults | Comparable-1.82 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 319 | gemini-2-5-flash-reasoning-04-2025ClosedGoogle | 69.8% | Independent | group defaults | Comparable-1.92 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 319 | nova-2-0-lite-reasoning-lowClosedAmazon Web Services | 69.8% | Independent | group defaults | Comparable-1.92 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 321 | MiniMax-M1-80kOpen weightsMiniMax | 69.7% | Independent | group defaults | Comparable-2.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 322 | Qwen3 VL 30B A3B InstructOpen weightsQwen | 69.5% | Independent | group defaults | Comparable-2.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 322 | k-exaone-non-reasoningOpen weightsLG AI Research | 69.5% | Independent | group defaults | Comparable-2.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 322 | motif-2-12-7bClosedMotif Technologies | 69.5% | Independent | group defaults | Comparable-2.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 325 | grok-3ClosedSpaceXAI | 69.3% | Independent | group defaults | Comparable-2.43 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 326 | step-3-vl-10bOpen weightsStepFun | 69.0% | Independent | group defaults | Comparable-2.73 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 327 | gpt-oss-20bOpen weightsOpenAI | 68.8% | Independent | group defaults | Comparable-2.93 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 328 | gpt-5-mini-minimalClosedOpenAI | 68.7% | Independent | group defaults | Comparable-3.03 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 328 | solar-pro-2-reasoningClosedUpstage | 68.7% | Independent | group defaults | Comparable-3.03 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 330 | glm-5-2-non-reasoningOpen weightsZ.ai (Zhipu AI) | 68.6% | Independent | group defaults | Comparable-3.13 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 330 | gpt-5-chatgptClosedOpenAI | 68.6% | Independent | group defaults | Comparable-3.13 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 332 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) · best of 2 rows | 68.4% | Independent | group defaults | Comparable-3.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 333 | Claude Sonnet 4ClosedAnthropic · Claude | 68.3% | Independent | group defaults | Comparable-3.44 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 333 | Gemini 2.5 FlashClosedGoogle · Gemini | 68.3% | Independent | group defaults | Comparable-3.44 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 335 | MiniMax-M1-40kOpen weightsMiniMax | 68.2% | Independent | group defaults | Comparable-3.54 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 336 | k2-v2Open weightsMBZUAI Institute of Foundation Models | 68.1% | Independent | group defaults | Comparable-3.64 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 337 | Mistral Large 3Open weightsMistral AI | 68.0% | Independent | group defaults | Comparable-3.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 338 | magistral-mediumClosedMistral AI | 67.9% | Independent | group defaults | Comparable-3.84 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 339 | gpt-5-nanoClosedOpenAI | 67.6% | Independent | group defaults | Comparable-4.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 339 | jt-miniClosedChina Mobile | 67.6% | Independent | group defaults | Comparable-4.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 341 | gpt-5-minimalClosedOpenAI | 67.3% | Independent | group defaults | Comparable-4.45 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 342 | claude-4-5-haiku-reasoningClosedAnthropic | 67.2% | Independent | group defaults | Comparable-4.55 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 342 | gpt-oss-120b-lowOpen weightsOpenAI | 67.2% | Independent | group defaults | Comparable-4.55 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | Llama 4 MaverickOpen weightsMeta AI | 67.1% | Independent | group defaults | Comparable-4.65 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | Qwen3 VL 32B InstructOpen weightsQwen | 67.1% | Independent | group defaults | Comparable-4.65 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 346 | gpt-5-nano-mediumClosedOpenAI | 67.0% | Independent | group defaults | Comparable-4.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 347 | diffusiongemma-26b-a4bOpen weightsGoogle | 66.9% | Independent | group defaults | Comparable-4.85 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 348 | Qwen3 32BOpen weightsQwen | 66.8% | Independent | group defaults | Comparable-4.95 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 349 | qwen3-4b-2507-instruct-reasoningOpen weightsAlibaba Group | 66.7% | Independent | group defaults | Comparable-5.05 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | glm-5-non-reasoningOpen weightsZ.ai (Zhipu AI) | 66.6% | Independent | group defaults | Comparable-5.15 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | gpt-4.1ClosedOpenAI | 66.6% | Independent | group defaults | Comparable-5.15 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 352 | glm-4-7-non-reasoningOpen weightsZ.ai (Zhipu AI) | 66.4% | Independent | group defaults | Comparable-5.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 352 | gpt-4.1-miniClosedOpenAI | 66.4% | Independent | group defaults | Comparable-5.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 354 | Magistral Small 1.2Open weightsMistral AI | 66.3% | Independent | group defaults | Comparable-5.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 355 | falcon-h1r-7bOpen weightsTII UAE | 66.1% | Independent | group defaults | Comparable-5.66 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 355 | gemma-4-12b-non-reasoningOpen weightsGoogle | 66.1% | Independent | group defaults | Comparable-5.66 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 357 | qwen3-30b-a3b-2507Open weightsAlibaba Group | 65.9% | Independent | group defaults | Comparable-5.86 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | grok-4-3-non-reasoningClosedSpaceXAI | 65.8% | Independent | group defaults | Comparable-5.96 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 359 | ling-flash-2-0Open weightsinclusionAI | 65.7% | Independent | group defaults | Comparable-6.06 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 359 | solar-open-100b-reasoningOpen weightsUpstage | 65.7% | Independent | group defaults | Comparable-6.06 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 361 | Claude 3.7 SonnetClosedAnthropic · Claude | 65.6% | Independent | group defaults | Comparable-6.16 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 361 | mimo-v2-flashOpen weightsXiaomi | 65.6% | Independent | group defaults | Comparable-6.16 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 363 | DeepSeek V3 0324Open sourceDeepSeek · DeepSeek-V3 | 65.5% | Independent | group defaults | Comparable-6.27 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 363 | gpt-4o-chatgpt-03-25ClosedOpenAI | 65.5% | Independent | group defaults | Comparable-6.27 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 365 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle | 65.0% | Independent | group defaults | Comparable-6.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 366 | Claude Haiku 4.5ClosedAnthropic · Claude | 64.7% | Independent | group defaults | Comparable-7.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 367 | gpt-5-6-luna-non-reasoningClosedOpenAI | 64.5% | Independent | group defaults | Comparable-7.17 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 368 | granite-4.2-30bOpen weightsIBM | 64.4% | Independent | group defaults | Comparable-7.28 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 369 | gpt-5-1-non-reasoningClosedOpenAI | 64.3% | Independent | group defaults | Comparable-7.38 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 369 | llama-3-3-nemotron-super-49b-reasoningOpen weightsNVIDIA | 64.3% | Independent | group defaults | Comparable-7.38 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 371 | magistral-smallOpen weightsMistral AI | 64.1% | Independent | group defaults | Comparable-7.58 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 372 | grok-4-1-fastClosedSpaceXAI | 63.7% | Independent | group defaults | Comparable-7.98 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | gemini-2.0-flash-expClosedGoogle | 63.6% | Independent | group defaults | Comparable-8.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | longcat-flash-liteOpen weightsLongCat | 63.6% | Independent | group defaults | Comparable-8.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 373 | nova-2-0-proClosedAmazon Web Services | 63.6% | Independent | group defaults | Comparable-8.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 376 | sarvam-30bOpen weightsSarvam | 63.3% | Independent | group defaults | Comparable-8.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 377 | GLM 4.6Open weightsZ.ai (Zhipu AI) | 63.2% | Independent | group defaults | Comparable-8.49 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | Granite 4.2 8BOpen weightsIBM | 63.1% | Independent | group defaults | Comparable-8.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | celeris-1ClosedCeleris | 63.1% | Independent | group defaults | Comparable-8.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 380 | exaone-4-0-32bOpen weightsLG AI Research | 62.8% | Independent | group defaults | Comparable-8.89 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 381 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini · best of 2 rows | 62.5% | Independent | group defaults | Comparable-9.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 382 | Gemini 2.0 FlashClosedGoogle · Gemini | 62.3% | Independent | group defaults | Comparable-9.40 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 382 | sonar-reasoningClosedPerplexity AI | 62.3% | Independent | group defaults | Comparable-9.40 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 384 | gemini-2-0-pro-experimental-02-05ClosedGoogle | 62.2% | Independent | group defaults | Comparable-9.50 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 385 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group | 62.0% | Independent | group defaults | Comparable-9.70 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 386 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 61.8% | Independent | group defaults | Comparable-9.90 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 387 | qwen3-30b-a3b-instruct-reasoningOpen weightsAlibaba Group | 61.6% | Independent | group defaults | Comparable-10.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 388 | DeepSeek-R1-Distill-Qwen-32BOpen weightsDeepSeek | 61.5% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 388 | hyperclova-x-seed-think-32bOpen weightsNaver | 61.5% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 390 | qwen3-235b-a22b-instructOpen weightsAlibaba Group | 61.3% | Independent | group defaults | Comparable-10.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 391 | DeepSeek-R1-0528-Qwen3-8BOpen weightsDeepSeek | 61.2% | Independent | group defaults | Comparable-10.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 392 | gpt-oss-20b-lowOpen weightsOpenAI | 61.1% | Independent | group defaults | Comparable-10.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 393 | olmo-3-32b-thinkOpen weightsAllen Institute for AI | 61.0% | Independent | group defaults | Comparable-10.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 394 | gpt-5-4-mini-non-reasoningClosedOpenAI | 60.6% | Independent | group defaults | Comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 394 | grok-4-fastClosedSpaceXAI | 60.6% | Independent | group defaults | Comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 396 | Qwen3 14BOpen weightsQwen | 60.4% | Independent | group defaults | Comparable-11.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 397 | nova-2-0-liteClosedAmazon Web Services | 60.3% | Independent | group defaults | Comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 397 | o1-miniClosedOpenAI | 60.3% | Independent | group defaults | Comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 399 | tri-21b-think-v0-5Open weightsTrillion Labs | 60.1% | Independent | group defaults | Comparable-11.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 400 | claude-35-sonnetClosedAnthropic | 59.9% | Independent | group defaults | Comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →