MMMU-Pro
robust multimodal understanding (10-option, vision-only variants)
Updated 4 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 518
- Models
- 157
- Current leader
- gpt-6-astra 86.9%
Score history · GLM 4.6V 4 rows
- GLM 4.6V
- 42.2%aa_slug=glm-4-6v · evaluator=Artificial Analysis · reasoning=off · index_version=4.312 Sept 2026
- 48.55%aa_slug=glm-4-6v-reasoning · evaluator=Artificial Analysis · reasoning=on · index_version=4.312 Sept 2026
- 42.2%aa_slug=glm-4-6v · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 48.55%aa_slug=glm-4-6v-reasoning · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · evaluator=Artificial Analysis
6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 86.9%gpt-6-astra OpenAI Independent11 Sept 2026
- 86.4%gpt-6-astra OpenAI Independent11 Sept 2026
- 85.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 84.7%Gemini 3.7 Flash Google Independent11 Sept 2026
- 84.5%Gemini 3.8 Flash Google Independent11 Sept 2026
- 81.6%Claude Opus 5 Anthropic Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 157 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | gpt-6-astraClosedOpenAI · GPT 6 · best of 11 rows | 86.9% | Independent | reasoning_effortmax | leader | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 2 | Gemini 3.8 FlashClosedGoogle · Gemini 3.8 · best of 6 rows | 85.6% | Independent | reasoning_efforthigh | Partially comparable-1.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 3 | Gemini 3.7 FlashClosedGoogle · Gemini 3.7 · best of 6 rows | 85.5% | Independent | reasoning_efforthigh | Partially comparable-1.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Claude Opus 5ClosedAnthropic · Claude · best of 10 rows | 84.7% | Independent | reasoning_effortmax | Comparable-2.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 6 rows | 84.3% | Independent | reasoningon | Partially comparable-2.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 6 | gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 12 rows | 83.4% | Independent | reasoning_effortmax | Comparable-3.47 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 7 | Gemini 3.6 FlashClosedGoogle · Gemini 3.6 · best of 2 rows | 83.2% | Independent | reasoningon | Partially comparable-3.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 82.4% | Independent | reasoningon | Partially comparable-4.45 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | Qwen 3.8 MaxClosedQwen · Qwen3.8 · best of 2 rows | 82.3% | Independent | reasoningon | Partially comparable-4.57 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | Muse Spark 1.3ClosedMeta AI · best of 2 rows | 82.0% | Independent | reasoning_effortxhigh | Partially comparable-4.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 11 | gpt-5.5ClosedOpenAI · GPT 5.5 · best of 10 rows | 81.2% | Independent | reasoning_effortmedium | Partially comparable-5.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 12 rows | 80.7% | Independent | reasoning_effortmax | Comparable-6.19 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 13 | Kimi K3Open weightsMoonshot AI · Kimi · best of 4 rows | 80.5% | Independent | reasoning_effortmax | Comparable-6.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 13 | muse-sparkClosedMeta AI · best of 2 rows | 80.5% | Independent | reasoningon | Partially comparable-6.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 15 | Qwen 3.7 PlusClosedQwen · Qwen3.7 · best of 2 rows | 80.5% | Independent | reasoningon | Partially comparable-6.42 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 16 | Grok 4.5ClosedxAI · Grok · best of 2 rows | 80.4% | Independent | reasoning_efforthigh | Partially comparable-6.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 17 | gemini-3-proClosedGoogle · Gemini 3 · best of 2 rows | 80.2% | Independent | reasoning_efforthigh | Partially comparable-6.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Gemini 3 Flash PreviewClosedGoogle · Gemini 3 | 79.9% | Independent | group defaults | Partially comparable-6.94 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | gemini-3-flashClosedGoogle · Gemini 3 · best of 3 rows | 79.9% | Independent | reasoningon | Partially comparable-6.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 20 | Qwen3.8 FlashOpen weightsQwen · Qwen3.8 · best of 2 rows | 79.8% | Independent | reasoningon | Partially comparable-7.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 21 | Kimi K2.6Open weightsMoonshot AI · Kimi · best of 2 rows | 79.4% | Independent | reasoningon | Partially comparable-7.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | apodex-1-1ClosedApodex · best of 2 rows | 79.2% | Independent | reasoningon | Partially comparable-7.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 23 | Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.5 · best of 2 rows | 79.0% | Independent | reasoningon | Partially comparable-7.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | Ling 3.0 Flash VLOpen weightsinclusionAI · best of 2 rows | 79.0% | Independent | reasoningon | Partially comparable-7.92 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 25 | Claude Opus 4.7ClosedAnthropic · Claude · best of 4 rows | 78.8% | Independent | reasoning_effortmax | Comparable-8.04 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | MiniMax-M3Open weightsMiniMax · MiniMax · best of 2 rows | 78.5% | Independent | reasoningon | Partially comparable-8.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | gpt-5.6-lunaClosedOpenAI · GPT 5.6 · best of 12 rows | 78.5% | Independent | reasoning_effortxhigh | Partially comparable-8.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 28 | gpt-5.3-codexClosedOpenAI · GPT 5.3 · best of 2 rows | 78.5% | Independent | reasoning_effortxhigh | Partially comparable-8.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | gpt-5.4ClosedOpenAI · GPT 5.4 · best of 6 rows | 78.4% | Independent | reasoning_effortxhigh | Partially comparable-8.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 30 | Grok 4.3ClosedxAI · Grok · best of 8 rows | 78.1% | Independent | reasoning_efforthigh | Partially comparable-8.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | Qwen3.6 PlusClosedQwen · Qwen3.6 · best of 2 rows | 78.0% | Independent | reasoningon | Partially comparable-8.90 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | Claude Sonnet 5ClosedAnthropic · Claude · best of 4 rows | 77.3% | Independent | reasoning_effortmax | Comparable-9.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 4 rows | 77.3% | Independent | reasoningon | Partially comparable-9.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 34 | DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek · best of 2 rows | 77.0% | Independent | reasoning_effortmax | Comparable-9.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | grok-build-0-1-06-16ClosedSpaceXAI · Grok · best of 2 rows | 76.5% | Independent | reasoningon | Partially comparable-10.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 36 | GPT-5.2-CodexClosedOpenAI · GPT 5.2 · best of 2 rows | 76.3% | Independent | reasoning_effortxhigh | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 36 | Qwen3.8 27BOpen weightsQwen · Qwen3.8 · best of 8 rows | 76.3% | Independent | reasoning_effortxhigh | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 75.5% | Independent | reasoningon | Partially comparable-11.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 39 | gpt-5.1ClosedOpenAI · GPT 5.1 · best of 4 rows | 75.5% | Independent | reasoning_efforthigh | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | Claude Opus 4.6ClosedAnthropic · Claude · best of 4 rows | 75.4% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | MiMo-V2.5Open weightsXiaomi · best of 2 rows | 75.4% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | agnes-2-5-pro-betaClosedSapiens AI · best of 2 rows | 75.4% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 43 | Kimi K2.5Open weightsMoonshot AI · Kimi · best of 4 rows | 75.4% | Independent | reasoningon | Partially comparable-11.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 44 | Step 3.7 FlashOpen weightsStepFun · Step3.7 · best of 2 rows | 75.3% | Independent | reasoningon | Partially comparable-11.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 4 rows | 75.0% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 4 rows | 75.0% | Independent | reasoningon | Partially comparable-11.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 47 | Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 4 rows | 75.0% | Independent | reasoningon | Partially comparable-11.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 48 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 · best of 2 rows | 74.9% | Independent | reasoningon | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 49 | deepseek-v4-flash-visionClosedDeepSeek · DeepSeek · best of 2 rows | 74.8% | Independent | reasoning_effortmax | Comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 4 rows | 74.6% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 51 | Grok 4.20ClosedxAI · Grok · best of 3 rows | 74.6% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 51 | gpt-5.2ClosedOpenAI · GPT 5.2 · best of 4 rows | 74.6% | Independent | reasoning_effortmedium | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | Muse Glimmer 30BOpen weightsMeta AI · best of 2 rows | 74.3% | Independent | reasoning_efforthigh | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | gpt-5ClosedOpenAI · GPT 5 · best of 8 rows | 74.3% | Independent | reasoning_effortmedium | Partially comparable-12.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | Claude Opus 4.5ClosedAnthropic · Claude · best of 4 rows | 74.0% | Independent | reasoningon | Partially comparable-12.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | Inkling SmallOpen weightsThinking Machines · best of 2 rows | 74.0% | Independent | reasoningon | Partially comparable-12.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 57 | mimo-v2-omni-0327ClosedXiaomi · best of 2 rows | 73.9% | Independent | reasoningon | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 58 | GPT-5-CodexClosedOpenAI · GPT 5 · best of 2 rows | 73.8% | Independent | reasoning_efforthigh | Partially comparable-13.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 59 | InklingOpen weightsThinking Machines · best of 2 rows | 73.5% | Independent | reasoningon | Partially comparable-13.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 4 rows | 73.4% | Independent | reasoningon | Partially comparable-13.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 61 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 5 rows | 73.3% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 61 | gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 6 rows | 73.3% | Independent | reasoning_effortxhigh | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 63 | grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 4 rows | 73.2% | Independent | reasoningon | Partially comparable-13.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 6 rows | 73.1% | Independent | reasoningon | Partially comparable-13.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 65 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 72.8% | Independent | reasoningon | Partially comparable-14.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 4 rows | 72.7% | Independent | reasoningon | Partially comparable-14.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 67 | GPT-5.1-CodexClosedOpenAI · GPT 5.1 · best of 2 rows | 72.5% | Independent | reasoning_efforthigh | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 · best of 2 rows | 70.5% | Independent | reasoningoff | Partially comparable-16.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 69 | gpt-5-miniClosedOpenAI · GPT 5 · best of 6 rows | 70.1% | Independent | reasoning_efforthigh | Partially comparable-16.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 69 | o3ClosedOpenAI · OpenAI o-series · best of 2 rows | 70.1% | Independent | reasoningon | Partially comparable-16.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | mimo-v2-omniClosedXiaomi · best of 2 rows | 69.9% | Independent | reasoningon | Partially comparable-17.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 72 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 4 rows | 69.7% | Independent | reasoningon | Partially comparable-17.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 69.3% | Independent | reasoningon | Partially comparable-17.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 4 rows | 69.3% | Independent | reasoningon | Partially comparable-17.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | o4-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 69.3% | Independent | reasoning_efforthigh | Partially comparable-17.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 76 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 69.1% | Independent | reasoningon | Partially comparable-17.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 77 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 · best of 2 rows | 69.0% | Independent | reasoning_efforthigh | Partially comparable-17.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | grok-4ClosedSpaceXAI · Grok 4 · best of 2 rows | 68.8% | Independent | reasoningon | Partially comparable-18.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 4 rows | 68.7% | Independent | reasoningon | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 68.7% | Independent | reasoningon | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 81 | doubao-seed-codeClosedByteDance · Seed · best of 2 rows | 68.1% | Independent | reasoningon | Partially comparable-18.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 82 | Claude Opus 4.1ClosedAnthropic · Claude · best of 2 rows | 67.9% | Independent | reasoningon | Partially comparable-19.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 · best of 2 rows | 67.3% | Independent | reasoningon | Partially comparable-19.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 84 | diffusiongemma-26b-a4bOpen weightsGoogle · best of 2 rows | 66.5% | Independent | reasoningon | Partially comparable-20.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 4 rows | 65.4% | Independent | reasoningon | Partially comparable-21.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 6 rows | 65.4% | Independent | reasoning_effortxhigh | Partially comparable-21.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 87 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 5 rows | 65.0% | Independent | reasoningon | Partially comparable-21.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 87 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 3 rows | 65.0% | Independent | reasoningon | Partially comparable-21.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 89 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 64.9% | Independent | group defaults | Partially comparable-22.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 90 | Mistral Medium 3.5Open weightsMistral AI · Mistral · best of 2 rows | 64.9% | Independent | reasoningon | Partially comparable-22.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 91 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 · best of 2 rows | 64.7% | Independent | reasoningoff | Partially comparable-22.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 92 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 · best of 2 rows | 64.6% | Independent | reasoningon | Partially comparable-22.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 64.5% | Independent | reasoningonreasoning_effortmedium | Partially comparable-22.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 94 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 64.3% | Independent | reasoningoff | Partially comparable-22.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | jt-4-1-flash-236b-a21bClosedChina Mobile · best of 2 rows | 64.1% | Independent | reasoningoff | Partially comparable-22.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 96 | step-3-vl-10bOpen weightsStepFun · Step3 · best of 2 rows | 64.0% | Independent | reasoningon | Partially comparable-22.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 97 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 8 rows | 63.8% | Independent | reasoningonreasoning_efforthigh | Partially comparable-23.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 98 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 4 rows | 63.3% | Independent | reasoningon | Partially comparable-23.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 99 | command-a-plusOpen weightsCohere · Command · best of 2 rows | 63.2% | Independent | reasoningon | Partially comparable-23.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | Claude Sonnet 4ClosedAnthropic · Claude · best of 4 rows | 62.4% | Independent | reasoningoff | Partially comparable-24.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →