Updated 2 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,639
- Models
- 376
- Current leader
- gpt-5.6-sol 65.9%
Score history · gpt-oss-20b 8 rows
- gpt-oss-20b
- 4.55%aa_slug=gpt-oss-20b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 10.61%aa_slug=gpt-oss-20b · variant=hard · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 13.86%aa_slug=gpt-oss-20b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 0%aa_slug=gpt-oss-20b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 4.55%aa_slug=gpt-oss-20b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 10.61%aa_slug=gpt-oss-20b · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 13.86%aa_slug=gpt-oss-20b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 0%aa_slug=gpt-oss-20b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · variant=hard · evaluator=Artificial Analysis
10 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 65.9%gpt-5.6-sol OpenAI Independent11 Sept 2026
- 61.4%gpt-5.6-sol OpenAI Independent11 Sept 2026
- 53.0%Claude Sonnet 4.6 Anthropic Independent11 Sept 2026
- 51.5%Claude Opus 4.7 Anthropic Independent11 Sept 2026
- 50.8%Z.ai GLM 5.2 Z.ai (Zhipu AI) Independent11 Sept 2026
- 49.2%KAT-Coder-Pro V2 Kwaipilot Independent11 Sept 2026
- 33.3%GPT-5.1-Codex Mini OpenAI Independent11 Sept 2026
- 26.5%Grok 4.3 xAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 317 models · trust independent-evaluator
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 100 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 25% | Independent | reasoningoff | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | command-a-plusOpen weightsCohere · Command · best of 2 rows | 25% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 25% | Independent | group defaults | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 · best of 2 rows | 25% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 · best of 2 rows | 24.2% | Independent | reasoningon | Partially comparable-0.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Qwen3 MaxClosedQwen · Qwen3 · best of 4 rows | 24.2% | Independent | reasoningon | Partially comparable-0.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 4 rows | 24.2% | Independent | reasoningon | Partially comparable-0.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 4 rows | 24.2% | Independent | reasoningon | Partially comparable-0.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 6 rows | 24.2% | Independent | reasoningonreasoning_effortmedium | Partially comparable-0.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | Kimi K2 0905Open weightsMoonshot AI · Kimi · best of 2 rows | 23.5% | Independent | reasoningoff | Partially comparable-1.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 4 rows | 23.5% | Independent | reasoning_efforthigh | Partially comparable-1.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | hypernova-60bOpen weightsMultiverse Computing · best of 2 rows | 23.5% | Independent | reasoning_efforthigh | Partially comparable-1.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | Trinity Large ThinkingOpen weightsArcee AI · best of 2 rows | 22.7% | Independent | reasoningon | Partially comparable-2.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 4 rows | 22.7% | Independent | reasoningon | Partially comparable-2.27 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 22.0% | Independent | reasoningon | Partially comparable-3.03 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows | 22.0% | Independent | reasoningon | Partially comparable-3.03 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 4 rows | 21.2% | Independent | reasoningoff | Partially comparable-3.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | ling-2-6-flashOpen weightsinclusionAI · best of 2 rows | 21.2% | Independent | reasoningoff | Partially comparable-3.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron · best of 2 rows | 21.2% | Independent | reasoningon | Partially comparable-3.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 · best of 2 rows | 21.2% | Independent | reasoningoff | Partially comparable-3.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 20.4% | Independent | reasoningon | Partially comparable-4.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 · best of 2 rows | 20.4% | Independent | reasoningon | Partially comparable-4.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | qwen3-max-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 19.7% | Independent | reasoningoff | Partially comparable-5.30 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | Devstral 2Open weightsMistral AI · Devstral 2 · best of 2 rows | 18.9% | Independent | reasoningoff | Partially comparable-6.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 4 rows | 18.9% | Independent | reasoningon | Partially comparable-6.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder · best of 2 rows | 18.9% | Independent | reasoningoff | Partially comparable-6.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | Qwen3 Coder NextOpen weightsQwen · Qwen3 · best of 2 rows | 18.2% | Independent | reasoningoff | Partially comparable-6.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 4 rows | 18.2% | Independent | reasoningon | Partially comparable-6.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 4 rows | 18.2% | Independent | reasoningon | Partially comparable-6.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | jt-miniClosedChina Mobile · best of 2 rows | 18.2% | Independent | reasoningoff | Partially comparable-6.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | Grok Build 0.1ClosedxAI · Grok · best of 2 rows | 17.4% | Independent | reasoningon | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | Mistral Small 4Open weightsMistral AI · Mistral · best of 4 rows | 17.4% | Independent | reasoningon | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 6 rows | 17.4% | Independent | reasoning_effortmedium | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 · best of 2 rows | 17.4% | Independent | reasoningonreasoning_efforthigh | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 8 rows | 17.4% | Independent | reasoningonreasoning_effortmedium | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 17.4% | Independent | reasoningon | Partially comparable-7.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Devstral Small 2Open weightsMistral AI · Devstral · best of 2 rows | 16.7% | Independent | reasoningoff | Partially comparable-8.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito · best of 2 rows | 16.7% | Independent | reasoningon | Partially comparable-8.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 6 rows | 16.7% | Independent | reasoningon | Partially comparable-8.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 16.7% | Independent | group defaults | Partially comparable-8.33 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | Kimi K2 0711Open weightsMoonshot AI · Kimi · best of 2 rows | 15.9% | Independent | reasoningoff | Partially comparable-9.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | Mistral Large 3Open weightsMistral AI · Mistral · best of 2 rows | 15.9% | Independent | reasoningoff | Partially comparable-9.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 · best of 2 rows | 15.9% | Independent | reasoningon | Partially comparable-9.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 15.2% | Independent | reasoningoff | Partially comparable-9.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 4 rows | 15.2% | Independent | reasoningoff | Partially comparable-9.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | Qwen3 Coder 30B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 15.2% | Independent | reasoningoff | Partially comparable-9.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | o4-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 15.2% | Independent | reasoning_efforthigh | Partially comparable-9.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 4 rows | 14.4% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | apriel-v1-6-15b-thinkerOpen weightsServiceNow · best of 2 rows | 14.4% | Independent | reasoningon | Partially comparable-10.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 13.6% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 4 rows | 13.6% | Independent | reasoningon | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | gpt-4.1ClosedOpenAI · GPT 4.1 · best of 2 rows | 13.6% | Independent | reasoningoff | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 5 rows | 12.9% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | Magistral Medium 1.2ClosedMistral AI · Magistral · best of 2 rows | 12.9% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 3 rows | 12.9% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | gpt-5-chatgptClosedOpenAI · GPT 5 · best of 2 rows | 12.9% | Independent | reasoningoff | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | o1ClosedOpenAI · OpenAI o-series · best of 2 rows | 12.9% | Independent | reasoningon | Partially comparable-12.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | hyperclova-x-seed-think-32bOpen weightsNaver · Seed · best of 2 rows | 12.1% | Independent | reasoningon | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | Hermes 4 405BOpen weightsNous Research · Hermes 4 | 11.4% | Independent | group defaults | Partially comparable-13.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | Kimi-Linear-48B-A3B-InstructOpen weightsMoonshot AI · Kimi · best of 2 rows | 11.4% | Independent | reasoningoff | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 11.4% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | grok-3ClosedSpaceXAI · Grok 3 · best of 2 rows | 11.4% | Independent | reasoningoff | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | hermes-4-llama-3-1-405bOpen weightsNous Research · Llama 3.1 · best of 3 rows | 11.4% | Independent | reasoningon | Partially comparable-13.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | Mistral Medium 3.1ClosedMistral AI · Mistral · best of 2 rows | 10.6% | Independent | reasoningoff | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | apriel-v1-5-15b-thinkerOpen weightsServiceNow · best of 2 rows | 10.6% | Independent | reasoningon | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 4 rows | 10.6% | Independent | reasoning_efforthigh | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | ling-1tOpen weightsinclusionAI · best of 2 rows | 10.6% | Independent | reasoningoff | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | ling-flash-2-0Open weightsinclusionAI · best of 2 rows | 10.6% | Independent | reasoningoff | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | longcat-flash-liteOpen weightsLongCat · best of 2 rows | 10.6% | Independent | reasoningoff | Partially comparable-14.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 9.85% | Independent | reasoningon | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 6 rows | 9.85% | Independent | reasoning_efforthigh | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | devstral-mediumClosedMistral AI · Devstral · best of 2 rows | 9.09% | Independent | reasoningoff | Partially comparable-15.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | intellect-3Open weightsPrime Intellect · best of 2 rows | 9.09% | Independent | reasoningon | Partially comparable-15.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | kat-coder-pro-v1ClosedKwaiKAT · best of 2 rows | 9.09% | Independent | reasoningoff | Partially comparable-15.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | magistral-mediumClosedMistral AI · Magistral · best of 2 rows | 9.09% | Independent | reasoningon | Partially comparable-15.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | GPT-4o (2024-08-06)ClosedOpenAI · GPT 4 · best of 2 rows | 8.33% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 8.33% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | gemma-4-E4BOpen weightsGoogle · Gemma 4 · best of 4 rows | 8.33% | Independent | reasoningon | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | gpt-4oClosedOpenAI · GPT 4 · best of 2 rows | 8.33% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 8.33% | Independent | reasoningon | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 · best of 2 rows | 8.33% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | Mistral Small 3.1Open weightsMistral AI · Mistral · best of 2 rows | 7.58% | Independent | reasoningoff | Partially comparable-17.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | Solar Pro 3ClosedUpstage · Solar · best of 2 rows | 7.58% | Independent | reasoningon | Partially comparable-17.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | gpt-4.1-miniClosedOpenAI · GPT 4.1 · best of 2 rows | 7.58% | Independent | reasoningoff | Partially comparable-17.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | ring-flash-2-0Open weightsinclusionAI · best of 2 rows | 7.58% | Independent | reasoningon | Partially comparable-17.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 4 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 · best of 2 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Llama-3.1-405BRestricted weightsMeta AI · Llama 3.1 · best of 2 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Mistral Small 3.2Open weightsMistral AI · Mistral · best of 2 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed · best of 2 rows | 6.82% | Independent | reasoningon | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models · best of 2 rows | 6.82% | Independent | reasoningon | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 6 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | nova-premierClosedAmazon Web Services · Nova · best of 2 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 6.82% | Independent | reasoningon | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | o3-miniClosedOpenAI · OpenAI o-series · best of 4 rows | 6.82% | Independent | reasoningon | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 6.82% | Independent | reasoningoff | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | ring-1tOpen weightsinclusionAI · best of 2 rows | 6.82% | Independent | reasoningon | Partially comparable-18.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Devstral Small 1.0Open weightsMistral AI · Devstral · best of 2 rows | 6.06% | Independent | reasoningoff | Partially comparable-18.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 6.06% | Independent | reasoningoff | Partially comparable-18.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | deepseek-r1-0120Open weightsDeepSeek · DeepSeek · best of 2 rows | 6.06% | Independent | reasoningon | Partially comparable-18.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →