Updated 5 h ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 1,217
- Models
- 453
- Current leader
- Claude Fable 5.1 59.1%
Frontier over time · accuracy · evaluator=Artificial Analysis
9 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 59.1%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 58.7%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 55.9%Claude Fable 5.1 Anthropic Independent11 Sept 2026
- 55.5%Claude Fable 5 Anthropic Independent11 Sept 2026
- 53.1%gpt-6-astra OpenAI Independent11 Sept 2026
- 52.7%gpt-6-astra OpenAI Independent11 Sept 2026
- 51.3%Claude Opus 5 Anthropic Independent11 Sept 2026
- 11.0%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 453 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 201 | Qwen3 Coder NextOpen weightsQwen · Qwen3 · best of 2 rows | 10.2% | Independent | reasoningoff | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 201 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 10.2% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 201 | qwen3-max-previewClosedAlibaba Group · Qwen3 · best of 2 rows | 10.2% | Independent | reasoningoff | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 204 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models · best of 2 rows | 10.1% | Independent | reasoningon | Partially comparable-0.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 205 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 4 rows | 9.92% | Independent | reasoningon | Partially comparable-0.23 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | Mistral Small 4Open weightsMistral AI · Mistral · best of 4 rows | 9.87% | Independent | reasoningon | Partially comparable-0.28 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 206 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed · best of 2 rows | 9.87% | Independent | reasoningon | Partially comparable-0.28 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 208 | magistral-mediumClosedMistral AI · Magistral · best of 2 rows | 9.82% | Independent | reasoningon | Partially comparable-0.33 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 209 | Granite 4.2 8BOpen weightsIBM · Granite 4.2 · best of 2 rows | 9.68% | Independent | reasoningon | Partially comparable-0.47 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 210 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 4 rows | 9.67% | Independent | reasoningon | Partially comparable-0.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 211 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 4 rows | 9.64% | Independent | reasoningon | Partially comparable-0.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 211 | ring-flash-2-0Open weightsinclusionAI · best of 2 rows | 9.64% | Independent | reasoningon | Partially comparable-0.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 213 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 6 rows | 9.50% | Independent | reasoning_efforthigh | Partially comparable-0.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 214 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 6 rows | 9.41% | Independent | reasoningonreasoning_effortmedium | Partially comparable-0.74 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 215 | ling-3-0-tinyOpen weightsinclusionAI · best of 2 rows | 9.31% | Independent | reasoningon | Partially comparable-0.84 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 216 | midm-250-pro-rsnsftClosedKorea Telecom · best of 2 rows | 9.08% | Independent | reasoningon | Partially comparable-1.07 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 217 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 9.04% | Independent | group defaults | Partially comparable-1.11 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 218 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 4 rows | 8.94% | Independent | reasoningon | Partially comparable-1.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 218 | minicpm5-2bOpen weightsOpenBMB · best of 2 rows | 8.94% | Independent | reasoningon | Partially comparable-1.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 220 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax · best of 2 rows | 8.90% | Independent | reasoningon | Partially comparable-1.25 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 221 | Hermes-4-70BRestricted weightsNous Research · Hermes 4 | 8.76% | Independent | group defaults | Partially comparable-1.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 221 | hermes-4-llama-3-1-70bOpen weightsNous Research · Llama 3.1 · best of 3 rows | 8.76% | Independent | reasoningon | Partially comparable-1.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 221 | motif-2-12-7bClosedMotif Technologies · best of 2 rows | 8.76% | Independent | reasoningon | Partially comparable-1.39 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 224 | ling-2-6-1tOpen weightsinclusionAI · best of 2 rows | 8.71% | Independent | reasoningoff | Partially comparable-1.44 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 225 | deepseek-r1-0120Open weightsDeepSeek · DeepSeek · best of 2 rows | 8.50% | Independent | reasoningon | Partially comparable-1.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 226 | deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek · DeepSeek | 8.25% | Independent | group defaults | Partially comparable-1.90 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 227 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom · best of 2 rows | 8.06% | Independent | reasoningon | Partially comparable-2.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 228 | Grok Build 0.1ClosedxAI · Grok · best of 2 rows | 8.02% | Independent | reasoningon | Partially comparable-2.13 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 229 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax · best of 2 rows | 7.83% | Independent | reasoningon | Partially comparable-2.32 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 230 | deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek · DeepSeek | 7.78% | Independent | group defaults | Partially comparable-2.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 231 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows | 7.60% | Independent | reasoningon | Partially comparable-2.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 231 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 · best of 2 rows | 7.60% | Independent | reasoningoff | Partially comparable-2.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 233 | magistral-smallOpen weightsMistral AI · Magistral · best of 2 rows | 7.55% | Independent | reasoningon | Partially comparable-2.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 234 | sarvam-30bOpen weightsSarvam · best of 2 rows | 7.51% | Independent | reasoning_efforthigh | Partially comparable-2.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 235 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 7.46% | Independent | reasoningon | Partially comparable-2.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 236 | Kimi K2 0711Open weightsMoonshot AI · Kimi · best of 2 rows | 7.41% | Independent | reasoningoff | Partially comparable-2.74 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 236 | Qwen3 32BOpen weightsQwen · Qwen3 | 7.41% | Independent | group defaults | Partially comparable-2.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 236 | qwen3-32b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows | 7.41% | Independent | reasoningon | Partially comparable-2.74 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 239 | llama-3-1-nemotron-ultra-253b-v1-reasoningOpen weightsNVIDIA · Llama 3.1 · best of 2 rows | 7.38% | Independent | reasoningon | Partially comparable-2.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 240 | solar-pro-2ClosedUpstage · Solar · best of 5 rows | 7.37% | Independent | reasoningon | Partially comparable-2.78 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 241 | QwQ-32BOpen weightsAlibaba Group · Qwen · best of 2 rows | 7.35% | Independent | reasoningon | Partially comparable-2.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | ling-1tOpen weightsinclusionAI · best of 2 rows | 7.32% | Independent | reasoningoff | Partially comparable-2.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 242 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA · Llama · best of 4 rows | 7.32% | Independent | reasoningon | Partially comparable-2.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 244 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows | 7.04% | Independent | reasoningon | Partially comparable-3.11 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 245 | o1ClosedOpenAI · OpenAI o-series · best of 2 rows | 7.01% | Independent | reasoningon | Partially comparable-3.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 246 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 5 rows | 6.95% | Independent | reasoningon | Partially comparable-3.20 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 246 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 3 rows | 6.95% | Independent | reasoningon | Partially comparable-3.20 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 246 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 6.95% | Independent | reasoningonreasoning_effortmedium | Partially comparable-3.20 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 249 | LFM2.5-8B-A1BOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 6.86% | Independent | reasoningon | Partially comparable-3.29 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 250 | celeris-1ClosedCeleris · best of 2 rows | 6.81% | Independent | reasoningoff | Partially comparable-3.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 251 | LFM2.5-1.2B-InstructOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 6.72% | Independent | reasoningoff | Partially comparable-3.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 252 | gpt-5-chatgptClosedOpenAI · GPT 5 · best of 2 rows | 6.63% | Independent | reasoningoff | Partially comparable-3.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 252 | granite-4.2-3bOpen weightsIBM · Granite 4.2 · best of 2 rows | 6.63% | Independent | reasoningon | Partially comparable-3.52 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 254 | Sonar ProClosedPerplexity AI · Sonar · best of 2 rows | 6.55% | Independent | reasoningoff | Partially comparable-3.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 255 | minicpm5-1bOpen weightsOpenBMB · best of 4 rows | 6.49% | Independent | reasoningon | Partially comparable-3.66 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 256 | Magistral Small 1.2Open weightsMistral AI · Magistral · best of 2 rows | 6.44% | Independent | reasoningon | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 256 | granite-4-0-h-350mOpen weightsIBM · Granite 4.0 · best of 2 rows | 6.44% | Independent | reasoningoff | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 256 | jt-35b-flashClosedChina Mobile · best of 2 rows | 6.44% | Independent | reasoningoff | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 256 | jt-miniClosedChina Mobile · best of 2 rows | 6.44% | Independent | reasoningoff | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 256 | olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows | 6.44% | Independent | reasoningon | Partially comparable-3.71 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 261 | Kimi K2 0905Open weightsMoonshot AI · Kimi · best of 2 rows | 6.39% | Independent | reasoningoff | Partially comparable-3.76 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 262 | gemini-2.0-flash-thinking-exp-01-21ClosedGoogle · Gemini 2.0 · best of 2 rows | 6.35% | Independent | reasoningon | Partially comparable-3.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 263 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 4 rows | 6.30% | Independent | reasoningon | Partially comparable-3.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 264 | ling-2-6-flashOpen weightsinclusionAI · best of 2 rows | 6.26% | Independent | reasoningoff | Partially comparable-3.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 264 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 3 rows | 6.26% | Independent | reasoningon | Partially comparable-3.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | LFM2.5-2.6B (free)Open weightsLiquid AI · LFM2.5 · best of 2 rows | 6.21% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | lfm2-5-1-2b-thinkingOpen weightsLiquid AI · LFM2.5 · best of 2 rows | 6.21% | Independent | reasoningon | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 266 | ling-flash-2-0Open weightsinclusionAI · best of 2 rows | 6.21% | Independent | reasoningoff | Partially comparable-3.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 269 | gemini-2-0-pro-experimental-02-05ClosedGoogle · Gemini 2.0 · best of 2 rows | 6.19% | Independent | reasoningoff | Partially comparable-3.96 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 270 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 6.16% | Independent | reasoningon | Partially comparable-3.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 270 | qwen3-4b-2507-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows | 6.16% | Independent | reasoningon | Partially comparable-3.99 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 272 | solar-pro-2-previewClosedUpstage · Solar · best of 3 rows | 6.07% | Independent | reasoningon | Partially comparable-4.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 273 | Olmo-3-7B-ThinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows | 5.98% | Independent | reasoningon | Partially comparable-4.17 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 273 | exaone-4-0-1-2bOpen weightsLG AI Research · EXAONE 4.0 · best of 4 rows | 5.98% | Independent | reasoningon | Partially comparable-4.17 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 275 | DeepSeek-R1-0528-Qwen3-8BOpen weightsDeepSeek · Qwen3 · best of 2 rows | 5.93% | Independent | reasoningon | Partially comparable-4.22 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 275 | tri-21b-think-v0-5Open weightsTrillion Labs · best of 2 rows | 5.93% | Independent | reasoningon | Partially comparable-4.22 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 277 | longcat-flash-liteOpen weightsLongCat · best of 2 rows | 5.84% | Independent | reasoningoff | Partially comparable-4.31 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 278 | Olmo-3-7B-InstructOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows | 5.79% | Independent | reasoningoff | Partially comparable-4.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 278 | tri-21b-think-previewOpen weightsTrillion Labs · best of 2 rows | 5.79% | Independent | reasoningon | Partially comparable-4.36 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 280 | Qwen3-0.6BOpen weightsQwen · Qwen3.0 | 5.64% | Independent | group defaults | Partially comparable-4.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 280 | qwen3-0.6b-instructOpen weightsAlibaba Group · Qwen3.0 · best of 3 rows | 5.64% | Independent | reasoningon | Partially comparable-4.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 282 | llama-3-3-nemotron-super-49bOpen weightsNVIDIA · Llama 3.3 · best of 4 rows | 5.62% | Independent | reasoningon | Partially comparable-4.53 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 283 | LFM2-1.2BOpen weightsLiquid AI · LFM2.1 · best of 2 rows | 5.56% | Independent | reasoningoff | Partially comparable-4.59 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 284 | llama-3-2-instruct-11b-visionOpen weightsMeta AI · Llama 3.2 · best of 2 rows | 5.53% | Independent | reasoningoff | Partially comparable-4.62 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 285 | granite-4-0-350mOpen weightsIBM · Granite 4.0 · best of 2 rows | 5.51% | Independent | reasoningoff | Partially comparable-4.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 285 | nvidia-nemotron-nano-12b-v2-vlOpen weightsNVIDIA · Nemotron · best of 4 rows | 5.51% | Independent | reasoningon | Partially comparable-4.64 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | apertus-70b-instructOpen weightsSwiss AI Initiative · best of 2 rows | 5.47% | Independent | reasoningoff | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | hyperclova-x-seed-think-32bOpen weightsNaver · Seed · best of 2 rows | 5.47% | Independent | reasoningon | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 287 | lfm2-2-6bOpen weightsLiquid AI · LFM2.2 · best of 2 rows | 5.47% | Independent | reasoningoff | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 290 | Llama-3.2-1BRestricted weightsMeta AI · Llama 3.2 · best of 2 rows | 5.46% | Independent | reasoningoff | Partially comparable-4.69 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | Ministral 3 3BOpen weightsMistral AI · Ministral 3 · best of 2 rows | 5.38% | Independent | reasoningoff | Partially comparable-4.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 291 | olmo-2-7bOpen weightsAllen Institute for AI · OLMo 2 · best of 2 rows | 5.38% | Independent | reasoningoff | Partially comparable-4.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 293 | deepseek-coder-v2-liteOpen weightsDeepSeek · DeepSeek · best of 2 rows | 5.36% | Independent | reasoningoff | Partially comparable-4.79 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 294 | Llama-3.2-3BRestricted weightsMeta AI · Llama 3.2 · best of 2 rows | 5.35% | Independent | reasoningoff | Partially comparable-4.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 295 | gemma-3-1bOpen weightsGoogle · Gemma 3 · best of 2 rows | 5.33% | Independent | reasoningoff | Partially comparable-4.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 295 | llama-2-chat-7bOpen weightsMeta AI · Llama 2 · best of 2 rows | 5.33% | Independent | reasoningoff | Partially comparable-4.82 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 297 | qwen3-1.7b-instructOpen weightsAlibaba Group · Qwen3.1 · best of 4 rows | 5.32% | Independent | reasoningoff | Partially comparable-4.83 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 298 | Gemma 3 4BRestricted weightsGoogle · Gemma 3 · best of 2 rows | 5.29% | Independent | reasoningoff | Partially comparable-4.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 298 | Llama 3.1 8BRestricted weightsMeta AI · Llama 3.1 · best of 2 rows | 5.29% | Independent | reasoningoff | Partially comparable-4.86 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 300 | tiny-aya-globalRestricted weightsCohere · Aya · best of 2 rows | 5.24% | Independent | reasoningoff | Partially comparable-4.91 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →