τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 2 h ago · first seen 11 Sept 2026
- Metric
- pass^1 · % ↑
- Current results
- 880
- Models
- 326
- Current leader
- Z.ai GLM 5.2 99.1%
Score history · Qwen3 VL 32B Instruct 4 rows
- Qwen3 VL 32B Instruct
- 29.24%aa_slug=qwen3-vl-32b-instruct · variant=Telecom · evaluator=Artificial Analysis · reasoning=off12 Sept 2026
- 45.61%aa_slug=qwen3-vl-32b-reasoning · variant=Telecom · evaluator=Artificial Analysis · reasoning=on12 Sept 2026
- 29.24%aa_slug=qwen3-vl-32b-instruct · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 45.61%aa_slug=qwen3-vl-32b-reasoning · evaluator=Artificial Analysis · reasoning=on · index_version=4.311 Sept 2026
Frontier over time · pass^1 · variant=Telecom · evaluator=Artificial Analysis
2 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 99.1%Z.ai GLM 5.2 Z.ai (Zhipu AI) Independent12 Sept 2026
- 90.3%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 308 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.2 | 99.1% | Independent | reasoning_effortmax | leader | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 1 | jt-35b-flashClosedChina Mobile | 99.1% | Independent | reasoningoff | leader | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 3 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 98.8% | Independent | reasoningon | Partially comparable-0.29 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Claude Fable 5ClosedAnthropic · Claude | 98.5% | Independent | reasoningon | Partially comparable-0.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | GLM 5 TurboClosedZ.ai (Zhipu AI) · GLM5 | 98.5% | Independent | reasoningon | Partially comparable-0.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 | 98.5% | Independent | reasoningon | Partially comparable-0.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Step 3.7 FlashOpen weightsStepFun · Step3.7 | 98.5% | Independent | reasoningon | Partially comparable-0.58 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 98.3% | Independent | reasoningon | Partially comparable-0.87 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | GLM 5.1Open weightsZ.ai (Zhipu AI) · GLM5.1 · best of 2 rows | 97.7% | Independent | reasoningon | Partially comparable-1.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | Grok 4.3ClosedxAI · Grok · best of 4 rows | 97.7% | Independent | reasoning_efforthigh | Partially comparable-1.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | Qwen3.6 PlusClosedQwen · Qwen3.6 | 97.7% | Independent | reasoningon | Partially comparable-1.46 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 2 rows | 96.5% | Independent | reasoningon | Partially comparable-2.63 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 13 | deepseek-v4-pro-0424Open weightsDeepSeek · DeepSeek · best of 3 rows | 96.2% | Independent | reasoning_effortmax | Comparable-2.92 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 95.9% | Independent | reasoningon | Partially comparable-3.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | Kimi K2.5Open weightsMoonshot AI · Kimi · best of 2 rows | 95.9% | Independent | reasoningon | Partially comparable-3.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | Kimi K2.6Open weightsMoonshot AI · Kimi · best of 2 rows | 95.9% | Independent | reasoningon | Partially comparable-3.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | Qwen3.6 Max PreviewClosedQwen · Qwen3.6 | 95.9% | Independent | reasoningon | Partially comparable-3.21 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.1 | 95.6% | Independent | reasoningon | Partially comparable-3.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 3 rows | 95.6% | Independent | reasoning_effortmedium | Partially comparable-3.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 2 rows | 95.6% | Independent | reasoningon | Partially comparable-3.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | deepseek-v4-flash-0420Open weightsDeepSeek · DeepSeek · best of 3 rows | 95.6% | Independent | reasoning_efforthigh | Partially comparable-3.51 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | MiniMax M2.5Open weightsMiniMax · MiniMax | 95.3% | Independent | reasoningon | Partially comparable-3.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 2 rows | 95.3% | Independent | reasoningon | Partially comparable-3.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | mimo-v2-flashOpen weightsXiaomi · best of 2 rows | 95.0% | Independent | reasoningon | Partially comparable-4.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | mimo-v2-proClosedXiaomi | 95.0% | Independent | reasoningon | Partially comparable-4.09 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 26 | Qwen3.7 MaxClosedQwen · Qwen3.7 | 94.7% | Independent | reasoningon | Partially comparable-4.38 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 27 | Claude Opus 4.8ClosedAnthropic · Claude | 94.4% | Independent | reasoning_effortmax | Comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 27 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 2 rows | 94.4% | Independent | reasoningon | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | MiMo-V2.5-ProOpen weightsXiaomi · best of 2 rows | 94.2% | Independent | reasoningon | Partially comparable-4.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | Mistral Medium 3.5Open weightsMistral AI · Mistral | 94.2% | Independent | reasoningon | Partially comparable-4.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 2 rows | 94.2% | Independent | reasoningon | Partially comparable-4.97 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 2 rows | 93.9% | Independent | reasoningon | Partially comparable-5.26 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | gpt-5.5ClosedOpenAI · GPT 5.5 · best of 5 rows | 93.9% | Independent | reasoning_effortxhigh | Partially comparable-5.26 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 34 | Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 2 rows | 93.6% | Independent | reasoningon | Partially comparable-5.55 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 2 rows | 93.3% | Independent | reasoningon | Partially comparable-5.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | mimo-v2-0206Open weightsXiaomi | 93.3% | Independent | reasoningon | Partially comparable-5.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 35 | tri-21b-think-previewOpen weightsTrillion Labs | 93.3% | Independent | reasoningon | Partially comparable-5.85 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | Grok 4.20ClosedxAI · Grok · best of 2 rows | 93.0% | Independent | reasoningon | Partially comparable-6.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi | 93.0% | Independent | reasoningon | Partially comparable-6.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | Qwen 3.7 PlusClosedQwen · Qwen3.7 | 93.0% | Independent | reasoningon | Partially comparable-6.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | jt-miniClosedChina Mobile | 93.0% | Independent | reasoningoff | Partially comparable-6.14 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 42 | Hy3Open weightsTencent · best of 2 rows | 92.7% | Independent | reasoningon | Partially comparable-6.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 42 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 92.7% | Independent | reasoningonreasoning_effortmedium | Partially comparable-6.43 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 44 | ring-2-6-1tOpen weightsinclusionAI | 92.4% | Independent | reasoningon | Partially comparable-6.72 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Claude Opus 4.6ClosedAnthropic · Claude · best of 2 rows | 92.1% | Independent | reasoningadaptivereasoning_effortmax | Partially comparable-7.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | GPT-5.2-CodexClosedOpenAI · GPT 5.2 | 92.1% | Independent | reasoning_effortxhigh | Partially comparable-7.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 2 rows | 92.1% | Independent | reasoningon | Partially comparable-7.01 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 48 | muse-sparkClosedMeta AI | 91.5% | Independent | reasoningon | Partially comparable-7.60 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 49 | mimo-v2-omniClosedXiaomi | 91.2% | Independent | reasoningon | Partially comparable-7.89 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 3 rows | 90.6% | Independent | reasoningon | Partially comparable-8.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | MiMo-V2.5Open weightsXiaomi | 90.6% | Independent | reasoningon | Partially comparable-8.48 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 52 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 | 90.3% | Independent | reasoningonreasoning_efforthigh | Partially comparable-8.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi | 90.1% | Independent | reasoningon | Partially comparable-9.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | Trinity Large ThinkingOpen weightsArcee AI | 90.1% | Independent | reasoningon | Partially comparable-9.06 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | ling-2-6-1tOpen weightsinclusionAI | 89.8% | Independent | reasoningoff | Partially comparable-9.35 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 56 | Claude Opus 4.5ClosedAnthropic · Claude · best of 2 rows | 89.5% | Independent | reasoningon | Partially comparable-9.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 56 | KAT-Coder-Pro V2ClosedKwaipilot | 89.5% | Independent | reasoningoff | Partially comparable-9.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 58 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 2 rows | 89.2% | Independent | reasoningon | Partially comparable-9.94 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 59 | MiniMax-M3Open weightsMiniMax · MiniMax | 88.9% | Independent | reasoningon | Partially comparable-10.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | Claude Opus 4.7ClosedAnthropic · Claude · best of 2 rows | 88.6% | Independent | reasoning_effortmax | Comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | kat-coder-pro-v1ClosedKwaiKAT | 88.6% | Independent | reasoningoff | Partially comparable-10.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 62 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 | 88.3% | Independent | reasoningoff | Partially comparable-10.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 63 | mimo-v2-omni-0327ClosedXiaomi | 88.0% | Independent | reasoningon | Partially comparable-11.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | minicpm-v4-6-1-3bOpen weightsOpenBMB | 87.7% | Independent | reasoningoff | Partially comparable-11.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 65 | hyperclova-x-seed-think-32bOpen weightsNaver · Seed | 87.4% | Independent | reasoningon | Partially comparable-11.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | gemini-3-proClosedGoogle · Gemini 3 · best of 2 rows | 87.1% | Independent | reasoning_efforthigh | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | gpt-5.4ClosedOpenAI · GPT 5.4 · best of 3 rows | 87.1% | Independent | reasoning_effortxhigh | Partially comparable-12.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | GPT-5-CodexClosedOpenAI · GPT 5 | 86.8% | Independent | reasoning_efforthigh | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | MiniMax M2Open weightsMiniMax · MiniMax | 86.8% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 2 rows | 86.8% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | gpt-5ClosedOpenAI · GPT 5 · best of 4 rows | 86.5% | Independent | reasoning_effortmedium | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom | 86.5% | Independent | reasoningon | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | Solar Pro 3ClosedUpstage · Solar | 86.3% | Independent | reasoningon | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 73 | gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 5 rows | 86.3% | Independent | reasoning_effortmax | Comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | gpt-5.3-codexClosedOpenAI · GPT 5.3 | 86.0% | Independent | reasoning_effortxhigh | Partially comparable-13.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 75 | ling-2-6-flashOpen weightsinclusionAI | 86.0% | Independent | reasoningoff | Partially comparable-13.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 77 | MiniMax M2.1Open weightsMiniMax · MiniMax | 85.4% | Independent | reasoningon | Partially comparable-13.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 5 rows | 85.1% | Independent | reasoning_effortmax | Comparable-14.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | MiniMax M2.7Open weightsMiniMax · MiniMax | 84.8% | Independent | reasoningon | Partially comparable-14.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 79 | gpt-5.2ClosedOpenAI · GPT 5.2 · best of 3 rows | 84.8% | Independent | reasoning_effortxhigh | Partially comparable-14.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 81 | qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 | 84.5% | Independent | reasoningoff | Partially comparable-14.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 82 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 | 83.9% | Independent | reasoningon | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | Qwen3 MaxClosedQwen · Qwen3 · best of 2 rows | 83.6% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 | 83.6% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 3 | 83.3% | Independent | reasoningon | Partially comparable-15.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 85 | gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 3 rows | 83.3% | Independent | reasoning_effortxhigh | Partially comparable-15.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 87 | GPT-5.1-CodexClosedOpenAI · GPT 5.1 | 83.0% | Independent | reasoning_efforthigh | Partially comparable-16.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | minicpm5-1bOpen weightsOpenBMB · best of 2 rows | 82.5% | Independent | reasoningoff | Partially comparable-16.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 89 | gpt-5.1ClosedOpenAI · GPT 5.1 · best of 2 rows | 81.9% | Independent | reasoning_efforthigh | Partially comparable-17.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 90 | Qwen3.5-2BOpen weightsQwen · Qwen3.5 · best of 2 rows | 81.6% | Independent | reasoningoff | Partially comparable-17.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 90 | nex-n2-proOpen weightsNex AGI | 81.6% | Independent | reasoningon | Partially comparable-17.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 92 | tri-21b-think-v0-5Open weightsTrillion Labs | 81.0% | Independent | reasoningon | Partially comparable-18.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | command-a-plusOpen weightsCohere · Command | 80.7% | Independent | reasoningon | Partially comparable-18.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | o3ClosedOpenAI · OpenAI o-series | 80.7% | Independent | reasoningon | Partially comparable-18.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | gemini-3-flashClosedGoogle · Gemini 3 · best of 2 rows | 80.4% | Independent | reasoningon | Partially comparable-18.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 95 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 80.4% | Independent | reasoningonreasoning_effortmedium | Partially comparable-18.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 97 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 3 rows | 79.5% | Independent | reasoningoffreasoning_efforthigh | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 97 | Qwen3 Coder NextOpen weightsQwen · Qwen3 | 79.5% | Independent | reasoningoff | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 97 | longcat-flash-liteOpen weightsLongCat | 79.5% | Independent | reasoningoff | Partially comparable-19.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 2 rows | 78.1% | Independent | reasoningon | Partially comparable-21.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →