τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 3 h ago · first seen 11 Sept 2026
- Metric
- pass^1 · % ↑
- Current results
- 880
- Models
- 326
- Current leader
- Z.ai GLM 5.2 99.1%
Score history · Qwen3 14B 1 row
Not enough history to chart — a single observation (34.5% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 34.5%aa_slug=qwen3-14b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · pass^1 · evaluator=Artificial Analysis
2 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 99.1%Z.ai GLM 5.2 Z.ai (Zhipu AI) Independent11 Sept 2026
- 90.3%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 323 models · trust independent-evaluator
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 101 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 3 rows | 79.5% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 101 | Qwen3 Coder NextOpen weightsQwen · Qwen3 | 79.5% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 101 | longcat-flash-liteOpen weightsLongCat | 79.5% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 2 rows | 79.0% | Independent | group defaults | Comparable-0.58 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 2 rows | 78.1% | Independent | reasoningon | Partially comparable-1.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 | 78.1% | Independent | group defaults | Comparable-1.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 76.9% | Independent | group defaults | Comparable-2.63 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows | 76.0% | Independent | group defaults | Comparable-3.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | Grok Build 0.1ClosedxAI · Grok | 75.7% | Independent | group defaults | Comparable-3.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 109 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 75.7% | Independent | reasoningonreasoning_effortmedium | Partially comparable-3.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | grok-4ClosedSpaceXAI · Grok 4 | 74.8% | Independent | group defaults | Comparable-4.68 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows | 74.3% | Independent | group defaults | Comparable-5.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | Claude Opus 4ClosedAnthropic · Claude | 73.4% | Independent | group defaults | Comparable-6.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | Kimi K2 0905Open weightsMoonshot AI · Kimi | 73.4% | Independent | group defaults | Comparable-6.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | Claude Opus 4.1ClosedAnthropic · Claude | 71.4% | Independent | reasoningon | Partially comparable-8.16 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows | 71.0% | Independent | reasoning_effortmedium | Partially comparable-8.48 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | Mercury 2ClosedInception | 70.8% | Independent | group defaults | Comparable-8.77 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 118 | apriel-v1-6-15b-thinkerOpen weightsServiceNow | 69.3% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 68.4% | Independent | group defaults | Comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 | 67.8% | Independent | group defaults | Comparable-11.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | Hy3Open weightsTencent | 67.5% | Independent | reasoningoff | Partially comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows | 65.8% | Independent | group defaults | Comparable-13.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 2 rows | 65.8% | Independent | reasoningon | Partially comparable-13.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 2 rows | 65.5% | Independent | reasoningoff | Partially comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 125 | Qwen3.5-0.8BOpen weightsQwen · Qwen3.5 · best of 2 rows | 65.2% | Independent | reasoningoff | Partially comparable-14.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 64.6% | Independent | reasoningon | Partially comparable-14.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | hypernova-60bOpen weightsMultiverse Computing | 63.2% | Independent | group defaults | Comparable-16.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 | 62.9% | Independent | group defaults | Comparable-16.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 129 | o1ClosedOpenAI · OpenAI o-series | 62.6% | Independent | group defaults | Comparable-17.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 61.1% | Independent | group defaults | Comparable-18.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows | 60.2% | Independent | group defaults | Comparable-19.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 59.9% | Independent | group defaults | Comparable-19.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 133 | doubao-seed-codeClosedByteDance · Seed | 58.2% | Independent | group defaults | Comparable-21.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | o4-miniClosedOpenAI · OpenAI o-series | 55.6% | Independent | group defaults | Comparable-24.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 2 rows | 54.7% | Independent | reasoningon | Partially comparable-24.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 2 rows | 54.7% | Independent | reasoningon | Partially comparable-24.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 | 54.1% | Independent | group defaults | Comparable-25.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 54.1% | Independent | reasoningon | Partially comparable-25.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 2 rows | 53.2% | Independent | group defaults | Comparable-26.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron | 53.2% | Independent | group defaults | Comparable-26.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | gpt-4.1-miniClosedOpenAI · GPT 4.1 | 52.9% | Independent | group defaults | Comparable-26.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | Magistral Medium 1.2ClosedMistral AI · Magistral | 52.0% | Independent | group defaults | Comparable-27.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed | 49.4% | Independent | group defaults | Comparable-30.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 | 49.4% | Independent | group defaults | Comparable-30.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | midm-250-pro-rsnsftClosedKorea Telecom | 49.4% | Independent | group defaults | Comparable-30.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | grok-3ClosedSpaceXAI · Grok 3 | 48.8% | Independent | group defaults | Comparable-30.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | solar-open-100b-reasoningOpen weightsUpstage · Solar | 48.3% | Independent | group defaults | Comparable-31.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 47.1% | Independent | group defaults | Comparable-32.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | gpt-4.1ClosedOpenAI · GPT 4.1 | 47.1% | Independent | group defaults | Comparable-32.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | sarvam-105bOpen weightsSarvam | 46.8% | Independent | group defaults | Comparable-32.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 | 46.5% | Independent | group defaults | Comparable-33.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | motif-2-12-7bClosedMotif Technologies | 46.5% | Independent | group defaults | Comparable-33.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 45.6% | Independent | reasoningon | Partially comparable-33.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 45.6% | Independent | reasoningon | Partially comparable-33.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 155 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 | 45.3% | Independent | group defaults | Comparable-34.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 43.6% | Independent | group defaults | Comparable-36.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 43.6% | Independent | group defaults | Comparable-36.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | gemini-3-flashClosedGoogle · Gemini 3 | 43.3% | Independent | group defaults | Comparable-36.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 | 43.0% | Independent | group defaults | Comparable-36.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | granite-4.1-30bOpen weightsIBM · Granite 4.1 | 42.1% | Independent | group defaults | Comparable-37.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 161 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 41.5% | Independent | reasoningon | Partially comparable-38.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | Mistral Small 4Open weightsMistral AI · Mistral · best of 2 rows | 41.2% | Independent | group defaults | Comparable-38.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 163 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 40.9% | Independent | reasoningon | Partially comparable-38.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | Mistral Medium 3.1ClosedMistral AI · Mistral | 40.6% | Independent | group defaults | Comparable-38.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | nova-premierClosedAmazon Web Services · Nova | 38.3% | Independent | group defaults | Comparable-41.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Devstral Small 1.0Open weightsMistral AI · Devstral | 38.0% | Independent | group defaults | Comparable-41.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 167 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 37.4% | Independent | reasoningon | Partially comparable-42.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 167 | North Mini Code (free)Open weightsCohere | 37.4% | Independent | group defaults | Comparable-42.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 169 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 2 rows | 37.1% | Independent | group defaults | Comparable-42.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | Pixtral LargeOpen weightsMistral AI · Pixtral | 36.5% | Independent | group defaults | Comparable-43.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 | 36.5% | Independent | group defaults | Comparable-43.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows | 36.5% | Independent | group defaults | Comparable-43.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows | 36.3% | Independent | group defaults | Comparable-43.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | Qwen2.5 72B InstructOpen weightsQwen · Qwen2.5 | 34.5% | Independent | group defaults | Comparable-45.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | Qwen3 14BOpen weightsQwen · Qwen3 | 34.5% | Independent | group defaults | Comparable-45.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | Qwen3 Coder 30B A3B InstructOpen weightsQwen · Qwen3 | 34.5% | Independent | group defaults | Comparable-45.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | sarvam-30bOpen weightsSarvam | 34.5% | Independent | group defaults | Comparable-45.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax | 34.2% | Independent | group defaults | Comparable-45.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 | 33.9% | Independent | group defaults | Comparable-45.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 33.9% | Independent | group defaults | Comparable-45.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Mistral Large 2.0Open weightsMistral AI · Mistral | 33.0% | Independent | group defaults | Comparable-46.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | ling-1tOpen weightsinclusionAI | 32.8% | Independent | group defaults | Comparable-46.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | qwen3-max-previewClosedAlibaba Group · Qwen3 | 32.8% | Independent | group defaults | Comparable-46.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | qwen3-14b-instructOpen weightsAlibaba Group · Qwen3 | 32.2% | Independent | group defaults | Comparable-47.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 185 | solar-pro-2ClosedUpstage · Solar · best of 2 rows | 31.9% | Independent | group defaults | Comparable-47.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 31.6% | Independent | group defaults | Comparable-48.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 31.6% | Independent | reasoningon | Partially comparable-48.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax | 31.6% | Independent | group defaults | Comparable-48.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 | 31.3% | Independent | group defaults | Comparable-48.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 31.3% | Independent | reasoning_efforthigh | Partially comparable-48.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 191 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 30.7% | Independent | reasoningon | Partially comparable-48.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 191 | mistral-large-2Open weightsMistral AI · Mistral | 30.7% | Independent | group defaults | Comparable-48.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 193 | Qwen3 32BOpen weightsQwen · Qwen3 | 29.8% | Independent | group defaults | Comparable-49.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | Gemini 2.0 FlashClosedGoogle · Gemini 2.0 | 29.5% | Independent | group defaults | Comparable-50.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | Mistral Small 3.2Open weightsMistral AI · Mistral | 29.5% | Independent | group defaults | Comparable-50.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | Qwen3 VL 8B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 29.2% | Independent | group defaults | Comparable-50.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | GPT-4o (2024-08-06)ClosedOpenAI · GPT 4 | 28.9% | Independent | group defaults | Comparable-50.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | devstral-smallOpen weightsMistral AI · Devstral | 28.4% | Independent | group defaults | Comparable-51.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 199 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA · Llama · best of 2 rows | 28.1% | Independent | reasoningon | Partially comparable-51.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 199 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 | 28.1% | Independent | group defaults | Comparable-51.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →