Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

Score history · gpt-5.1 1 row

Not enough history to chart — a single observation (81.87% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 81.87%aa_slug=gpt-5-1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 440 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101qwen3-6-35b-a3b-non-reasoningAlibaba Group85.09%aa_slug=qwen3-6-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102Claude Opus 4.6Anthropic84.8%aa_slug=claude-opus-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103gpt-5-6-sol-xhighOpenAI84.8%aa_slug=gpt-5-6-sol-xhigh · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104gpt-5OpenAI84.8%aa_slug=gpt-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105gpt-5.2OpenAI84.8%aa_slug=gpt-5-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106MiniMax M2.7MiniMax84.8%aa_slug=minimax-m2-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107qwen3-5-122b-a10b-non-reasoningAlibaba Group84.5%aa_slug=qwen3-5-122b-a10b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108qwen3-5-omni-flashAlibaba Group84.5%aa_slug=qwen3-5-omni-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109gpt-5 (low)OpenAI84.21%aa_slug=gpt-5-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110mimo-v2-flashXiaomi83.92%aa_slug=mimo-v2-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111qwen3-5-397b-a17b-non-reasoningAlibaba Group83.92%aa_slug=qwen3-5-397b-a17b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112gpt-5-5-lowOpenAI83.92%aa_slug=gpt-5-5-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113ernie-5-0-thinking-previewBaidu83.92%aa_slug=ernie-5-0-thinking-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114Qwen3 Max ThinkingQwen83.63%aa_slug=qwen3-max-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115qwen3-max-thinking-previewAlibaba Group83.63%aa_slug=qwen3-max-thinking-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116gpt-5.4-miniOpenAI83.33%aa_slug=gpt-5-4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117gpt-5-6-sol-highOpenAI83.33%aa_slug=gpt-5-6-sol-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118Nemotron 3 UltraNVIDIA83.33%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119GPT-5.1-CodexOpenAI83.04%aa_slug=gpt-5-1-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120minicpm5-1b-non-reasoningOpenBMB82.46%aa_slug=minicpm5-1b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121gpt-5.1OpenAI81.87%aa_slug=gpt-5-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122nex-n2-proNex AGI81.58%aa_slug=nex-n2-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123qwen3-5-2b-non-reasoningAlibaba Group81.58%aa_slug=qwen3-5-2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124kimi-k2-5-non-reasoningMoonshot AI81.29%aa_slug=kimi-k2-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125gpt-5-6-sol-mediumOpenAI80.99%aa_slug=gpt-5-6-sol-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126minicpm5-1bOpenBMB80.99%aa_slug=minicpm5-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127tri-21b-think-v0-5Trillion Labs80.99%aa_slug=tri-21b-think-v0-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128o3OpenAI80.7%aa_slug=o3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129command-a-plusCohere80.7%aa_slug=command-a-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130nova-2-0-omni-reasoning-mediumAmazon Web Services80.41%aa_slug=nova-2-0-omni-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131gpt-5-6-terra-xhighOpenAI80.41%aa_slug=gpt-5-6-terra-xhigh · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132Gemini 3 Flash PreviewGoogle80.41%aa_slug=gemini-3-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133Claude Sonnet 4.6Anthropic79.53%aa_slug=claude-sonnet-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134longcat-flash-liteLongCat79.53%aa_slug=longcat-flash-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135Qwen3 Coder NextQwen79.53%aa_slug=qwen3-coder-next · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136DeepSeek V3DeepSeek78.95%aa_slug=deepseek-v3-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137claude-sonnet-4-6-non-reasoning-low-effortAnthropic78.95%aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138gpt-5-6-terra-highOpenAI78.36%aa_slug=gpt-5-6-terra-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139claude-4-5-sonnet-thinkingAnthropic78.07%aa_slug=claude-4-5-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140exaone-4-5-33bLG AI Research78.07%aa_slug=exaone-4-5-33b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141GLM 4.6Z.ai (Zhipu AI)76.9%aa_slug=glm-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142gpt-5.4-nanoOpenAI76.02%aa_slug=gpt-5-4-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143gpt-5-6-sol-lowOpenAI76.02%aa_slug=gpt-5-6-sol-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144nova-2-0-lite-reasoning-mediumAmazon Web Services75.73%aa_slug=nova-2-0-lite-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145claude-sonnet-4-6-adaptiveAnthropic75.73%aa_slug=claude-sonnet-4-6-adaptive · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146Grok Build 0.1xAI75.73%aa_slug=grok-code-fast-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147grok-4SpaceXAI74.85%aa_slug=grok-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
148#148gpt-5-4-lowOpenAI74.56%aa_slug=gpt-5-4-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
149#149k-exaoneLG AI Research74.27%aa_slug=k-exaone · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
150#150gpt-5-2-mediumOpenAI74.27%aa_slug=gpt-5-2-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
151#151Qwen3 MaxQwen74.27%aa_slug=qwen3-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
152#152claude-opus-4-7-non-reasoningAnthropic73.98%aa_slug=claude-opus-4-7-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
153#153Kimi K2 0905Moonshot AI73.39%aa_slug=kimi-k2-0905 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
154#154Claude Opus 4Anthropic73.39%aa_slug=claude-4-opus-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
155#155gpt-5-6-terra-mediumOpenAI72.81%aa_slug=gpt-5-6-terra-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
156#156nova-2-0-lite-reasoningAmazon Web Services72.81%aa_slug=nova-2-0-lite-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
157#157mimo-v2-5-pro-non-reasoningXiaomi72.51%aa_slug=mimo-v2-5-pro-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
158#158nova-2-0-lite-reasoning-lowAmazon Web Services71.93%aa_slug=nova-2-0-lite-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
159#159nova-2-0-proAmazon Web Services71.64%aa_slug=nova-2-0-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
160#160claude-4-1-opus-thinkingAnthropic71.37%aa_slug=claude-4-1-opus-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
161#161gpt-5-mini-mediumOpenAI71.05%aa_slug=gpt-5-mini-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
162#162Mercury 2Inception70.76%aa_slug=mercury-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
163#163Claude Sonnet 4.5Anthropic70.47%aa_slug=claude-4-5-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
164#164glm-4-6-reasoningZ.ai (Zhipu AI)70.47%aa_slug=glm-4-6-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
165#165grok-4-20-0309-non-reasoningSpaceXAI69.59%aa_slug=grok-4-20-0309-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
166#166gpt-5-5-non-reasoningOpenAI69.3%aa_slug=gpt-5-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
167#167apriel-v1-6-15b-thinkerServiceNow69.3%aa_slug=apriel-v1-6-15b-thinker · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
168#168Qwen3.5-2BQwen69.01%aa_slug=qwen3-5-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
169#169apriel-v1-5-15b-thinkerServiceNow68.42%aa_slug=apriel-v1-5-15b-thinker · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
170#170gpt-5-miniOpenAI68.42%aa_slug=gpt-5-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
171#171gemini-3-pro-lowGoogle68.13%aa_slug=gemini-3-pro-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
172#172nova-2-0-omni-reasoning-lowAmazon Web Services67.84%aa_slug=nova-2-0-omni-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
173#173Nemotron 3 SuperNVIDIA67.84%aa_slug=nvidia-nemotron-3-super-120b-a12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
174#174hy3-non-reasoningTencent67.54%aa_slug=hy3-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
175#175gpt-5-minimalOpenAI66.96%aa_slug=gpt-5-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
176#176gpt-oss-120bOpenAI65.79%aa_slug=gpt-oss-120b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
177#177grok-4-3-non-reasoningSpaceXAI65.79%aa_slug=grok-4-3-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
178#178grok-4-fast-reasoningSpaceXAI65.79%aa_slug=grok-4-fast-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
179#179gemma-4-31b-non-reasoningGoogle65.5%aa_slug=gemma-4-31b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
180#180qwen3-5-0-8b-non-reasoningAlibaba Group65.2%aa_slug=qwen3-5-0-8b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
181#181claude-4-sonnet-thinkingAnthropic64.62%aa_slug=claude-4-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
182#182grok-4-1-fastSpaceXAI63.74%aa_slug=grok-4-1-fast · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
183#183grok-4-fastSpaceXAI63.74%aa_slug=grok-4-fast · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
184#184hypernova-60bMultiverse Computing63.16%aa_slug=hypernova-60b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
185#185GPT-5.1-Codex MiniOpenAI62.87%aa_slug=gpt-5-1-codex-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
186#186o1OpenAI62.57%aa_slug=o1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
187#187nova-2-0-liteAmazon Web Services61.99%aa_slug=nova-2-0-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
188#188Kimi K2 0711Moonshot AI61.11%aa_slug=kimi-k2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
189#189gpt-5-6-terra-lowOpenAI60.53%aa_slug=gpt-5-6-terra-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
190#190gpt-oss-20bOpenAI60.23%aa_slug=gpt-oss-20b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
191#191grok-4.20-0309-non-reasoningxAI59.94%aa_slug=grok-4-20-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
192#192Gemma 4 31BGoogle59.94%aa_slug=gemma-4-31b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
193#193k-exaone-non-reasoningLG AI Research59.06%aa_slug=k-exaone-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
194#194gemini-3-5-flash-minimalGoogle58.77%aa_slug=gemini-3-5-flash-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
195#195doubao-seed-codeByteDance58.19%aa_slug=doubao-seed-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
196#196o4-miniOpenAI55.56%aa_slug=o4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
197#197claude-3-7-sonnet-thinkingAnthropic54.68%aa_slug=claude-3-7-sonnet-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
198#198claude-4-5-haiku-reasoningAnthropic54.68%aa_slug=claude-4-5-haiku-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
199#199Gemini 2.5 ProGoogle54.09%aa_slug=gemini-2-5-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
200#200qwen3-vl-235b-a22b-reasoningAlibaba Group54.09%aa_slug=qwen3-vl-235b-a22b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.