Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 6 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

Score history · deepseek-v4-pro-0424 1 row

Not enough history to chart — a single observation (96.2% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 96.2%aa_slug=deepseek-v4-pro-0424 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 440 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
1#1Z.ai GLM 5.2Z.ai (Zhipu AI)99.12%aa_slug=glm-5-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
2#2jt-35b-flashChina Mobile99.12%aa_slug=jt-35b-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
3#3GLM 4.7 FlashZ.ai (Zhipu AI)98.83%aa_slug=glm-4-7-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
4#4Claude Fable 5Anthropic98.54%aa_slug=claude-fable-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
5#5Step 3.7 FlashStepFun98.54%aa_slug=step-3-7-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
6#6GLM 5 TurboZ.ai (Zhipu AI)98.54%aa_slug=glm-5-turbo · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
7#7GLM 5V TurboZ.ai (Zhipu AI)98.54%aa_slug=glm-5v-turbo · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
8#8GLM 5Z.ai (Zhipu AI)98.25%aa_slug=glm-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
9#9Qwen3.6 PlusQwen97.66%aa_slug=qwen3-6-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
10#10Grok 4.3xAI97.66%aa_slug=grok-4-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
11#11GLM 5.1Z.ai (Zhipu AI)97.66%aa_slug=glm-5-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
12#12glm-5-non-reasoningZ.ai (Zhipu AI)97.37%aa_slug=glm-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
13#13glm-5-1-non-reasoningZ.ai (Zhipu AI)97.08%aa_slug=glm-5-1-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
14#14grok-4-20-0309SpaceXAI96.49%aa_slug=grok-4-20-0309 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
15#15deepseek-v4-pro-0424DeepSeek96.2%aa_slug=deepseek-v4-pro-0424 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
16#16Kimi K2.5Moonshot AI95.91%aa_slug=kimi-k2-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
17#17Qwen3.6 Max PreviewQwen95.91%aa_slug=qwen3-6-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
18#18GLM 4.7Z.ai (Zhipu AI)95.91%aa_slug=glm-4-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
19#19Kimi K2.6Moonshot AI95.91%aa_slug=kimi-k2-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
20#20gemini-3-5-flash-mediumGoogle95.61%aa_slug=gemini-3-5-flash-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
21#21Gemini 3.1 Pro PreviewGoogle95.61%aa_slug=gemini-3-1-pro-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
22#22deepseek-v4-flash-0420-highDeepSeek95.61%aa_slug=deepseek-v4-flash-0420-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
23#23Qwen3.5 397B A17BQwen95.61%aa_slug=qwen3-5-397b-a17b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
24#24MiniMax M2.5MiniMax95.32%aa_slug=minimax-m2-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
25#25Qwen3.6 35B A3BQwen95.32%aa_slug=qwen3-6-35b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
26#26Gemini 3.5 FlashGoogle95.32%aa_slug=gemini-3-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
27#27mimo-v2-flash-reasoningXiaomi95.03%aa_slug=mimo-v2-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
28#28mimo-v2-proXiaomi95.03%aa_slug=mimo-v2-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
29#29deepseek-v4-flash-0420DeepSeek95.03%aa_slug=deepseek-v4-flash-0420 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
30#30Qwen3.7 MaxQwen94.74%aa_slug=qwen3-7-max · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
31#31Claude Opus 4.8Anthropic94.44%aa_slug=claude-opus-4-8 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
32#32deepseek-v4-flash-0420-non-reasoningDeepSeek94.44%aa_slug=deepseek-v4-flash-0420-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
33#33Step 3.5 FlashStepFun94.44%aa_slug=step-3-5-flash-0202 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
34#34Qwen3.6 27BQwen94.15%aa_slug=qwen3-6-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
35#35Mistral Medium 3.5Mistral AI94.15%aa_slug=mistral-medium-3-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
36#36MiMo-V2.5-ProXiaomi94.15%aa_slug=mimo-v2-5-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
37#37glm-4-7-non-reasoningZ.ai (Zhipu AI)94.15%aa_slug=glm-4-7-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
38#38deepseek-v4-pro-0424-highDeepSeek94.15%aa_slug=deepseek-v4-pro-0424-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
39#39gpt-5.5OpenAI93.86%aa_slug=gpt-5-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
40#40kimi-k2-6-non-reasoningMoonshot AI93.86%aa_slug=kimi-k2-6-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
41#41Qwen3.5-27BQwen93.86%aa_slug=qwen3-5-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
42#42Qwen3.5-122B-A10BQwen93.57%aa_slug=qwen3-5-122b-a10b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
43#43qwen3-6-27b-non-reasoningAlibaba Group93.57%aa_slug=qwen3-6-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
44#44grok-4-1-fast-reasoningSpaceXAI93.27%aa_slug=grok-4-1-fast-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
45#45mimo-v2-0206Xiaomi93.27%aa_slug=mimo-v2-0206 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
46#46tri-21b-think-previewTrillion Labs93.27%aa_slug=tri-21b-think-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
47#47jt-miniChina Mobile92.98%aa_slug=jt-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
48#48Kimi K2 ThinkingMoonshot AI92.98%aa_slug=kimi-k2-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
49#49Qwen 3.7 PlusQwen92.98%aa_slug=qwen3-7-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
50#50Grok 4.20xAI92.98%aa_slug=grok-4-20 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
51#51gpt-5-5-highOpenAI92.98%aa_slug=gpt-5-5-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
52#52Hy3 previewTencent92.69%aa_slug=hy3-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
53#53nova-2-0-pro-reasoning-mediumAmazon Web Services92.69%aa_slug=nova-2-0-pro-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
54#54ring-2-6-1tinclusionAI92.4%aa_slug=ring-2-6-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
55#55GPT-5.2-CodexOpenAI92.11%aa_slug=gpt-5-2-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
56#56Qwen3.5-4BQwen92.11%aa_slug=qwen3-5-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
57#57claude-opus-4-6-adaptiveAnthropic92.11%aa_slug=claude-opus-4-6-adaptive · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
58#58glm-4-7-flash-non-reasoningZ.ai (Zhipu AI)91.81%aa_slug=glm-4-7-flash-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
59#59gpt-5-5-mediumOpenAI91.81%aa_slug=gpt-5-5-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
60#60muse-sparkMeta AI91.52%aa_slug=muse-spark · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
61#61mimo-v2-omniXiaomi91.23%aa_slug=mimo-v2-omni · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
62#62grok-4-3-mediumSpaceXAI91.23%aa_slug=grok-4-3-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
63#63deepseek-v4-pro-0424-non-reasoningDeepSeek91.23%aa_slug=deepseek-v4-pro-0424-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
64#64DeepSeek V3.2DeepSeek90.64%aa_slug=deepseek-v3-2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
65#65nova-2-0-pro-reasoning-lowAmazon Web Services90.64%aa_slug=nova-2-0-pro-reasoning-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
66#66MiMo-V2.5Xiaomi90.64%aa_slug=mimo-v2-5-0424 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
67#67grok-3-mini-reasoningSpaceXAI90.35%aa_slug=grok-3-mini-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
68#68Kimi K2.7 CodeMoonshot AI90.06%aa_slug=kimi-k2-7-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
69#69Trinity Large ThinkingArcee AI90.06%aa_slug=trinity-large-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
70#70ling-2-6-1tinclusionAI89.77%aa_slug=ling-2-6-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
71#71KAT-Coder-Pro V2Kwaipilot89.47%aa_slug=kat-coder-pro-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
72#72claude-opus-4-5-thinkingAnthropic89.47%aa_slug=claude-opus-4-5-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
73#73Qwen3.5-35B-A3BQwen89.18%aa_slug=qwen3-5-35b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
74#74MiniMax M3MiniMax88.89%aa_slug=minimax-m3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
75#75grok-4-3-lowSpaceXAI88.89%aa_slug=grok-4-3-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
76#76kat-coder-pro-v1KwaiKAT88.6%aa_slug=kat-coder-pro-v1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
77#77Claude Opus 4.7Anthropic88.6%aa_slug=claude-opus-4-7 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
78#78qwen3-5-omni-plusAlibaba Group88.3%aa_slug=qwen3-5-omni-plus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
79#79mimo-v2-omni-0327Xiaomi88.01%aa_slug=mimo-v2-omni-0327 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
80#80minicpm-v4-6-1-3bOpenBMB87.72%aa_slug=minicpm-v4-6-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
81#81qwen3-5-4b-non-reasoningAlibaba Group87.72%aa_slug=qwen3-5-4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
82#82hyperclova-x-seed-think-32bNaver87.43%aa_slug=hyperclova-x-seed-think-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
83#83step-3-5-flashStepFun87.43%aa_slug=step-3-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
84#84gpt-5.4OpenAI87.13%aa_slug=gpt-5-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
85#85qwen3-5-27b-non-reasoningAlibaba Group87.13%aa_slug=qwen3-5-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
86#86gemini-3-proGoogle87.13%aa_slug=gemini-3-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
87#87MiniMax M2MiniMax86.84%aa_slug=minimax-m2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
88#88Qwen3.5-9BQwen86.84%aa_slug=qwen3-5-9b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
89#89GPT-5-CodexOpenAI86.84%aa_slug=gpt-5-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
90#90gpt-5 (medium)OpenAI86.55%aa_slug=gpt-5-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
91#91mi-dm-k-2-5-pro-dec28Korea Telecom86.55%aa_slug=mi-dm-k-2-5-pro-dec28 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
92#92Solar Pro 3Upstage86.26%aa_slug=solar-pro-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
93#93Claude Opus 4.5Anthropic86.26%aa_slug=claude-opus-4-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
94#94qwen3-5-35b-a3b-non-reasoningAlibaba Group86.26%aa_slug=qwen3-5-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
95#95gpt-5.6-terraOpenAI86.26%aa_slug=gpt-5-6-terra · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
96#96ling-2-6-flashinclusionAI85.96%aa_slug=ling-2-6-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
97#97gpt-5.3-codexOpenAI85.96%aa_slug=gpt-5-3-codex · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
98#98MiniMax M2.1MiniMax85.38%aa_slug=minimax-m2-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
99#99gpt-5-6-solOpenAI85.09%aa_slug=gpt-5-6-sol · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
100#100qwen3-6-35b-a3b-non-reasoningAlibaba Group85.09%aa_slug=qwen3-6-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.