Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

Score history · o1 1 row

Not enough history to chart — a single observation (62.57% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 62.57%aa_slug=o1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 440 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201nemotron-cascade-2-30b-a3bNVIDIA53.22%aa_slug=nemotron-cascade-2-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202Qwen3 235B A22B Instruct 2507Qwen53.22%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203gpt-4.1-miniOpenAI52.92%aa_slug=gpt-4-1-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204gpt-5-4-nano-mediumOpenAI52.63%aa_slug=gpt-5-4-nano-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205Claude Sonnet 4Anthropic52.34%aa_slug=claude-4-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206Magistral Medium 1.2Mistral AI52.05%aa_slug=magistral-medium-2509 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207gpt-oss-20b-lowOpenAI50.29%aa_slug=gpt-oss-20b-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208Claude 3.7 SonnetAnthropic50%aa_slug=claude-3-7-sonnet · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209Seed-OSS-36B-InstructByteDance49.42%aa_slug=seed-oss-36b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210midm-250-pro-rsnsftKorea Telecom49.42%aa_slug=midm-250-pro-rsnsft · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211gpt-5-5-instant-05-26OpenAI49.42%aa_slug=gpt-5-5-instant-05-26 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212grok-3SpaceXAI48.83%aa_slug=grok-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213solar-open-100b-reasoningUpstage48.25%aa_slug=solar-open-100b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214Qwen3.5-0.8BQwen47.66%aa_slug=qwen3-5-0-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215gpt-4.1OpenAI47.08%aa_slug=gpt-4-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216DeepSeek V3 0324DeepSeek47.08%aa_slug=deepseek-v3-0324 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217sarvam-105bSarvam46.78%aa_slug=sarvam-105b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218gpt-5-1-non-reasoningOpenAI46.49%aa_slug=gpt-5-1-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219gpt-5-2-non-reasoningOpenAI46.49%aa_slug=gpt-5-2-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220motif-2-12-7bMotif Technologies46.49%aa_slug=motif-2-12-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221GLM 4.5 AirZ.ai (Zhipu AI)46.49%aa_slug=glm-4-5-air · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222gemini-2-5-flash-preview-09-2025-reasoningGoogle45.61%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223qwen3-vl-32b-reasoningAlibaba Group45.61%aa_slug=qwen3-vl-32b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224nemotron-3-nano-omni-30b-a3bNVIDIA45.32%aa_slug=nemotron-3-nano-omni-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225gpt-oss-120b-lowOpenAI45.03%aa_slug=gpt-oss-120b-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226nova-2-0-omniAmazon Web Services44.74%aa_slug=nova-2-0-omni · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227qwen3-coder-480b-a35b-instructAlibaba Group43.57%aa_slug=qwen3-coder-480b-a35b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228Gemma 4 26B A4BGoogle43.57%aa_slug=gemma-4-26b-a4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229gemini-3-flashGoogle43.27%aa_slug=gemini-3-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230GLM 4.5Z.ai (Zhipu AI)42.98%aa_slug=glm-4.5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231granite-4.1-30bIBM42.11%aa_slug=granite-4-1-30b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232qwen3-next-80b-a3b-reasoningAlibaba Group41.52%aa_slug=qwen3-next-80b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233Mistral Small 4Mistral AI41.23%aa_slug=mistral-small-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA40.94%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235Mistral Medium 3.1Mistral AI40.64%aa_slug=mistral-medium-3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236gemma-4-26b-a4b-non-reasoningGoogle40.35%aa_slug=gemma-4-26b-a4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237nova-premierAmazon Web Services38.3%aa_slug=nova-premier · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238Devstral Small 1.0Mistral AI38.01%aa_slug=devstral-small-2505 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
239#239deepseek-v3-1-reasoningDeepSeek37.43%aa_slug=deepseek-v3-1-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
240#240North Mini Code (free)Cohere37.43%aa_slug=north-mini-code · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
241#241DeepSeek V3.1 TerminusDeepSeek37.13%aa_slug=deepseek-v3-1-terminus · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
242#242deepseek-v3-1-terminus-reasoningDeepSeek37.13%aa_slug=deepseek-v3-1-terminus-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
243#243Pixtral LargeMistral AI36.55%aa_slug=pixtral-large-2411 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
244#244gpt-5-nanoOpenAI36.55%aa_slug=gpt-5-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
245#245gpt-5-4-mini-mediumOpenAI36.55%aa_slug=gpt-5-4-mini-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
246#246deepseek-r1DeepSeek36.55%aa_slug=deepseek-r1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
247#247gemma-4-12BGoogle36.26%aa_slug=gemma-4-12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
248#248gpt-5-4-non-reasoningOpenAI35.96%aa_slug=gpt-5-4-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
249#249Qwen3 VL 235B A22B InstructQwen35.09%aa_slug=qwen3-vl-235b-a22b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
250#250DeepSeek V3.1DeepSeek34.8%aa_slug=deepseek-v3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
251#251gpt-5-4-nano-non-reasoningOpenAI34.8%aa_slug=gpt-5-4-nano-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
252#252qwen2-5-72b-instructAlibaba Group34.5%aa_slug=qwen2-5-72b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
253#253Qwen3 Coder 30B A3B InstructQwen34.5%aa_slug=qwen3-coder-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
254#254Qwen3 14BQwen34.5%aa_slug=qwen3-14b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
255#255sarvam-30bSarvam34.5%aa_slug=sarvam-30b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
256#256MiniMax-M1-80kMiniMax34.21%aa_slug=minimax-m1-80k · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
257#257deepseek-v3-2-0925DeepSeek33.92%aa_slug=deepseek-v3-2-0925 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
258#258DeepSeek V3.2 ExpDeepSeek33.92%aa_slug=deepseek-v3-2-reasoning-0925 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
259#259qwen3-235b-a22b-instruct-2507Alibaba Group33.33%aa_slug=qwen3-235b-a22b-instruct-2507 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
260#260Mistral Large 2.0Mistral AI33.04%aa_slug=mistral-large-2407 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
261#261ling-1tinclusionAI32.75%aa_slug=ling-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
262#262qwen3-max-previewAlibaba Group32.75%aa_slug=qwen3-max-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
263#263Claude Haiku 4.5Anthropic32.46%aa_slug=claude-4-5-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
264#264qwen3-14b-instructAlibaba Group32.16%aa_slug=qwen3-14b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
265#265gpt-5-mini-minimalOpenAI31.87%aa_slug=gpt-5-mini-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
266#266solar-pro-2Upstage31.87%aa_slug=solar-pro-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
267#267gemma-4-12b-non-reasoningGoogle31.87%aa_slug=gemma-4-12b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
268#268MiniMax-M1-40kMiniMax31.58%aa_slug=minimax-m1-40k · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
269#269GLM 4.6VZ.ai (Zhipu AI)31.58%aa_slug=glm-4-6v-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
270#270gemini-2-5-flash-reasoningGoogle31.58%aa_slug=gemini-2-5-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
271#271o3 Mini HighOpenAI31.29%aa_slug=o3-mini-high · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
272#272gemini-3-1-flash-lite-previewGoogle31.29%aa_slug=gemini-3-1-flash-lite-preview · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
273#273gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle30.7%aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
274#274glm-4-6vZ.ai (Zhipu AI)30.7%aa_slug=glm-4-6v · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
275#275mistral-large-2Mistral AI30.7%aa_slug=mistral-large-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
276#276gpt-5-nano-mediumOpenAI30.41%aa_slug=gpt-5-nano-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
277#277gemini-2-5-flash-lite-preview-09-2025Google30.41%aa_slug=gemini-2-5-flash-lite-preview-09-2025 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
278#278Qwen3 32BQwen29.82%aa_slug=qwen3-32b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
279#279Mistral Small 3.2Mistral AI29.53%aa_slug=mistral-small-3-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
280#280Gemini 2.0 FlashGoogle29.53%aa_slug=gemini-2-0-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
281#281Qwen3 VL 32B InstructQwen29.24%aa_slug=qwen3-vl-32b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
282#282Qwen3 VL 8B InstructQwen29.24%aa_slug=qwen3-vl-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
283#283GPT-4o (2024-08-06)OpenAI28.95%aa_slug=gpt-4o-2024-08-06 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
284#284o3-miniOpenAI28.65%aa_slug=o3-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
285#285gemini-2-5-flash-preview-09-2025Google28.36%aa_slug=gemini-2-5-flash-preview-09-2025 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
286#286devstral-smallMistral AI28.36%aa_slug=devstral-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
287#287solar-pro-2-reasoningUpstage28.07%aa_slug=solar-pro-2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
288#288nvidia-nemotron-3-nano-4bNVIDIA28.07%aa_slug=nvidia-nemotron-3-nano-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
289#289qwen3-30b-a3b-2507-reasoningAlibaba Group28.07%aa_slug=qwen3-30b-a3b-2507-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
290#290llama-nemotron-super-49b-v1-5-reasoningNVIDIA28.07%aa_slug=llama-nemotron-super-49b-v1-5-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
291#291falcon-h1r-7bTII UAE27.78%aa_slug=falcon-h1r-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
292#292granite-4.1-8bIBM27.78%aa_slug=granite-4-1-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
293#293k2-v2MBZUAI Institute of Foundation Models27.78%aa_slug=k2-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
294#294Qwen3 8BQwen27.78%aa_slug=qwen3-8b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
295#295Magistral Small 1.2Mistral AI27.78%aa_slug=magistral-small-2509 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
296#296Ministral 3 14BMistral AI27.19%aa_slug=ministral-3-14b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
297#297qwen3-235b-a22b-instructAlibaba Group27.19%aa_slug=qwen3-235b-a22b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
298#298llama-3-3-nemotron-super-49b-reasoningNVIDIA26.9%aa_slug=llama-3-3-nemotron-super-49b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
299#299Llama 3.3 70BMeta AI26.61%aa_slug=llama-3-3-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
300#300intellect-3Prime Intellect26.61%aa_slug=intellect-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.