Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

Score history · command-a-plus 1 row

Not enough history to chart — a single observation (80.7% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 80.7%aa_slug=command-a-plus · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 440 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
401#401llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA11.4%aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
402#402apertus-8b-instructSwiss AI Initiative11.4%aa_slug=apertus-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
403#403deepseek-r1-0120DeepSeek11.4%aa_slug=deepseek-r1-0120 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
404#404lfm2-24b-a2bLiquid AI11.11%aa_slug=lfm2-24b-a2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
405#405LFM2.5-1.2B-InstructLiquid AI10.82%aa_slug=lfm2-5-1-2b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
406#406Gemma 3 12BGoogle10.82%aa_slug=gemma-3-12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
407#407Gemma 3 27BGoogle10.53%aa_slug=gemma-3-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
408#408lfm2-8b-a1bLiquid AI10.53%aa_slug=lfm2-8b-a1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
409#409granite-3-3-8b-instructIBM10.53%aa_slug=granite-3-3-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
410#410gemma-3-1bGoogle10.53%aa_slug=gemma-3-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
411#411qwen3-30b-a3b-2507Alibaba Group10.23%aa_slug=qwen3-30b-a3b-2507 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
412#412gemma-3-270mGoogle9.06%aa_slug=gemma-3-270m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
413#413LFM2.5-VL-1.6BLiquid AI8.48%aa_slug=lfm2-5-vl-1-6b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
414#414phi-4-miniMicrosoft8.19%aa_slug=phi-4-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
415#415Gemma 3 4BGoogle4.97%aa_slug=gemma-3-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
416#416gemma-3n-e4bGoogle4.97%aa_slug=gemma-3n-e4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
417#417exaone-4-0-32bLG AI Research4.09%aa_slug=exaone-4-0-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
418#418Kimi-Linear-48B-A3B-InstructMoonshot AI0%aa_slug=kimi-linear-48b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
419#419ernie-4-5-300b-a47bBaidu0%aa_slug=ernie-4-5-300b-a47b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
420#420phi-3-miniMicrosoft0%aa_slug=phi-3-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
421#421Mistral 7BMistral AI0%aa_slug=mistral-7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
422#422ring-flash-2-0inclusionAI0%aa_slug=ring-flash-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
423#423gpt-5-chatgptOpenAI0%aa_slug=gpt-5-chatgpt · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
424#424Phi 4Microsoft0%aa_slug=phi-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
425#425llama-3-instruct-70bMeta AI0%aa_slug=llama-3-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
426#426olmo-2-32bAllen Institute for AI0%aa_slug=olmo-2-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
427#427olmo-2-7bAllen Institute for AI0%aa_slug=olmo-2-7b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
428#428gemma-3n-e2bGoogle0%aa_slug=gemma-3n-e2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
429#429olmo-3-1-32b-thinkAllen Institute for AI0%aa_slug=olmo-3-1-32b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
430#430deepseek-v3-2-specialeDeepSeek0%aa_slug=deepseek-v3-2-speciale · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
431#431olmo-3-32b-thinkAllen Institute for AI0%aa_slug=olmo-3-32b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
432#432sarvam-m-reasoningSarvam0%aa_slug=sarvam-m-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
433#433Olmo-3-7B-ThinkAllen Institute for AI0%aa_slug=olmo-3-7b-think · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
434#434Llama-3.2-1BMeta AI0%aa_slug=llama-3-2-instruct-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
435#435tiny-aya-globalCohere0%aa_slug=tiny-aya-global · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
436#436Molmo2-8BAllen Institute for AI0%aa_slug=molmo2-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
437#437llama-3-instruct-8bMeta AI0%aa_slug=llama-3-instruct-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
438#438DeepSeek-R1-0528-Qwen3-8BDeepSeek0%aa_slug=deepseek-r1-qwen3-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
439#439Reka Flash 3rekaai0%aa_slug=reka-flash-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
440#440molmo-7b-dAllen Institute for AI0%aa_slug=molmo-7b-d · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.