Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

Score history · GLM 4.5 1 row

Not enough history to chart — a single observation (42.98% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 42.98%aa_slug=glm-4.5 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 440 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
301#301Ministral 3 8BMistral AI26.61%aa_slug=ministral-3-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
302#302magistral-smallMistral AI26.61%aa_slug=magistral-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
303#303hermes-4-llama-3-1-405bNous Research26.61%aa_slug=hermes-4-llama-3-1-405b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
304#304qwen3-4b-2507-instructAlibaba Group26.61%aa_slug=qwen3-4b-2507-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
305#305ring-1tinclusionAI26.32%aa_slug=ring-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
306#306qwen3-30b-a3b-instruct-reasoningAlibaba Group26.02%aa_slug=qwen3-30b-a3b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
307#307gemma-4-e4b-non-reasoningGoogle26.02%aa_slug=gemma-4-e4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
308#308qwen3-1.7b-instruct-reasoningAlibaba Group26.02%aa_slug=qwen3-1.7b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
309#309gpt-5-nano-minimalOpenAI25.73%aa_slug=gpt-5-nano-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
310#310qwen3-4b-2507-instruct-reasoningAlibaba Group25.44%aa_slug=qwen3-4b-2507-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
311#311Nemotron 3 Nano 30B A3BNVIDIA25.44%aa_slug=nvidia-nemotron-3-nano-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
312#312k2-think-v2MBZUAI Institute of Foundation Models25.44%aa_slug=k2-think-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
313#313llama-nemotron-super-49b-v1-5NVIDIA25.15%aa_slug=llama-nemotron-super-49b-v1-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
314#314gpt-4oOpenAI25.15%aa_slug=gpt-4o · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
315#315Mistral Small 3.1Mistral AI25.15%aa_slug=mistral-small-3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
316#316Devstral 2Mistral AI24.85%aa_slug=devstral-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
317#317k2-v2-mediumMBZUAI Institute of Foundation Models24.85%aa_slug=k2-v2-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
318#318Ministral 3 3BMistral AI24.85%aa_slug=ministral-3-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
319#319qwen3-8b-instructAlibaba Group24.85%aa_slug=qwen3-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
320#320Claude Haiku 3.5Anthropic24.56%aa_slug=claude-3-5-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
321#321Mistral Large 3Mistral AI24.56%aa_slug=mistral-large-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
322#322Mistral Medium 3Mistral AI24.27%aa_slug=mistral-medium-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
323#323qwen3-235b-a22b-instruct-reasoningAlibaba Group23.98%aa_slug=qwen3-235b-a22b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
324#324Devstral Small 2Mistral AI23.39%aa_slug=devstral-small-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
325#325gpt-5-4-mini-non-reasoningOpenAI23.39%aa_slug=gpt-5-4-mini-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
326#326nvidia-nemotron-nano-9b-v2NVIDIA23.39%aa_slug=nvidia-nemotron-nano-9b-v2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
327#327Qwen3-VL-4B-InstructQwen23.39%aa_slug=qwen3-vl-4b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
328#328magistral-mediumMistral AI23.1%aa_slug=magistral-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
329#329llama-3-1-nemotron-instruct-70bNVIDIA23.1%aa_slug=llama-3-1-nemotron-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
330#330granite-4-0-nano-1bIBM22.81%aa_slug=granite-4-0-nano-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
331#331deepseek-v3DeepSeek22.81%aa_slug=deepseek-v3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
332#332GLM 4.5VZ.ai (Zhipu AI)22.51%aa_slug=glm-4-5v-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
333#333Hermes-4-70BNous Research22.51%aa_slug=hermes-4-llama-3-1-70b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
334#334qwen3-vl-8b-reasoningAlibaba Group22.51%aa_slug=qwen3-vl-8b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
335#335Hermes 4 405BNous Research22.22%aa_slug=hermes-4-llama-3-1-405b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
336#336gemma-4-e2b-non-reasoningGoogle22.22%aa_slug=gemma-4-e2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
337#337qwen3-30b-a3b-instructAlibaba Group22.22%aa_slug=qwen3-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
338#338R1 Distill Llama 70BDeepSeek21.93%aa_slug=deepseek-r1-distill-llama-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
339#339NVIDIA-Nemotron-Nano-9B-v2NVIDIA21.93%aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
340#340Qwen3 Next 80B A3B InstructQwen21.64%aa_slug=qwen3-next-80b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
341#341nanbeige4-1-3bNanbeige21.64%aa_slug=nanbeige4-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
342#342hermes-4-llama-3-1-70bNous Research21.64%aa_slug=hermes-4-llama-3-1-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
343#343qwen3-1.7b-instructAlibaba Group21.64%aa_slug=qwen3-1.7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
344#344qwen3-omni-30b-a3b-reasoningAlibaba Group21.35%aa_slug=qwen3-omni-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
345#345nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA21.35%aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
346#346olmo-3-1-32b-instructAllen Institute for AI21.35%aa_slug=olmo-3-1-32b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
347#347Claude 3 HaikuAnthropic21.05%aa_slug=claude-3-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
348#348Qwen3-0.6BQwen21.05%aa_slug=qwen3-0.6b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
349#349Llama-3.2-3BMeta AI21.05%aa_slug=llama-3-2-instruct-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
350#350gemma-4-E4BGoogle20.76%aa_slug=gemma-4-e4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
351#351k2-v2-lowMBZUAI Institute of Foundation Models20.76%aa_slug=k2-v2-low · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
352#352ling-flash-2-0inclusionAI20.76%aa_slug=ling-flash-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
353#353gemma-4-E2BGoogle20.76%aa_slug=gemma-4-e2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
354#354exaone-4-0-1-2bLG AI Research20.47%aa_slug=exaone-4-0-1-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
355#355solar-miniUpstage20.18%aa_slug=solar-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
356#356qwen3-vl-30b-a3b-reasoningAlibaba Group19.88%aa_slug=qwen3-vl-30b-a3b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
357#357devstral-mediumMistral AI19.88%aa_slug=devstral-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
358#358glm-4-5vZ.ai (Zhipu AI)19.59%aa_slug=glm-4-5v · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
359#359lfm2-5-1-2b-thinkingLiquid AI19.59%aa_slug=lfm2-5-1-2b-thinking · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
360#360granite-4.1-3bIBM19.59%aa_slug=granite-4-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
361#361Mistral Small 3Mistral AI19.59%aa_slug=mistral-small-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
362#362granite-4-0-h-nano-1bIBM19.59%aa_slug=granite-4-0-h-nano-1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
363#363nvidia-nemotron-nano-12b-v2-vlNVIDIA19.3%aa_slug=nvidia-nemotron-nano-12b-v2-vl · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
364#364Qwen3 VL 30B A3B InstructQwen19.01%aa_slug=qwen3-vl-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
365#365Qwen3-4BQwen19.01%aa_slug=qwen3-4b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
366#366Llama-3.1-405BMeta AI19.01%aa_slug=llama-3-1-instruct-405b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
367#367gemini-2-5-flash-liteGoogle19.01%aa_slug=gemini-2-5-flash-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
368#368Gemini 2.5 Flash-LiteGoogle18.42%aa_slug=gemini-2-5-flash-lite-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
369#369mistral-small-4-non-reasoningMistral AI18.42%aa_slug=mistral-small-4-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
370#370Llama 4 MaverickMeta AI17.84%aa_slug=llama-4-maverick · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
371#371nova-liteAmazon Web Services17.54%aa_slug=nova-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
372#372exaone-4-0-32b-reasoningLG AI Research17.25%aa_slug=exaone-4-0-32b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
373#373granite-4-0-h-smallIBM17.25%aa_slug=granite-4-0-h-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
374#374gpt-4.1-nanoOpenAI17.25%aa_slug=gpt-4-1-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
375#375qwen3-omni-30b-a3b-instructAlibaba Group16.37%aa_slug=qwen3-omni-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
376#376exaone-4-0-1-2b-reasoningLG AI Research16.37%aa_slug=exaone-4-0-1-2b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
377#377Llama 3.1 8BMeta AI16.37%aa_slug=llama-3-1-instruct-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
378#378LFM2.5-8B-A1BLiquid AI16.08%aa_slug=lfm2-5-8b-a1b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
379#379step-3-vl-10bStepFun16.08%aa_slug=step-3-vl-10b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
380#380jamba-reasoning-3bAI21 Labs15.79%aa_slug=jamba-reasoning-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
381#381qwen3-vl-4b-reasoningAlibaba Group15.5%aa_slug=qwen3-vl-4b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
382#382Llama 4 ScoutMeta AI15.5%aa_slug=llama-4-scout · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
383#383Llama-3.1-70BMeta AI15.2%aa_slug=llama-3-1-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
384#384Command ACohere15.2%aa_slug=command-a · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
385#385Gemini 2.5 FlashGoogle14.91%aa_slug=gemini-2-5-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
386#386llama-3-2-instruct-11b-visionMeta AI14.62%aa_slug=llama-3-2-instruct-11b-vision · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
387#387qwen3-0.6b-instructAlibaba Group14.62%aa_slug=qwen3-0.6b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
388#388granite-4-0-h-350mIBM14.62%aa_slug=granite-4-0-h-350m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
389#389nova-microAmazon Web Services14.04%aa_slug=nova-micro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
390#390nova-proAmazon Web Services14.04%aa_slug=nova-pro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
391#391lfm2-2-6bLiquid AI13.45%aa_slug=lfm2-2-6b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
392#392jamba-1-7-largeAI21 Labs13.45%aa_slug=jamba-1-7-large · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
393#393granite-4-0-350mIBM13.16%aa_slug=granite-4-0-350m · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
394#394ling-mini-2-0inclusionAI13.16%aa_slug=ling-mini-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
395#395apertus-70b-instructSwiss AI Initiative12.87%aa_slug=apertus-70b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
396#396Olmo-3-7B-InstructAllen Institute for AI12.57%aa_slug=olmo-3-7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
397#397Granite 4.0 MicroIBM12.57%aa_slug=granite-4-0-micro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
398#398jamba-1-7-miniAI21 Labs12.57%aa_slug=jamba-1-7-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
399#399LFM2-1.2BLiquid AI12.57%aa_slug=lfm2-1-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
400#400llama-3-1-nemotron-nano-4b-reasoningNVIDIA11.7%aa_slug=llama-3-1-nemotron-nano-4b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.