τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 4 h ago · first seen 11 Sept 2026
- Metric
- pass^1 · % ↑
- Current results
- 880
- Models
- 326
- Current leader
- Z.ai GLM 5.2 99.1%
Score history · gpt-5.6-terra 10 rows
- gpt-5.6-terra
- 72.81%aa_slug=gpt-5-6-terra-medium · variant=Telecom · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 78.36%aa_slug=gpt-5-6-terra-high · variant=Telecom · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 80.41%aa_slug=gpt-5-6-terra-xhigh · variant=Telecom · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 86.26%aa_slug=gpt-5-6-terra · variant=Telecom · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 60.53%aa_slug=gpt-5-6-terra-low · variant=Telecom · evaluator=Artificial Analysis · index_version=4.312 Sept 2026
- 72.81%aa_slug=gpt-5-6-terra-medium · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=gpt-5-6-terra-medium11 Sept 2026
- 78.36%aa_slug=gpt-5-6-terra-high · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=gpt-5-6-terra-high11 Sept 2026
- 80.41%aa_slug=gpt-5-6-terra-xhigh · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=gpt-5-6-terra-xhigh11 Sept 2026
- 86.26%aa_slug=gpt-5-6-terra · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 60.53%aa_slug=gpt-5-6-terra-low · evaluator=Artificial Analysis · index_version=4.3 · aa_variant_slug=gpt-5-6-terra-low11 Sept 2026
Frontier over time · pass^1 · evaluator=Artificial Analysis
2 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 99.1%Z.ai GLM 5.2 Z.ai (Zhipu AI) Independent11 Sept 2026
- 90.3%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 323 models · trust independent-evaluator
Select models with +, then Compare.
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →