Skip to content
AI Atlas
BenchmarkActivecategory · agentic

τ²-bench

dual-control tool-agent-user interaction (telecom, retail, airline)

quality51

Updated 4 h ago · first seen 11 Sept 2026

bench_01M293SPH15XRN6880KKHSKM5P

Metric
pass^1 · %
Direction
Higher is better
Results
440
Leader
Z.ai GLM 5.2 99.12%

As of

Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.

Claim history

5 claims · 5 properties

Categorycategory1

Claim history for Category
ValueValid from → toStatusSourceConfidenceExtractor
agenticcurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Metricmetric1

Claim history for Metric
ValueValid from → toStatusSourceConfidenceExtractor
pass^1currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Paperpaper1

Claim history for Paper
ValueValid from → toStatusSourceConfidenceExtractor
https://arxiv.org/abs/2506.07982currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Tasktask1

Claim history for Task
ValueValid from → toStatusSourceConfidenceExtractor
dual-control tool-agent-user interaction (telecom, retail, airline)currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Unitunit1

Claim history for Unit
ValueValid from → toStatusSourceConfidenceExtractor
%currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →