Skip to content
AI Atlas
BenchmarkActivecategory · general

LiveBench

livebench.ai

contamination-limited, monthly refreshed questions across 6 categories

quality57

Updated 2 h ago · first seen 11 Sept 2026

bench_01M293SPERF0D8QG7TSCGE8GGF

Metric
average score · %
Direction
Higher is better
Results
456
Leader
Claude Fable 5.1 Max Effort 97.01%

As of

Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.

Claim history

6 claims · 6 properties

Categorycategory1

Claim history for Category
ValueValid from → toStatusSourceConfidenceExtractor
generalcurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Metricmetric1

Claim history for Metric
ValueValid from → toStatusSourceConfidenceExtractor
average scorecurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Paperpaper1

Claim history for Paper
ValueValid from → toStatusSourceConfidenceExtractor
https://arxiv.org/abs/2406.19314currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Tasktask1

Claim history for Task
ValueValid from → toStatusSourceConfidenceExtractor
contamination-limited, monthly refreshed questions across 6 categoriescurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Unitunit1

Claim history for Unit
ValueValid from → toStatusSourceConfidenceExtractor
%currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Websitewebsite1

Claim history for Website
ValueValid from → toStatusSourceConfidenceExtractor
https://livebench.aicurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →