Skip to content
AI Atlas
BenchmarkActivecategory · preference

LMArena text leaderboard

lmarena.ai

crowdsourced pairwise human preference

quality57

Updated 1 h ago · first seen 11 Sept 2026

bench_01M293SPFANQ2XYBZDAA78N1DA

Metric
Elo / Bradley–Terry score
Direction
Results
0
Leader

As of

Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.

Claim history

5 claims · 5 properties

Categorycategory1

Claim history for Category
ValueValid from → toStatusSourceConfidenceExtractor
preferencecurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Known limitationsknown_limitations1

Claim history for Known limitations
ValueValid from → toStatusSourceConfidenceExtractor
Style bias; sampling of prompts by users.currentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Metricmetric1

Claim history for Metric
ValueValid from → toStatusSourceConfidenceExtractor
Elo / Bradley–Terry scorecurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Tasktask1

Claim history for Task
ValueValid from → toStatusSourceConfidenceExtractor
crowdsourced pairwise human preferencecurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Websitewebsite1

Claim history for Website
ValueValid from → toStatusSourceConfidenceExtractor
https://lmarena.aicurrentcurrentAI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2mediumcurated

Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →