Skip to content
AI Atlas
Benchmarks

Benchmarks

Evaluation suites and the results published for them. Each result carries its configuration; leaders are shown per benchmark, not as a composite.

27 benchmarks

Benchmarks
BenchmarkCategoryMetricResultsModelsCurrent leaderUpdated
τ-benchagenticpass^1 (%)0019 min ago
τ²-benchagenticpass^1 (%)0019 min ago
Aider polyglotcodingpass rate (2 attempts) (%)0019 min ago
AIME 2025mathaccuracy (%)0019 min ago
ARC-AGIreasoningaccuracy (%)0019 min ago
Artificial Analysis Intelligence Indexcompositeindex0019 min ago
GPQAreasoningaccuracy (%)0019 min ago
HumanEvalcodingpass@1 (%)0019 min ago
Humanity's Last Examknowledgeaccuracy (%)0019 min ago
IFBenchinstruction-followingaccuracy (%)0019 min ago
IFEvalinstruction-followingprompt-level strict accuracy (%)0019 min ago
LiveBenchgeneralaverage score (%)0019 min ago
LiveCodeBenchcodingpass@1 (%)0019 min ago
LMArena text leaderboardpreferenceElo / Bradley–Terry score0019 min ago
MATH-500mathaccuracy (%)0019 min ago
MMLUknowledgeaccuracy (%)0019 min ago
MMLU-Proknowledgeaccuracy (%)0019 min ago
MMMUmultimodalaccuracy (%)0019 min ago
MMMU-Promultimodalaccuracy (%)0019 min ago
MTEBembeddingsmean score0019 min ago
SciCodecodingaccuracy (%)0019 min ago
SWE-bench (full test split)codingresolved (%)0019 min ago
SWE-bench Litecodingresolved (%)0019 min ago
SWE-bench Multilingualcodingresolved (%)0019 min ago
SWE-bench Multimodalcodingresolved (%)0019 min ago
SWE-bench Verifiedcodingresolved (%)0019 min ago
Terminal-Benchagenticaccuracy (%)0019 min ago

Leader = best current result under the benchmark's default direction (higher or lower is better). Configs differ; open a benchmark for its leaderboard, config filter and per-model history.