Skip to content
AI Atlas
BenchmarkActivecategory · generalfamily · livebench · variant global

LiveBench

livebench.ai

contamination-limited, monthly refreshed questions across 7 categories — overall mean of the category averages

data quality57

Updated 2 h ago · first seen 11 Sept 2026

Metric
global_average · %
Current results
57
Models
57
Current leader
Claude Fable 5.1 83.4%

Score history · gpt-5.5 8 rows

Not enough history to chart — 8 observations, all dated 25 Jun 2026. Rows under different configurations count separately; the list below shows each one.

  • 70.73%release=2026-06-25 · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 87.36%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 81.58%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 95.86%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 53.99%release=2026-06-25 · subtasks=["javascript","typescript","python"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 82.15%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 89.65%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026
  • 80.19%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-5.5-xhigh25 Jun 2026

Back to the leaderboard

Frontier over time · global_average

9 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 83.4%Claude Fable 5.1 Anthropic Official board25 Jun 2026
  2. 83.0%Claude Fable 5 Anthropic Official board25 Jun 2026
  3. 81.1%gpt-5.6-sol OpenAI Official board25 Jun 2026
  4. 80.2%gpt-5.5 OpenAI Official board25 Jun 2026
  5. 78.0%gpt-5.4 OpenAI Official board25 Jun 2026
  6. 77.0%Gemini 3.1 Pro Preview Google Official board25 Jun 2026
  7. 76.5%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  8. 74.5%Claude Opus 4.6 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models · trust official-benchmark

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Claude Fable 5.1ClosedAnthropic · Claude83.4%Official boardreasoning_effortmaxrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Claude Fable 5ClosedAnthropic · Claude83.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-0.44 pt25 Jun 2026livebench.aiT2History
3gpt-6-astraClosedOpenAI · GPT 682.2%Official boardrelease2026-06-25Partially comparable-1.25 pt25 Jun 2026livebench.aiT2History
4Muse Spark 1.3ClosedMeta AI81.6%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-1.83 pt25 Jun 2026livebench.aiT2History
5DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek81.1%Official boardrelease2026-06-25Partially comparable-2.30 pt25 Jun 2026livebench.aiT2History
6gpt-5.6-solClosedOpenAI · GPT 5.681.1%Official boardrelease2026-06-25Partially comparable-2.36 pt25 Jun 2026livebench.aiT2History
7gpt-5.5ClosedOpenAI · GPT 5.580.2%Official boardrelease2026-06-25Partially comparable-3.23 pt25 Jun 2026livebench.aiT2History
8Claude Opus 5ClosedAnthropic · Claude80.1%Official boardreasoning_effortmaxrelease2026-06-25Comparable-3.33 pt25 Jun 2026livebench.aiT2History
9Smaug Agentic79.5%Official boardrelease2026-06-25Partially comparable-3.91 pt25 Jun 2026livebench.aiT2History
10Kimi K3Open weightsMoonshot AI · Kimi79.2%Official boardrelease2026-06-25Partially comparable-4.22 pt25 Jun 2026livebench.aiT2History
11Gemini 3.7 FlashClosedGoogle · Gemini 3.778.8%Official boardrelease2026-06-25Partially comparable-4.59 pt25 Jun 2026livebench.aiT2History
12Qwen 3.8 MaxClosedQwen · Qwen3.878.5%Official boardrelease2026-06-25Partially comparable-4.95 pt25 Jun 2026livebench.aiT2History
13Grok 4.6ClosedxAI · Grok78.0%Official boardrelease2026-06-25Partially comparable-5.37 pt25 Jun 2026livebench.aiT2History
14gpt-5.4ClosedOpenAI · GPT 5.478.0%Official boardrelease2026-06-25Partially comparable-5.44 pt25 Jun 2026livebench.aiT2History
15Muse Spark 1.2ClosedMeta AI78.0%Official boardrelease2026-06-25Partially comparable-5.46 pt25 Jun 2026livebench.aiT2History
16gpt-5.6-terraClosedOpenAI · GPT 5.677.9%Official boardrelease2026-06-25Partially comparable-5.48 pt25 Jun 2026livebench.aiT2History
17DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek77.4%Official boardrelease2026-06-25Partially comparable-5.98 pt25 Jun 2026livebench.aiT2History
18Smaug Flash77.4%Official boardrelease2026-06-25Partially comparable-5.98 pt25 Jun 2026livebench.aiT2History
19Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.177.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-6.46 pt25 Jun 2026livebench.aiT2History
20Smaug Mini76.9%Official boardrelease2026-06-25Partially comparable-6.48 pt25 Jun 2026livebench.aiT2History
21DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V476.8%Official boardrelease2026-06-25Partially comparable-6.66 pt25 Jun 2026livebench.aiT2History
22Claude Opus 4.7ClosedAnthropic · Claude76.5%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-6.89 pt25 Jun 2026livebench.aiT2History
23Claude Opus 4.8ClosedAnthropic · Claude76.2%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-7.19 pt25 Jun 2026livebench.aiT2History
24Qwen3.8 FlashOpen weightsQwen · Qwen3.876.2%Official boardrelease2026-06-25Partially comparable-7.22 pt25 Jun 2026livebench.aiT2History
25GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.376.1%Official boardrelease2026-06-25Partially comparable-7.28 pt25 Jun 2026livebench.aiT2History
26Claude Sonnet 5ClosedAnthropic · Claude76.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-7.37 pt25 Jun 2026livebench.aiT2History
27Gemini 3.8 FlashClosedGoogle · Gemini 3.875.8%Official boardrelease2026-06-25Partially comparable-7.59 pt25 Jun 2026livebench.aiT2History
28Grok 4.5ClosedxAI · Grok75.8%Official boardrelease2026-06-25Partially comparable-7.64 pt25 Jun 2026livebench.aiT2History
29Muse Spark 1.1ClosedMeta AI75.3%Official boardrelease2026-06-25Partially comparable-8.11 pt25 Jun 2026livebench.aiT2History
30Qwen3.8 27BOpen weightsQwen · Qwen3.875.3%Official boardreasoningoffrelease2026-06-25Partially comparable-8.14 pt25 Jun 2026livebench.aiT2History
31Gemini 3.5 FlashClosedGoogle · Gemini 3.574.6%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.78 pt25 Jun 2026livebench.aiT2History
32gpt-5.2ClosedOpenAI · GPT 5.274.6%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.78 pt25 Jun 2026livebench.aiT2History
33Claude Opus 4.6ClosedAnthropic · Claude74.5%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-8.89 pt25 Jun 2026livebench.aiT2History
34DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek74.2%Official boardrelease2026-06-25Partially comparable-9.24 pt25 Jun 2026livebench.aiT2History
35GPT-5.2-CodexClosedOpenAI · GPT 5.274.0%Official boardrelease2026-06-25Partially comparable-9.44 pt25 Jun 2026livebench.aiT2History
36Gemini 3.6 FlashClosedGoogle · Gemini 3.673.6%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-9.83 pt25 Jun 2026livebench.aiT2History
37gpt-5.6-lunaClosedOpenAI · GPT 5.673.6%Official boardrelease2026-06-25Partially comparable-9.86 pt25 Jun 2026livebench.aiT2History
38Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.273.2%Official boardrelease2026-06-25Partially comparable-10.3 pt25 Jun 2026livebench.aiT2History
39Qwen3.7 MaxClosedQwen · Qwen3.773.1%Official boardrelease2026-06-25Partially comparable-10.3 pt25 Jun 2026livebench.aiT2History
40claude-sonnet-4-6-thinking-auto-medium-effort · Claude73.0%Official boardrelease2026-06-25Partially comparable-10.4 pt25 Jun 2026livebench.aiT2History
41Claude Opus 4.5ClosedAnthropic · Claude72.6%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-10.8 pt25 Jun 2026livebench.aiT2History
42InklingOpen weightsThinking Machines71.9%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-11.5 pt25 Jun 2026livebench.aiT2History
43GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.371.6%Official boardrelease2026-06-25Partially comparable-11.8 pt25 Jun 2026livebench.aiT2History
44deepseek-v4-proClosedDeepSeek · V471.6%Official boardrelease2026-06-25Partially comparable-11.8 pt25 Jun 2026livebench.aiT2History
45Kimi K2.6Open weightsMoonshot AI · Kimi70.5%Official boardreasoningonrelease2026-06-25Partially comparable-12.9 pt25 Jun 2026livebench.aiT2History
46gpt-5.4-nanoClosedOpenAI · GPT 5.469.6%Official boardrelease2026-06-25Partially comparable-13.8 pt25 Jun 2026livebench.aiT2History
47ox-alpha-max69.2%Official boardrelease2026-06-25Partially comparable-14.2 pt25 Jun 2026livebench.aiT2History
48Qwen3.6 PlusClosedQwen · Qwen3.668.9%Official boardrelease2026-06-25Partially comparable-14.5 pt25 Jun 2026livebench.aiT2History
49Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi68.4%Official boardrelease2026-06-25Partially comparable-15.0 pt25 Jun 2026livebench.aiT2History
50Grok Build 0.1ClosedxAI · Grok67.8%Official boardrelease2026-06-25Partially comparable-15.6 pt25 Jun 2026livebench.aiT2History
51Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 367.4%Official boardrelease2026-06-25Partially comparable-16.1 pt25 Jun 2026livebench.aiT2History
52MiniMax-M3Open weightsMiniMax · MiniMax67.3%Official boardrelease2026-06-25Partially comparable-16.2 pt25 Jun 2026livebench.aiT2History
53gpt-5.4-miniClosedOpenAI · GPT 5.466.4%Official boardrelease2026-06-25Partially comparable-17.0 pt25 Jun 2026livebench.aiT2History
54deepseek-v4-flashOpen weightsDeepSeek · DeepSeek65.5%Official boardrelease2026-06-25Partially comparable-17.9 pt25 Jun 2026livebench.aiT2History
55Qwen3.6 27BOpen weightsQwen · Qwen3.664.0%Official boardrelease2026-06-25Partially comparable-19.4 pt25 Jun 2026livebench.aiT2History
56Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.563.9%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-19.5 pt25 Jun 2026livebench.aiT2History
57Grok 4.3ClosedxAI · Grok62.2%Official boardrelease2026-06-25Partially comparable-21.2 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →