Skip to content
AI Atlas
BenchmarkActivecategory · reasoningfamily · livebench · variant Reasoning

LiveBench Reasoning

livebench.ai

LiveBench reasoning category — mean of its subtasks (web of lies, zebra puzzles, spatial…)

data quality57

Updated 2 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
gpt-6-astra 92.7%

Score history · gpt-5.6-sol 1 row

Not enough history to chart — a single observation (91.65% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 91.65%release=2026-06-25 · variant=Reasoning · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=gpt-5.6-sol-max25 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Reasoning

7 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 92.7%gpt-6-astra OpenAI Official board25 Jun 2026
  2. 91.7%Claude Fable 5.1 Anthropic Official board25 Jun 2026
  3. 91.7%gpt-5.6-sol OpenAI Official board25 Jun 2026
  4. 89.7%gpt-5.5 OpenAI Official board25 Jun 2026
  5. 88.7%Claude Sonnet 5 Anthropic Official board25 Jun 2026
  6. 88.7%Claude Opus 4.6 Anthropic Official board25 Jun 2026
  7. 80.1%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models · trust official-benchmark

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1gpt-6-astraClosedOpenAI · GPT 692.7%Official boardrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Claude Fable 5.1ClosedAnthropic · Claude91.7%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-0.96 pt25 Jun 2026livebench.aiT2History
3gpt-5.6-solClosedOpenAI · GPT 5.691.7%Official boardrelease2026-06-25Comparable-1.00 pt25 Jun 2026livebench.aiT2History
4Claude Opus 5ClosedAnthropic · Claude91.2%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-1.44 pt25 Jun 2026livebench.aiT2History
5Kimi K3Open weightsMoonshot AI · Kimi90.7%Official boardrelease2026-06-25Comparable-1.98 pt25 Jun 2026livebench.aiT2History
6gpt-5.6-terraClosedOpenAI · GPT 5.690.6%Official boardrelease2026-06-25Comparable-2.02 pt25 Jun 2026livebench.aiT2History
7Grok 4.6ClosedxAI · Grok90.5%Official boardrelease2026-06-25Comparable-2.14 pt25 Jun 2026livebench.aiT2History
8Smaug Agentic90.3%Official boardrelease2026-06-25Comparable-2.38 pt25 Jun 2026livebench.aiT2History
9Muse Spark 1.2ClosedMeta AI90.0%Official boardrelease2026-06-25Comparable-2.65 pt25 Jun 2026livebench.aiT2History
10Claude Fable 5ClosedAnthropic · Claude89.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-3.00 pt25 Jun 2026livebench.aiT2History
10Muse Spark 1.3ClosedMeta AI89.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-3.00 pt25 Jun 2026livebench.aiT2History
10gpt-5.5ClosedOpenAI · GPT 5.589.7%Official boardrelease2026-06-25Comparable-3.00 pt25 Jun 2026livebench.aiT2History
13Gemini 3.8 FlashClosedGoogle · Gemini 3.889.3%Official boardrelease2026-06-25Comparable-3.36 pt25 Jun 2026livebench.aiT2History
14Claude Opus 4.8ClosedAnthropic · Claude89.2%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-3.46 pt25 Jun 2026livebench.aiT2History
15Claude Sonnet 5ClosedAnthropic · Claude88.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-3.96 pt25 Jun 2026livebench.aiT2History
16Claude Opus 4.6ClosedAnthropic · Claude88.7%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-3.98 pt25 Jun 2026livebench.aiT2History
17Qwen 3.8 MaxClosedQwen · Qwen3.888.2%Official boardrelease2026-06-25Comparable-4.44 pt25 Jun 2026livebench.aiT2History
18gpt-5.4ClosedOpenAI · GPT 5.488.1%Official boardrelease2026-06-25Comparable-4.54 pt25 Jun 2026livebench.aiT2History
19Gemini 3.7 FlashClosedGoogle · Gemini 3.787.8%Official boardrelease2026-06-25Comparable-4.86 pt25 Jun 2026livebench.aiT2History
20Muse Spark 1.1ClosedMeta AI87.7%Official boardrelease2026-06-25Comparable-4.92 pt25 Jun 2026livebench.aiT2History
21Qwen3.8 FlashOpen weightsQwen · Qwen3.887.4%Official boardrelease2026-06-25Comparable-5.27 pt25 Jun 2026livebench.aiT2History
22Claude Opus 4.7ClosedAnthropic · Claude87.2%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-5.46 pt25 Jun 2026livebench.aiT2History
23Grok 4.5ClosedxAI · Grok87.2%Official boardrelease2026-06-25Comparable-5.48 pt25 Jun 2026livebench.aiT2History
24DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek86.7%Official boardrelease2026-06-25Comparable-5.96 pt25 Jun 2026livebench.aiT2History
25DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek86.6%Official boardrelease2026-06-25Comparable-6.02 pt25 Jun 2026livebench.aiT2History
26Smaug Flash86.2%Official boardrelease2026-06-25Comparable-6.42 pt25 Jun 2026livebench.aiT2History
27DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek85.8%Official boardrelease2026-06-25Comparable-6.81 pt25 Jun 2026livebench.aiT2History
28GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.385.8%Official boardrelease2026-06-25Comparable-6.85 pt25 Jun 2026livebench.aiT2History
29gpt-5.6-lunaClosedOpenAI · GPT 5.685.6%Official boardrelease2026-06-25Comparable-7.01 pt25 Jun 2026livebench.aiT2History
30DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V485.4%Official boardrelease2026-06-25Comparable-7.25 pt25 Jun 2026livebench.aiT2History
31Gemini 3.6 FlashClosedGoogle · Gemini 3.685.1%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-7.50 pt25 Jun 2026livebench.aiT2History
32claude-sonnet-4-6-thinking-auto-medium-effort · Claude84.8%Official boardrelease2026-06-25Comparable-7.88 pt25 Jun 2026livebench.aiT2History
33Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.184.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.65 pt25 Jun 2026livebench.aiT2History
34Qwen3.7 MaxClosedQwen · Qwen3.783.3%Official boardrelease2026-06-25Comparable-9.32 pt25 Jun 2026livebench.aiT2History
35gpt-5.2ClosedOpenAI · GPT 5.283.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-9.44 pt25 Jun 2026livebench.aiT2History
36Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi82.8%Official boardrelease2026-06-25Comparable-9.85 pt25 Jun 2026livebench.aiT2History
36Smaug Mini82.8%Official boardrelease2026-06-25Comparable-9.85 pt25 Jun 2026livebench.aiT2History
38deepseek-v4-proClosedDeepSeek · V482.7%Official boardrelease2026-06-25Comparable-9.96 pt25 Jun 2026livebench.aiT2History
39Gemini 3.5 FlashClosedGoogle · Gemini 3.582.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-10.6 pt25 Jun 2026livebench.aiT2History
40gpt-5.4-nanoClosedOpenAI · GPT 5.481.1%Official boardrelease2026-06-25Comparable-11.6 pt25 Jun 2026livebench.aiT2History
41Claude Opus 4.5ClosedAnthropic · Claude80.1%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-12.6 pt25 Jun 2026livebench.aiT2History
42Qwen3.8 27BOpen weightsQwen · Qwen3.880.0%Official boardreasoningoffrelease2026-06-25Partially comparable-12.6 pt25 Jun 2026livebench.aiT2History
43Kimi K2.6Open weightsMoonshot AI · Kimi79.4%Official boardreasoningonrelease2026-06-25Partially comparable-13.3 pt25 Jun 2026livebench.aiT2History
44Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.278.6%Official boardrelease2026-06-25Comparable-14.0 pt25 Jun 2026livebench.aiT2History
45InklingOpen weightsThinking Machines78.3%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-14.3 pt25 Jun 2026livebench.aiT2History
46GPT-5.2-CodexClosedOpenAI · GPT 5.277.7%Official boardrelease2026-06-25Comparable-14.9 pt25 Jun 2026livebench.aiT2History
47GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.377.6%Official boardrelease2026-06-25Comparable-15.0 pt25 Jun 2026livebench.aiT2History
48ox-alpha-max76.6%Official boardrelease2026-06-25Comparable-16.1 pt25 Jun 2026livebench.aiT2History
49Grok Build 0.1ClosedxAI · Grok76.4%Official boardrelease2026-06-25Comparable-16.3 pt25 Jun 2026livebench.aiT2History
50Qwen3.6 PlusClosedQwen · Qwen3.675.8%Official boardrelease2026-06-25Comparable-16.8 pt25 Jun 2026livebench.aiT2History
51Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 374.7%Official boardrelease2026-06-25Comparable-18.0 pt25 Jun 2026livebench.aiT2History
52MiniMax-M3Open weightsMiniMax · MiniMax74.5%Official boardrelease2026-06-25Comparable-18.2 pt25 Jun 2026livebench.aiT2History
53gpt-5.4-miniClosedOpenAI · GPT 5.471.3%Official boardrelease2026-06-25Comparable-21.3 pt25 Jun 2026livebench.aiT2History
54Grok 4.3ClosedxAI · Grok70.8%Official boardrelease2026-06-25Comparable-21.8 pt25 Jun 2026livebench.aiT2History
55deepseek-v4-flashOpen weightsDeepSeek · DeepSeek70.6%Official boardrelease2026-06-25Comparable-22.1 pt25 Jun 2026livebench.aiT2History
56Qwen3.6 27BOpen weightsQwen · Qwen3.670.3%Official boardrelease2026-06-25Comparable-22.4 pt25 Jun 2026livebench.aiT2History
57Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.560.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-32.5 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →