Skip to content
AI Atlas
BenchmarkActivecategory · mathfamily · livebench · variant Mathematics

LiveBench Mathematics

livebench.ai

LiveBench mathematics category — mean of its subtasks (competition math, AMPS hard, olympiad)

data quality57

Updated 3 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
Claude Fable 5.1 97.0%

Score history · Gemini 3.1 Pro Preview 1 row

Not enough history to chart — a single observation (91.05% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 91.05%release=2026-06-25 · variant=Mathematics · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · aa_variant_slug=gemini-3.1-pro-preview-high25 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Mathematics

8 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 97.0%Claude Fable 5.1 Anthropic Official board25 Jun 2026
  2. 96.2%gpt-5.6-sol OpenAI Official board25 Jun 2026
  3. 95.9%gpt-5.5 OpenAI Official board25 Jun 2026
  4. 94.1%gpt-5.4 OpenAI Official board25 Jun 2026
  5. 93.2%gpt-5.2 OpenAI Official board25 Jun 2026
  6. 92.9%Claude Sonnet 5 Anthropic Official board25 Jun 2026
  7. 92.9%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  8. 90.4%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models · trust official-benchmark

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Claude Fable 5.1ClosedAnthropic · Claude97.0%Official boardreasoning_effortmaxrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2gpt-6-astraClosedOpenAI · GPT 696.8%Official boardrelease2026-06-25Partially comparable-0.20 pt25 Jun 2026livebench.aiT2History
3gpt-5.6-solClosedOpenAI · GPT 5.696.2%Official boardrelease2026-06-25Partially comparable-0.81 pt25 Jun 2026livebench.aiT2History
4Claude Fable 5ClosedAnthropic · Claude96.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-1.02 pt25 Jun 2026livebench.aiT2History
5Muse Spark 1.3ClosedMeta AI96.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-1.06 pt25 Jun 2026livebench.aiT2History
6gpt-5.5ClosedOpenAI · GPT 5.595.9%Official boardrelease2026-06-25Partially comparable-1.15 pt25 Jun 2026livebench.aiT2History
7Claude Opus 5ClosedAnthropic · Claude95.7%Official boardreasoning_effortmaxrelease2026-06-25Comparable-1.28 pt25 Jun 2026livebench.aiT2History
8DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek95.1%Official boardrelease2026-06-25Partially comparable-1.92 pt25 Jun 2026livebench.aiT2History
9gpt-5.6-terraClosedOpenAI · GPT 5.694.9%Official boardrelease2026-06-25Partially comparable-2.10 pt25 Jun 2026livebench.aiT2History
10Claude Opus 4.8ClosedAnthropic · Claude94.3%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-2.69 pt25 Jun 2026livebench.aiT2History
11gpt-5.4ClosedOpenAI · GPT 5.494.1%Official boardrelease2026-06-25Partially comparable-2.86 pt25 Jun 2026livebench.aiT2History
12Gemini 3.7 FlashClosedGoogle · Gemini 3.793.5%Official boardrelease2026-06-25Partially comparable-3.54 pt25 Jun 2026livebench.aiT2History
13DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek93.3%Official boardrelease2026-06-25Partially comparable-3.72 pt25 Jun 2026livebench.aiT2History
14gpt-5.2ClosedOpenAI · GPT 5.293.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-3.84 pt25 Jun 2026livebench.aiT2History
15Claude Sonnet 5ClosedAnthropic · Claude92.9%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-4.07 pt25 Jun 2026livebench.aiT2History
16Claude Opus 4.7ClosedAnthropic · Claude92.9%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-4.15 pt25 Jun 2026livebench.aiT2History
17Grok 4.6ClosedxAI · Grok92.6%Official boardrelease2026-06-25Partially comparable-4.44 pt25 Jun 2026livebench.aiT2History
18Gemini 3.8 FlashClosedGoogle · Gemini 3.891.6%Official boardrelease2026-06-25Partially comparable-5.44 pt25 Jun 2026livebench.aiT2History
19Qwen 3.8 MaxClosedQwen · Qwen3.891.3%Official boardrelease2026-06-25Partially comparable-5.70 pt25 Jun 2026livebench.aiT2History
20Muse Spark 1.2ClosedMeta AI91.2%Official boardrelease2026-06-25Partially comparable-5.80 pt25 Jun 2026livebench.aiT2History
21Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.191.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-5.96 pt25 Jun 2026livebench.aiT2History
22gpt-5.4-nanoClosedOpenAI · GPT 5.491.0%Official boardrelease2026-06-25Partially comparable-6.03 pt25 Jun 2026livebench.aiT2History
23Grok 4.5ClosedxAI · Grok90.8%Official boardrelease2026-06-25Partially comparable-6.18 pt25 Jun 2026livebench.aiT2History
24deepseek-v4-proClosedDeepSeek · V490.7%Official boardrelease2026-06-25Partially comparable-6.33 pt25 Jun 2026livebench.aiT2History
25Claude Opus 4.5ClosedAnthropic · Claude90.4%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-6.62 pt25 Jun 2026livebench.aiT2History
26Smaug Flash90.1%Official boardrelease2026-06-25Partially comparable-6.94 pt25 Jun 2026livebench.aiT2History
27Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.289.8%Official boardrelease2026-06-25Partially comparable-7.23 pt25 Jun 2026livebench.aiT2History
28Smaug Mini89.7%Official boardrelease2026-06-25Partially comparable-7.26 pt25 Jun 2026livebench.aiT2History
29Claude Opus 4.6ClosedAnthropic · Claude89.3%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-7.69 pt25 Jun 2026livebench.aiT2History
30GPT-5.2-CodexClosedOpenAI · GPT 5.288.8%Official boardrelease2026-06-25Partially comparable-8.23 pt25 Jun 2026livebench.aiT2History
31Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 388.7%Official boardrelease2026-06-25Partially comparable-8.34 pt25 Jun 2026livebench.aiT2History
32InklingOpen weightsThinking Machines88.4%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-8.64 pt25 Jun 2026livebench.aiT2History
33Gemini 3.5 FlashClosedGoogle · Gemini 3.588.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.76 pt25 Jun 2026livebench.aiT2History
34GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.387.9%Official boardrelease2026-06-25Partially comparable-9.11 pt25 Jun 2026livebench.aiT2History
35DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V487.8%Official boardrelease2026-06-25Partially comparable-9.20 pt25 Jun 2026livebench.aiT2History
36gpt-5.6-lunaClosedOpenAI · GPT 5.687.2%Official boardrelease2026-06-25Partially comparable-9.81 pt25 Jun 2026livebench.aiT2History
37Muse Spark 1.1ClosedMeta AI87.1%Official boardrelease2026-06-25Partially comparable-9.86 pt25 Jun 2026livebench.aiT2History
38claude-sonnet-4-6-thinking-auto-medium-effort · Claude87.0%Official boardrelease2026-06-25Partially comparable-10.0 pt25 Jun 2026livebench.aiT2History
39DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek86.8%Official boardrelease2026-06-25Partially comparable-10.2 pt25 Jun 2026livebench.aiT2History
40Gemini 3.6 FlashClosedGoogle · Gemini 3.686.4%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-10.6 pt25 Jun 2026livebench.aiT2History
41Qwen3.8 27BOpen weightsQwen · Qwen3.886.2%Official boardreasoningoffrelease2026-06-25Partially comparable-10.8 pt25 Jun 2026livebench.aiT2History
42Qwen3.8 FlashOpen weightsQwen · Qwen3.885.8%Official boardrelease2026-06-25Partially comparable-11.2 pt25 Jun 2026livebench.aiT2History
43Qwen3.7 MaxClosedQwen · Qwen3.785.2%Official boardrelease2026-06-25Partially comparable-11.8 pt25 Jun 2026livebench.aiT2History
44Kimi K3Open weightsMoonshot AI · Kimi84.4%Official boardrelease2026-06-25Partially comparable-12.6 pt25 Jun 2026livebench.aiT2History
45Grok 4.3ClosedxAI · Grok84.3%Official boardrelease2026-06-25Partially comparable-12.7 pt25 Jun 2026livebench.aiT2History
46Kimi K2.6Open weightsMoonshot AI · Kimi84.3%Official boardreasoningonrelease2026-06-25Partially comparable-12.7 pt25 Jun 2026livebench.aiT2History
47Smaug Agentic83.9%Official boardrelease2026-06-25Partially comparable-13.1 pt25 Jun 2026livebench.aiT2History
48Qwen3.6 PlusClosedQwen · Qwen3.683.7%Official boardrelease2026-06-25Partially comparable-13.3 pt25 Jun 2026livebench.aiT2History
49GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.381.2%Official boardrelease2026-06-25Partially comparable-15.8 pt25 Jun 2026livebench.aiT2History
50Qwen3.6 27BOpen weightsQwen · Qwen3.679.9%Official boardrelease2026-06-25Partially comparable-17.1 pt25 Jun 2026livebench.aiT2History
51deepseek-v4-flashOpen weightsDeepSeek · DeepSeek79.6%Official boardrelease2026-06-25Partially comparable-17.4 pt25 Jun 2026livebench.aiT2History
52Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi79.6%Official boardrelease2026-06-25Partially comparable-17.4 pt25 Jun 2026livebench.aiT2History
53gpt-5.4-miniClosedOpenAI · GPT 5.478.5%Official boardrelease2026-06-25Partially comparable-18.5 pt25 Jun 2026livebench.aiT2History
54Grok Build 0.1ClosedxAI · Grok78.4%Official boardrelease2026-06-25Partially comparable-18.6 pt25 Jun 2026livebench.aiT2History
55ox-alpha-max77.5%Official boardrelease2026-06-25Partially comparable-19.5 pt25 Jun 2026livebench.aiT2History
56MiniMax-M3Open weightsMiniMax · MiniMax76.9%Official boardrelease2026-06-25Partially comparable-20.1 pt25 Jun 2026livebench.aiT2History
57Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.573.7%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-23.3 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →