Skip to content
AI Atlas
BenchmarkActivecategory · codingfamily · livebench · variant Coding

LiveBench Coding

livebench.ai

LiveBench coding category — mean of its subtasks (LCB generation, code completion)

data quality57

Updated 2 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
Claude Fable 5.1 86.4%

Score history · Smaug Agentic 1 row

Not enough history to chart — a single observation (82.47% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 82.47%release=2026-06-25 · variant=Coding · subtasks=["code_generation","code_completion"] · livebench_model_id=smaug-agentic25 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Coding

6 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 86.4%Claude Fable 5.1 Anthropic Official board25 Jun 2026
  2. 86.0%Claude Fable 5 Anthropic Official board25 Jun 2026
  3. 83.9%gpt-5.6-sol OpenAI Official board25 Jun 2026
  4. 83.6%GPT-5.2-Codex OpenAI Official board25 Jun 2026
  5. 82.1%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  6. 79.7%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models · trust official-benchmark

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Claude Fable 5.1ClosedAnthropic · Claude86.4%Official boardreasoning_effortmaxrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Claude Fable 5ClosedAnthropic · Claude86.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-0.38 pt25 Jun 2026livebench.aiT2History
3gpt-5.6-solClosedOpenAI · GPT 5.683.9%Official boardrelease2026-06-25Partially comparable-2.43 pt25 Jun 2026livebench.aiT2History
4GPT-5.2-CodexClosedOpenAI · GPT 5.283.6%Official boardrelease2026-06-25Partially comparable-2.76 pt25 Jun 2026livebench.aiT2History
5gpt-5.6-lunaClosedOpenAI · GPT 5.682.9%Official boardrelease2026-06-25Partially comparable-3.46 pt25 Jun 2026livebench.aiT2History
6Smaug Agentic82.5%Official boardrelease2026-06-25Partially comparable-3.90 pt25 Jun 2026livebench.aiT2History
7gpt-5.5ClosedOpenAI · GPT 5.582.1%Official boardrelease2026-06-25Partially comparable-4.23 pt25 Jun 2026livebench.aiT2History
8Claude Opus 4.7ClosedAnthropic · Claude82.1%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-4.29 pt25 Jun 2026livebench.aiT2History
9Claude Opus 4.8ClosedAnthropic · Claude81.8%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-4.55 pt25 Jun 2026livebench.aiT2History
10Claude Opus 5ClosedAnthropic · Claude81.4%Official boardreasoning_effortmaxrelease2026-06-25Comparable-4.93 pt25 Jun 2026livebench.aiT2History
10Kimi K3Open weightsMoonshot AI · Kimi81.4%Official boardrelease2026-06-25Partially comparable-4.93 pt25 Jun 2026livebench.aiT2History
12Muse Spark 1.3ClosedMeta AI81.1%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-5.31 pt25 Jun 2026livebench.aiT2History
13Claude Sonnet 5ClosedAnthropic · Claude80.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-5.69 pt25 Jun 2026livebench.aiT2History
14gpt-6-astraClosedOpenAI · GPT 680.4%Official boardrelease2026-06-25Partially comparable-6.02 pt25 Jun 2026livebench.aiT2History
15DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek80.0%Official boardrelease2026-06-25Partially comparable-6.34 pt25 Jun 2026livebench.aiT2History
16Claude Opus 4.5ClosedAnthropic · Claude79.7%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-6.72 pt25 Jun 2026livebench.aiT2History
16Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.279.7%Official boardrelease2026-06-25Partially comparable-6.72 pt25 Jun 2026livebench.aiT2History
18claude-sonnet-4-6-thinking-auto-medium-effort · Claude79.3%Official boardrelease2026-06-25Partially comparable-7.10 pt25 Jun 2026livebench.aiT2History
19GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.379.0%Official boardrelease2026-06-25Partially comparable-7.42 pt25 Jun 2026livebench.aiT2History
19GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.379.0%Official boardrelease2026-06-25Partially comparable-7.42 pt25 Jun 2026livebench.aiT2History
21Gemini 3.7 FlashClosedGoogle · Gemini 3.778.9%Official boardrelease2026-06-25Partially comparable-7.49 pt25 Jun 2026livebench.aiT2History
22Kimi K2.6Open weightsMoonshot AI · Kimi78.6%Official boardreasoningonrelease2026-06-25Partially comparable-7.81 pt25 Jun 2026livebench.aiT2History
23gpt-5.6-terraClosedOpenAI · GPT 5.678.2%Official boardrelease2026-06-25Partially comparable-8.13 pt25 Jun 2026livebench.aiT2History
24Claude Opus 4.6ClosedAnthropic · Claude78.2%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-8.19 pt25 Jun 2026livebench.aiT2History
24Gemini 3.5 FlashClosedGoogle · Gemini 3.578.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.19 pt25 Jun 2026livebench.aiT2History
24Qwen3.6 PlusClosedQwen · Qwen3.678.2%Official boardrelease2026-06-25Partially comparable-8.19 pt25 Jun 2026livebench.aiT2History
27Gemini 3.6 FlashClosedGoogle · Gemini 3.677.9%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-8.51 pt25 Jun 2026livebench.aiT2History
28Muse Spark 1.2ClosedMeta AI77.5%Official boardrelease2026-06-25Partially comparable-8.83 pt25 Jun 2026livebench.aiT2History
28gpt-5.4ClosedOpenAI · GPT 5.477.5%Official boardrelease2026-06-25Partially comparable-8.83 pt25 Jun 2026livebench.aiT2History
30DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek77.2%Official boardrelease2026-06-25Partially comparable-9.22 pt25 Jun 2026livebench.aiT2History
30Muse Spark 1.1ClosedMeta AI77.2%Official boardrelease2026-06-25Partially comparable-9.22 pt25 Jun 2026livebench.aiT2History
32Smaug Flash77.1%Official boardrelease2026-06-25Partially comparable-9.28 pt25 Jun 2026livebench.aiT2History
33Grok 4.6ClosedxAI · Grok76.8%Official boardrelease2026-06-25Partially comparable-9.60 pt25 Jun 2026livebench.aiT2History
34Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.176.5%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-9.92 pt25 Jun 2026livebench.aiT2History
35Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.576.1%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-10.3 pt25 Jun 2026livebench.aiT2History
35gpt-5.2ClosedOpenAI · GPT 5.276.1%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-10.3 pt25 Jun 2026livebench.aiT2History
37ox-alpha-max75.8%Official boardrelease2026-06-25Partially comparable-10.6 pt25 Jun 2026livebench.aiT2History
38Qwen3.8 27BOpen weightsQwen · Qwen3.875.7%Official boardreasoningoffrelease2026-06-25Partially comparable-10.7 pt25 Jun 2026livebench.aiT2History
39Smaug Mini75.4%Official boardrelease2026-06-25Partially comparable-10.9 pt25 Jun 2026livebench.aiT2History
40DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek75.0%Official boardrelease2026-06-25Partially comparable-11.4 pt25 Jun 2026livebench.aiT2History
41Qwen3.7 MaxClosedQwen · Qwen3.774.2%Official boardrelease2026-06-25Partially comparable-12.2 pt25 Jun 2026livebench.aiT2History
42Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi74.0%Official boardrelease2026-06-25Partially comparable-12.4 pt25 Jun 2026livebench.aiT2History
43Qwen 3.8 MaxClosedQwen · Qwen3.872.9%Official boardrelease2026-06-25Partially comparable-13.5 pt25 Jun 2026livebench.aiT2History
44Qwen3.8 FlashOpen weightsQwen · Qwen3.872.5%Official boardrelease2026-06-25Partially comparable-13.8 pt25 Jun 2026livebench.aiT2History
45Gemini 3.8 FlashClosedGoogle · Gemini 3.872.5%Official boardrelease2026-06-25Partially comparable-13.9 pt25 Jun 2026livebench.aiT2History
46Qwen3.6 27BOpen weightsQwen · Qwen3.671.8%Official boardrelease2026-06-25Partially comparable-14.6 pt25 Jun 2026livebench.aiT2History
47gpt-5.4-miniClosedOpenAI · GPT 5.471.6%Official boardrelease2026-06-25Partially comparable-14.8 pt25 Jun 2026livebench.aiT2History
48InklingOpen weightsThinking Machines71.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-15.4 pt25 Jun 2026livebench.aiT2History
49gpt-5.4-nanoClosedOpenAI · GPT 5.470.8%Official boardrelease2026-06-25Partially comparable-15.5 pt25 Jun 2026livebench.aiT2History
50Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 370.7%Official boardrelease2026-06-25Partially comparable-15.7 pt25 Jun 2026livebench.aiT2History
51deepseek-v4-proClosedDeepSeek · V470.0%Official boardrelease2026-06-25Partially comparable-16.4 pt25 Jun 2026livebench.aiT2History
52Grok 4.3ClosedxAI · Grok69.9%Official boardrelease2026-06-25Partially comparable-16.4 pt25 Jun 2026livebench.aiT2History
53deepseek-v4-flashOpen weightsDeepSeek · DeepSeek69.2%Official boardrelease2026-06-25Partially comparable-17.1 pt25 Jun 2026livebench.aiT2History
54Grok 4.5ClosedxAI · Grok68.6%Official boardrelease2026-06-25Partially comparable-17.8 pt25 Jun 2026livebench.aiT2History
55DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V468.2%Official boardrelease2026-06-25Partially comparable-18.2 pt25 Jun 2026livebench.aiT2History
55MiniMax-M3Open weightsMiniMax · MiniMax68.2%Official boardrelease2026-06-25Partially comparable-18.2 pt25 Jun 2026livebench.aiT2History
57Grok Build 0.1ClosedxAI · Grok65.4%Official boardrelease2026-06-25Partially comparable-21.0 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →