Skip to content
AI Atlas
BenchmarkActivecategory · codingfamily · livebench · variant Agentic Coding

LiveBench Agentic Coding

livebench.ai

LiveBench agentic coding category — mean of its subtasks

data quality57

Updated 6 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
DeepSeek-V4.1-Flash 77.3%

Score history · Gemini 3.5 Flash 1 row

Not enough history to chart — a single observation (48.99% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 48.99%release=2026-06-25 · variant=Agentic Coding · subtasks=["javascript","typescript","python"] · aa_variant_slug=gemini-3.5-flash-high25 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Agentic Coding

8 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 77.3%DeepSeek-V4.1-Flash DeepSeek Official board25 Jun 2026
  2. 66.1%Claude Fable 5.1 Anthropic Official board25 Jun 2026
  3. 65.2%Claude Opus 5 Anthropic Official board25 Jun 2026
  4. 62.2%Claude Fable 5 Anthropic Official board25 Jun 2026
  5. 59.4%Claude Sonnet 5 Anthropic Official board25 Jun 2026
  6. 50.7%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  7. 49.0%Claude Opus 4.6 Anthropic Official board25 Jun 2026
  8. 39.7%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek77.3%Official boardrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Claude Fable 5.1ClosedAnthropic · Claude66.1%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-11.2 pt25 Jun 2026livebench.aiT2History
3Claude Opus 5ClosedAnthropic · Claude65.2%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-12.1 pt25 Jun 2026livebench.aiT2History
4DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V465.1%Official boardrelease2026-06-25Comparable-12.2 pt25 Jun 2026livebench.aiT2History
5Qwen 3.8 MaxClosedQwen · Qwen3.864.6%Official boardrelease2026-06-25Comparable-12.6 pt25 Jun 2026livebench.aiT2History
5Smaug Agentic64.6%Official boardrelease2026-06-25Comparable-12.6 pt25 Jun 2026livebench.aiT2History
7Muse Spark 1.3ClosedMeta AI64.1%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-13.2 pt25 Jun 2026livebench.aiT2History
8Claude Fable 5ClosedAnthropic · Claude62.2%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-15.1 pt25 Jun 2026livebench.aiT2History
8Kimi K3Open weightsMoonshot AI · Kimi62.2%Official boardrelease2026-06-25Comparable-15.1 pt25 Jun 2026livebench.aiT2History
10Qwen3.8 FlashOpen weightsQwen · Qwen3.861.6%Official boardrelease2026-06-25Comparable-15.7 pt25 Jun 2026livebench.aiT2History
11Qwen3.8 27BOpen weightsQwen · Qwen3.861.4%Official boardreasoningoffrelease2026-06-25Partially comparable-15.9 pt25 Jun 2026livebench.aiT2History
12Smaug Flash61.1%Official boardrelease2026-06-25Comparable-16.2 pt25 Jun 2026livebench.aiT2History
13GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.360.9%Official boardrelease2026-06-25Comparable-16.4 pt25 Jun 2026livebench.aiT2History
14Smaug Mini60.8%Official boardrelease2026-06-25Comparable-16.5 pt25 Jun 2026livebench.aiT2History
15Claude Sonnet 5ClosedAnthropic · Claude59.4%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-17.9 pt25 Jun 2026livebench.aiT2History
16Muse Spark 1.1ClosedMeta AI58.5%Official boardrelease2026-06-25Comparable-18.7 pt25 Jun 2026livebench.aiT2History
17Gemini 3.7 FlashClosedGoogle · Gemini 3.758.3%Official boardrelease2026-06-25Comparable-19.0 pt25 Jun 2026livebench.aiT2History
18Muse Spark 1.2ClosedMeta AI57.6%Official boardrelease2026-06-25Comparable-19.7 pt25 Jun 2026livebench.aiT2History
19gpt-6-astraClosedOpenAI · GPT 657.3%Official boardrelease2026-06-25Comparable-19.9 pt25 Jun 2026livebench.aiT2History
20Grok 4.6ClosedxAI · Grok57.0%Official boardrelease2026-06-25Comparable-20.3 pt25 Jun 2026livebench.aiT2History
21GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.356.8%Official boardrelease2026-06-25Comparable-20.5 pt25 Jun 2026livebench.aiT2History
22Grok 4.5ClosedxAI · Grok56.5%Official boardrelease2026-06-25Comparable-20.8 pt25 Jun 2026livebench.aiT2History
23gpt-5.6-solClosedOpenAI · GPT 5.656.2%Official boardrelease2026-06-25Comparable-21.1 pt25 Jun 2026livebench.aiT2History
24DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek55.0%Official boardrelease2026-06-25Comparable-22.3 pt25 Jun 2026livebench.aiT2History
24gpt-5.6-terraClosedOpenAI · GPT 5.655.0%Official boardrelease2026-06-25Comparable-22.3 pt25 Jun 2026livebench.aiT2History
26Gemini 3.8 FlashClosedGoogle · Gemini 3.854.2%Official boardrelease2026-06-25Comparable-23.0 pt25 Jun 2026livebench.aiT2History
27gpt-5.5ClosedOpenAI · GPT 5.554.0%Official boardrelease2026-06-25Comparable-23.3 pt25 Jun 2026livebench.aiT2History
28gpt-5.4ClosedOpenAI · GPT 5.453.8%Official boardrelease2026-06-25Comparable-23.4 pt25 Jun 2026livebench.aiT2History
29ox-alpha-max52.6%Official boardrelease2026-06-25Comparable-24.6 pt25 Jun 2026livebench.aiT2History
30Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.251.8%Official boardrelease2026-06-25Comparable-25.5 pt25 Jun 2026livebench.aiT2History
31Claude Opus 4.7ClosedAnthropic · Claude50.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-26.6 pt25 Jun 2026livebench.aiT2History
32Claude Opus 4.8ClosedAnthropic · Claude50.5%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-26.8 pt25 Jun 2026livebench.aiT2History
33gpt-5.2ClosedOpenAI · GPT 5.250.3%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-27.0 pt25 Jun 2026livebench.aiT2History
34GPT-5.2-CodexClosedOpenAI · GPT 5.249.4%Official boardrelease2026-06-25Comparable-27.9 pt25 Jun 2026livebench.aiT2History
34InklingOpen weightsThinking Machines49.4%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-27.9 pt25 Jun 2026livebench.aiT2History
36Claude Opus 4.6ClosedAnthropic · Claude49.0%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-28.3 pt25 Jun 2026livebench.aiT2History
36Gemini 3.5 FlashClosedGoogle · Gemini 3.549.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-28.3 pt25 Jun 2026livebench.aiT2History
38gpt-5.6-lunaClosedOpenAI · GPT 5.648.4%Official boardrelease2026-06-25Comparable-28.8 pt25 Jun 2026livebench.aiT2History
39Kimi K2.6Open weightsMoonshot AI · Kimi46.9%Official boardreasoningonrelease2026-06-25Partially comparable-30.4 pt25 Jun 2026livebench.aiT2History
40DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek46.8%Official boardrelease2026-06-25Comparable-30.5 pt25 Jun 2026livebench.aiT2History
40gpt-5.4-nanoClosedOpenAI · GPT 5.446.8%Official boardrelease2026-06-25Comparable-30.5 pt25 Jun 2026livebench.aiT2History
42Grok Build 0.1ClosedxAI · Grok45.8%Official boardrelease2026-06-25Comparable-31.5 pt25 Jun 2026livebench.aiT2History
43Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi45.7%Official boardrelease2026-06-25Comparable-31.6 pt25 Jun 2026livebench.aiT2History
44Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.545.3%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-32.0 pt25 Jun 2026livebench.aiT2History
45Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.144.1%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-33.1 pt25 Jun 2026livebench.aiT2History
46Qwen3.7 MaxClosedQwen · Qwen3.743.6%Official boardrelease2026-06-25Comparable-33.7 pt25 Jun 2026livebench.aiT2History
47Gemini 3.6 FlashClosedGoogle · Gemini 3.643.4%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-33.8 pt25 Jun 2026livebench.aiT2History
48claude-sonnet-4-6-thinking-auto-medium-effort · Claude42.6%Official boardrelease2026-06-25Comparable-34.6 pt25 Jun 2026livebench.aiT2History
48deepseek-v4-proClosedDeepSeek · V442.6%Official boardrelease2026-06-25Comparable-34.6 pt25 Jun 2026livebench.aiT2History
50gpt-5.4-miniClosedOpenAI · GPT 5.441.7%Official boardrelease2026-06-25Comparable-35.6 pt25 Jun 2026livebench.aiT2History
51Qwen3.6 PlusClosedQwen · Qwen3.641.4%Official boardrelease2026-06-25Comparable-35.9 pt25 Jun 2026livebench.aiT2History
52MiniMax-M3Open weightsMiniMax · MiniMax40.7%Official boardrelease2026-06-25Comparable-36.6 pt25 Jun 2026livebench.aiT2History
53Claude Opus 4.5ClosedAnthropic · Claude39.7%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-37.6 pt25 Jun 2026livebench.aiT2History
54Qwen3.6 27BOpen weightsQwen · Qwen3.639.3%Official boardrelease2026-06-25Comparable-38.0 pt25 Jun 2026livebench.aiT2History
55Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 338.7%Official boardrelease2026-06-25Comparable-38.5 pt25 Jun 2026livebench.aiT2History
56deepseek-v4-flashOpen weightsDeepSeek · DeepSeek37.6%Official boardrelease2026-06-25Comparable-39.6 pt25 Jun 2026livebench.aiT2History
57Grok 4.3ClosedxAI · Grok18.5%Official boardrelease2026-06-25Comparable-58.7 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →