Skip to content
AI Atlas
BenchmarkActivecategory · generalfamily · livebench · variant Language

LiveBench Language

livebench.ai

LiveBench language category — mean of its subtasks (typos, connections, plot unscrambling)

data quality57

Updated 3 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
Claude Fable 5 90.7%

Score history · gpt-5.4-mini 1 row

Not enough history to chart — a single observation (70.95% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 70.95%release=2026-06-25 · variant=Language · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=gpt-5.4-mini-xhigh25 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Language

6 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 90.7%Claude Fable 5 Anthropic Official board25 Jun 2026
  2. 87.7%gpt-5.6-sol OpenAI Official board25 Jun 2026
  3. 87.4%gpt-5.5 OpenAI Official board25 Jun 2026
  4. 85.4%Gemini 3.1 Pro Preview Google Official board25 Jun 2026
  5. 83.3%Claude Opus 4.6 Anthropic Official board25 Jun 2026
  6. 81.3%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Claude Fable 5ClosedAnthropic · Claude90.7%Official boardreasoning_effortxhighrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Claude Fable 5.1ClosedAnthropic · Claude89.5%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-1.18 pt25 Jun 2026livebench.aiT2History
3gpt-6-astraClosedOpenAI · GPT 689.4%Official boardrelease2026-06-25Partially comparable-1.25 pt25 Jun 2026livebench.aiT2History
4Claude Opus 5ClosedAnthropic · Claude88.7%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-2.00 pt25 Jun 2026livebench.aiT2History
5Gemini 3.8 FlashClosedGoogle · Gemini 3.887.8%Official boardrelease2026-06-25Partially comparable-2.89 pt25 Jun 2026livebench.aiT2History
6gpt-5.6-solClosedOpenAI · GPT 5.687.7%Official boardrelease2026-06-25Partially comparable-3.00 pt25 Jun 2026livebench.aiT2History
7gpt-5.5ClosedOpenAI · GPT 5.587.4%Official boardrelease2026-06-25Partially comparable-3.32 pt25 Jun 2026livebench.aiT2History
8Kimi K3Open weightsMoonshot AI · Kimi85.5%Official boardrelease2026-06-25Partially comparable-5.16 pt25 Jun 2026livebench.aiT2History
9Gemini 3.7 FlashClosedGoogle · Gemini 3.785.5%Official boardrelease2026-06-25Partially comparable-5.23 pt25 Jun 2026livebench.aiT2History
10Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.185.4%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-5.31 pt25 Jun 2026livebench.aiT2History
11Gemini 3.5 FlashClosedGoogle · Gemini 3.584.6%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-6.10 pt25 Jun 2026livebench.aiT2History
12Smaug Agentic84.4%Official boardrelease2026-06-25Partially comparable-6.33 pt25 Jun 2026livebench.aiT2History
13Gemini 3.6 FlashClosedGoogle · Gemini 3.683.9%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-6.79 pt25 Jun 2026livebench.aiT2History
14Grok 4.6ClosedxAI · Grok83.7%Official boardrelease2026-06-25Partially comparable-6.99 pt25 Jun 2026livebench.aiT2History
15Claude Opus 4.6ClosedAnthropic · Claude83.3%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-7.41 pt25 Jun 2026livebench.aiT2History
16gpt-5.6-terraClosedOpenAI · GPT 5.682.9%Official boardrelease2026-06-25Partially comparable-7.79 pt25 Jun 2026livebench.aiT2History
17Grok 4.5ClosedxAI · Grok82.8%Official boardrelease2026-06-25Partially comparable-7.89 pt25 Jun 2026livebench.aiT2History
18Muse Spark 1.3ClosedMeta AI82.8%Official boardreasoning_effortxhighrelease2026-06-25Comparable-7.89 pt25 Jun 2026livebench.aiT2History
19gpt-5.4ClosedOpenAI · GPT 5.482.6%Official boardrelease2026-06-25Partially comparable-8.05 pt25 Jun 2026livebench.aiT2History
20DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek82.1%Official boardrelease2026-06-25Partially comparable-8.61 pt25 Jun 2026livebench.aiT2History
21Claude Opus 4.5ClosedAnthropic · Claude81.3%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-9.42 pt25 Jun 2026livebench.aiT2History
22DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek81.2%Official boardrelease2026-06-25Partially comparable-9.49 pt25 Jun 2026livebench.aiT2History
23DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V480.4%Official boardrelease2026-06-25Partially comparable-10.3 pt25 Jun 2026livebench.aiT2History
24GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.379.9%Official boardrelease2026-06-25Partially comparable-10.8 pt25 Jun 2026livebench.aiT2History
25gpt-5.2ClosedOpenAI · GPT 5.279.8%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-10.9 pt25 Jun 2026livebench.aiT2History
26Qwen3.7 MaxClosedQwen · Qwen3.779.7%Official boardrelease2026-06-25Partially comparable-10.9 pt25 Jun 2026livebench.aiT2History
27Qwen 3.8 MaxClosedQwen · Qwen3.879.7%Official boardrelease2026-06-25Partially comparable-11.0 pt25 Jun 2026livebench.aiT2History
28Claude Opus 4.8ClosedAnthropic · Claude79.7%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-11.0 pt25 Jun 2026livebench.aiT2History
29Smaug Flash79.2%Official boardrelease2026-06-25Partially comparable-11.5 pt25 Jun 2026livebench.aiT2History
30DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek79.2%Official boardrelease2026-06-25Partially comparable-11.5 pt25 Jun 2026livebench.aiT2History
31Muse Spark 1.2ClosedMeta AI78.6%Official boardrelease2026-06-25Partially comparable-12.1 pt25 Jun 2026livebench.aiT2History
32deepseek-v4-proClosedDeepSeek · V478.1%Official boardrelease2026-06-25Partially comparable-12.6 pt25 Jun 2026livebench.aiT2History
33Claude Opus 4.7ClosedAnthropic · Claude77.9%Official boardreasoning_effortxhighrelease2026-06-25Comparable-12.8 pt25 Jun 2026livebench.aiT2History
34Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi77.9%Official boardrelease2026-06-25Partially comparable-12.8 pt25 Jun 2026livebench.aiT2History
35GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.377.3%Official boardrelease2026-06-25Partially comparable-13.4 pt25 Jun 2026livebench.aiT2History
36Smaug Mini77.0%Official boardrelease2026-06-25Partially comparable-13.7 pt25 Jun 2026livebench.aiT2History
37MiniMax-M3Open weightsMiniMax · MiniMax76.8%Official boardrelease2026-06-25Partially comparable-13.8 pt25 Jun 2026livebench.aiT2History
38Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.276.2%Official boardrelease2026-06-25Partially comparable-14.4 pt25 Jun 2026livebench.aiT2History
39claude-sonnet-4-6-thinking-auto-medium-effort · Claude76.1%Official boardrelease2026-06-25Partially comparable-14.6 pt25 Jun 2026livebench.aiT2History
40Kimi K2.6Open weightsMoonshot AI · Kimi75.1%Official boardreasoningonrelease2026-06-25Partially comparable-15.5 pt25 Jun 2026livebench.aiT2History
41Qwen3.6 PlusClosedQwen · Qwen3.675.0%Official boardrelease2026-06-25Partially comparable-15.7 pt25 Jun 2026livebench.aiT2History
42Claude Sonnet 5ClosedAnthropic · Claude75.0%Official boardreasoning_effortxhighrelease2026-06-25Comparable-15.7 pt25 Jun 2026livebench.aiT2History
43Qwen3.8 FlashOpen weightsQwen · Qwen3.874.6%Official boardrelease2026-06-25Partially comparable-16.0 pt25 Jun 2026livebench.aiT2History
44Qwen3.8 27BOpen weightsQwen · Qwen3.874.3%Official boardreasoningoffrelease2026-06-25Partially comparable-16.3 pt25 Jun 2026livebench.aiT2History
45Muse Spark 1.1ClosedMeta AI74.3%Official boardrelease2026-06-25Partially comparable-16.3 pt25 Jun 2026livebench.aiT2History
46GPT-5.2-CodexClosedOpenAI · GPT 5.273.7%Official boardrelease2026-06-25Partially comparable-17.0 pt25 Jun 2026livebench.aiT2History
47Grok 4.3ClosedxAI · Grok73.6%Official boardrelease2026-06-25Partially comparable-17.1 pt25 Jun 2026livebench.aiT2History
48InklingOpen weightsThinking Machines73.5%Official boardreasoning_effortxhighrelease2026-06-25Comparable-17.2 pt25 Jun 2026livebench.aiT2History
49gpt-5.6-lunaClosedOpenAI · GPT 5.672.6%Official boardrelease2026-06-25Partially comparable-18.1 pt25 Jun 2026livebench.aiT2History
50Grok Build 0.1ClosedxAI · Grok72.5%Official boardrelease2026-06-25Partially comparable-18.2 pt25 Jun 2026livebench.aiT2History
51Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.571.8%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-18.9 pt25 Jun 2026livebench.aiT2History
52gpt-5.4-miniClosedOpenAI · GPT 5.471.0%Official boardrelease2026-06-25Partially comparable-19.7 pt25 Jun 2026livebench.aiT2History
53Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 370.8%Official boardrelease2026-06-25Partially comparable-19.9 pt25 Jun 2026livebench.aiT2History
54deepseek-v4-flashOpen weightsDeepSeek · DeepSeek70.1%Official boardrelease2026-06-25Partially comparable-20.6 pt25 Jun 2026livebench.aiT2History
55ox-alpha-max66.1%Official boardrelease2026-06-25Partially comparable-24.5 pt25 Jun 2026livebench.aiT2History
56Qwen3.6 27BOpen weightsQwen · Qwen3.663.3%Official boardrelease2026-06-25Partially comparable-27.4 pt25 Jun 2026livebench.aiT2History
57gpt-5.4-nanoClosedOpenAI · GPT 5.462.5%Official boardrelease2026-06-25Partially comparable-28.2 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →