Skip to content
AI Atlas
BenchmarkActivecategory · generalfamily · livebench · variant Data Analysis

LiveBench Data Analysis

livebench.ai

LiveBench data analysis category — mean of its subtasks (table reformatting, join, column type)

data quality57

Updated 5 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
gpt-6-astra 83.0%

Score history · DeepSeek V4 Flash (0731) 1 row

Not enough history to chart — a single observation (79.33% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 79.33%release=2026-06-25 · variant=Data Analysis · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=deepseek-v4-flash-073125 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=Data Analysis

6 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 83.0%gpt-6-astra OpenAI Official board25 Jun 2026
  2. 81.6%gpt-5.5 OpenAI Official board25 Jun 2026
  3. 79.3%gpt-5.4 OpenAI Official board25 Jun 2026
  4. 78.5%Gemini 3.1 Pro Preview Google Official board25 Jun 2026
  5. 78.3%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  6. 74.4%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1gpt-6-astraClosedOpenAI · GPT 683.0%Official boardrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2gpt-5.5ClosedOpenAI · GPT 5.581.6%Official boardrelease2026-06-25Comparable-1.40 pt25 Jun 2026livebench.aiT2History
3Claude Fable 5ClosedAnthropic · Claude80.5%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-2.44 pt25 Jun 2026livebench.aiT2History
4Claude Fable 5.1ClosedAnthropic · Claude80.3%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-2.70 pt25 Jun 2026livebench.aiT2History
5Smaug Agentic79.9%Official boardrelease2026-06-25Comparable-3.08 pt25 Jun 2026livebench.aiT2History
6gpt-5.6-solClosedOpenAI · GPT 5.679.8%Official boardrelease2026-06-25Comparable-3.13 pt25 Jun 2026livebench.aiT2History
7Muse Spark 1.3ClosedMeta AI79.6%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-3.41 pt25 Jun 2026livebench.aiT2History
8DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V479.5%Official boardrelease2026-06-25Comparable-3.50 pt25 Jun 2026livebench.aiT2History
9DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek79.3%Official boardrelease2026-06-25Comparable-3.65 pt25 Jun 2026livebench.aiT2History
10gpt-5.4ClosedOpenAI · GPT 5.479.3%Official boardrelease2026-06-25Comparable-3.66 pt25 Jun 2026livebench.aiT2History
11gpt-5.6-terraClosedOpenAI · GPT 5.679.3%Official boardrelease2026-06-25Comparable-3.67 pt25 Jun 2026livebench.aiT2History
12DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek79.3%Official boardrelease2026-06-25Comparable-3.72 pt25 Jun 2026livebench.aiT2History
13DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek79.2%Official boardrelease2026-06-25Comparable-3.73 pt25 Jun 2026livebench.aiT2History
14Smaug Flash79.1%Official boardrelease2026-06-25Comparable-3.85 pt25 Jun 2026livebench.aiT2History
15Smaug Mini78.8%Official boardrelease2026-06-25Comparable-4.16 pt25 Jun 2026livebench.aiT2History
16Kimi K3Open weightsMoonshot AI · Kimi78.7%Official boardrelease2026-06-25Comparable-4.24 pt25 Jun 2026livebench.aiT2History
17Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.178.5%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-4.43 pt25 Jun 2026livebench.aiT2History
18Qwen 3.8 MaxClosedQwen · Qwen3.878.4%Official boardrelease2026-06-25Comparable-4.56 pt25 Jun 2026livebench.aiT2History
19Claude Opus 4.7ClosedAnthropic · Claude78.3%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-4.71 pt25 Jun 2026livebench.aiT2History
20GPT-5.2-CodexClosedOpenAI · GPT 5.278.2%Official boardrelease2026-06-25Comparable-4.77 pt25 Jun 2026livebench.aiT2History
21gpt-5.2ClosedOpenAI · GPT 5.278.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-4.81 pt25 Jun 2026livebench.aiT2History
22gpt-5.6-lunaClosedOpenAI · GPT 5.678.0%Official boardrelease2026-06-25Comparable-4.94 pt25 Jun 2026livebench.aiT2History
23claude-sonnet-4-6-thinking-auto-medium-effort · Claude77.9%Official boardrelease2026-06-25Comparable-5.03 pt25 Jun 2026livebench.aiT2History
24Qwen3.8 27BOpen weightsQwen · Qwen3.876.6%Official boardreasoningoffrelease2026-06-25Partially comparable-6.39 pt25 Jun 2026livebench.aiT2History
25Muse Spark 1.2ClosedMeta AI76.5%Official boardrelease2026-06-25Comparable-6.52 pt25 Jun 2026livebench.aiT2History
26GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.376.4%Official boardrelease2026-06-25Comparable-6.57 pt25 Jun 2026livebench.aiT2History
27MiniMax-M3Open weightsMiniMax · MiniMax76.2%Official boardrelease2026-06-25Comparable-6.81 pt25 Jun 2026livebench.aiT2History
28ox-alpha-max75.8%Official boardrelease2026-06-25Comparable-7.21 pt25 Jun 2026livebench.aiT2History
29Claude Opus 5ClosedAnthropic · Claude74.5%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-8.42 pt25 Jun 2026livebench.aiT2History
30deepseek-v4-proClosedDeepSeek · V474.5%Official boardrelease2026-06-25Comparable-8.44 pt25 Jun 2026livebench.aiT2History
31Claude Opus 4.5ClosedAnthropic · Claude74.4%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-8.53 pt25 Jun 2026livebench.aiT2History
32Qwen3.8 FlashOpen weightsQwen · Qwen3.874.2%Official boardrelease2026-06-25Comparable-8.73 pt25 Jun 2026livebench.aiT2History
33Grok 4.6ClosedxAI · Grok73.9%Official boardrelease2026-06-25Comparable-9.12 pt25 Jun 2026livebench.aiT2History
34Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.273.7%Official boardrelease2026-06-25Comparable-9.23 pt25 Jun 2026livebench.aiT2History
35Grok 4.5ClosedxAI · Grok73.0%Official boardrelease2026-06-25Comparable-9.94 pt25 Jun 2026livebench.aiT2History
36InklingOpen weightsThinking Machines72.8%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-10.2 pt25 Jun 2026livebench.aiT2History
37Muse Spark 1.1ClosedMeta AI72.5%Official boardrelease2026-06-25Comparable-10.4 pt25 Jun 2026livebench.aiT2History
38Qwen3.7 MaxClosedQwen · Qwen3.771.8%Official boardrelease2026-06-25Comparable-11.2 pt25 Jun 2026livebench.aiT2History
39Claude Sonnet 5ClosedAnthropic · Claude71.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-11.2 pt25 Jun 2026livebench.aiT2History
40Grok Build 0.1ClosedxAI · Grok70.8%Official boardrelease2026-06-25Comparable-12.2 pt25 Jun 2026livebench.aiT2History
41gpt-5.4-miniClosedOpenAI · GPT 5.470.8%Official boardrelease2026-06-25Comparable-12.2 pt25 Jun 2026livebench.aiT2History
42Qwen3.6 27BOpen weightsQwen · Qwen3.670.4%Official boardrelease2026-06-25Comparable-12.5 pt25 Jun 2026livebench.aiT2History
43GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.370.2%Official boardrelease2026-06-25Comparable-12.7 pt25 Jun 2026livebench.aiT2History
44Qwen3.6 PlusClosedQwen · Qwen3.669.9%Official boardrelease2026-06-25Comparable-13.1 pt25 Jun 2026livebench.aiT2History
45Claude Opus 4.6ClosedAnthropic · Claude69.9%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-13.1 pt25 Jun 2026livebench.aiT2History
46deepseek-v4-flashOpen weightsDeepSeek · DeepSeek68.0%Official boardrelease2026-06-25Comparable-15.0 pt25 Jun 2026livebench.aiT2History
47Gemini 3.7 FlashClosedGoogle · Gemini 3.768.0%Official boardrelease2026-06-25Comparable-15.0 pt25 Jun 2026livebench.aiT2History
48gpt-5.4-nanoClosedOpenAI · GPT 5.467.6%Official boardrelease2026-06-25Comparable-15.3 pt25 Jun 2026livebench.aiT2History
49Claude Opus 4.8ClosedAnthropic · Claude66.0%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-16.9 pt25 Jun 2026livebench.aiT2History
50Kimi K2.6Open weightsMoonshot AI · Kimi65.1%Official boardreasoningonrelease2026-06-25Partially comparable-17.8 pt25 Jun 2026livebench.aiT2History
51Gemini 3.5 FlashClosedGoogle · Gemini 3.564.9%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-18.1 pt25 Jun 2026livebench.aiT2History
52Gemini 3.6 FlashClosedGoogle · Gemini 3.663.0%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-20.0 pt25 Jun 2026livebench.aiT2History
53Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi62.7%Official boardrelease2026-06-25Comparable-20.3 pt25 Jun 2026livebench.aiT2History
54Grok 4.3ClosedxAI · Grok55.8%Official boardrelease2026-06-25Comparable-27.2 pt25 Jun 2026livebench.aiT2History
55Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 354.5%Official boardrelease2026-06-25Comparable-28.5 pt25 Jun 2026livebench.aiT2History
56Gemini 3.8 FlashClosedGoogle · Gemini 3.854.0%Official boardrelease2026-06-25Comparable-29.0 pt25 Jun 2026livebench.aiT2History
57Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.553.3%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-29.7 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →