Skip to content
AI Atlas
BenchmarkActivecategory · instruction-followingfamily · livebench · variant IF

LiveBench Instruction Following

livebench.ai

LiveBench instruction-following category — mean of its subtasks (paraphrase, simplify, story generation, summarize)

data quality57

Updated 2 h ago · first seen 12 Sept 2026

Metric
average score · %
Current results
57
Models
57
Current leader
Gemini 3.8 Flash 81.4%

Score history · Grok 4.6 1 row

Not enough history to chart — a single observation (71.87% on 25 Jun 2026). Rows under different configurations count separately; the list below shows each one.

  • 71.87%release=2026-06-25 · variant=IF · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=grok-4.625 Jun 2026

Back to the leaderboard

Frontier over time · average score · variant=IF

6 leader changes recorded, all dated 25 Jun 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 81.4%Gemini 3.8 Flash Google Official board25 Jun 2026
  2. 79.9%Gemini 3.7 Flash Google Official board25 Jun 2026
  3. 79.1%Gemini 3.1 Pro Preview Google Official board25 Jun 2026
  4. 66.7%Claude Opus 4.7 Anthropic Official board25 Jun 2026
  5. 63.3%Claude Opus 4.6 Anthropic Official board25 Jun 2026
  6. 62.5%Claude Opus 4.5 Anthropic Official board25 Jun 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 57 models · trust official-benchmark

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1Gemini 3.8 FlashClosedGoogle · Gemini 3.881.4%Official boardrelease2026-06-25leader25 Jun 2026livebench.aiT2History
2Gemini 3.7 FlashClosedGoogle · Gemini 3.779.9%Official boardrelease2026-06-25Comparable-1.49 pt25 Jun 2026livebench.aiT2History
3Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.179.1%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-2.31 pt25 Jun 2026livebench.aiT2History
4Muse Spark 1.3ClosedMeta AI78.0%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-3.41 pt25 Jun 2026livebench.aiT2History
5Qwen3.8 FlashOpen weightsQwen · Qwen3.877.1%Official boardrelease2026-06-25Comparable-4.30 pt25 Jun 2026livebench.aiT2History
6Claude Fable 5ClosedAnthropic · Claude75.8%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-5.64 pt25 Jun 2026livebench.aiT2History
7Gemini 3.5 FlashClosedGoogle · Gemini 3.575.6%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-5.81 pt25 Jun 2026livebench.aiT2History
8gpt-6-astraClosedOpenAI · GPT 675.6%Official boardrelease2026-06-25Comparable-5.83 pt25 Jun 2026livebench.aiT2History
9Gemini 3.6 FlashClosedGoogle · Gemini 3.675.4%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-6.05 pt25 Jun 2026livebench.aiT2History
10Muse Spark 1.2ClosedMeta AI74.3%Official boardrelease2026-06-25Comparable-7.09 pt25 Jun 2026livebench.aiT2History
11Qwen 3.8 MaxClosedQwen · Qwen3.874.1%Official boardrelease2026-06-25Comparable-7.33 pt25 Jun 2026livebench.aiT2History
12Qwen3.7 MaxClosedQwen · Qwen3.774.0%Official boardrelease2026-06-25Comparable-7.37 pt25 Jun 2026livebench.aiT2History
13Smaug Mini73.9%Official boardrelease2026-06-25Comparable-7.50 pt25 Jun 2026livebench.aiT2History
14Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 373.4%Official boardrelease2026-06-25Comparable-7.97 pt25 Jun 2026livebench.aiT2History
15Claude Fable 5.1ClosedAnthropic · Claude73.0%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-8.42 pt25 Jun 2026livebench.aiT2History
16Qwen3.8 27BOpen weightsQwen · Qwen3.872.7%Official boardreasoningoffrelease2026-06-25Partially comparable-8.75 pt25 Jun 2026livebench.aiT2History
17Claude Opus 4.8ClosedAnthropic · Claude72.0%Official boardreasoningonreasoning_effortmaxrelease2026-06-25Partially comparable-9.38 pt25 Jun 2026livebench.aiT2History
18Grok 4.6ClosedxAI · Grok71.9%Official boardrelease2026-06-25Comparable-9.55 pt25 Jun 2026livebench.aiT2History
19gpt-5.6-solClosedOpenAI · GPT 5.671.8%Official boardrelease2026-06-25Comparable-9.57 pt25 Jun 2026livebench.aiT2History
20Grok 4.5ClosedxAI · Grok71.5%Official boardrelease2026-06-25Comparable-9.88 pt25 Jun 2026livebench.aiT2History
21Kimi K3Open weightsMoonshot AI · Kimi71.4%Official boardrelease2026-06-25Comparable-10.0 pt25 Jun 2026livebench.aiT2History
22Smaug Agentic71.0%Official boardrelease2026-06-25Comparable-10.4 pt25 Jun 2026livebench.aiT2History
23DeepSeek V4 Flash Vision ExpOpen weightsDeepSeek · DeepSeek-V471.0%Official boardrelease2026-06-25Comparable-10.5 pt25 Jun 2026livebench.aiT2History
24gpt-5.5ClosedOpenAI · GPT 5.570.7%Official boardrelease2026-06-25Comparable-10.7 pt25 Jun 2026livebench.aiT2History
25gpt-5.4ClosedOpenAI · GPT 5.470.2%Official boardrelease2026-06-25Comparable-11.2 pt25 Jun 2026livebench.aiT2History
26InklingOpen weightsThinking Machines70.1%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-11.3 pt25 Jun 2026livebench.aiT2History
27DeepSeek-V4.1-FlashOpen weightsDeepSeek · DeepSeek70.0%Official boardrelease2026-06-25Comparable-11.4 pt25 Jun 2026livebench.aiT2History
28Muse Spark 1.1ClosedMeta AI69.6%Official boardrelease2026-06-25Comparable-11.8 pt25 Jun 2026livebench.aiT2History
29GLM 5.3Open weightsZ.ai (Zhipu AI) · GLM5.369.3%Official boardrelease2026-06-25Comparable-12.1 pt25 Jun 2026livebench.aiT2History
30Smaug Flash69.3%Official boardrelease2026-06-25Comparable-12.2 pt25 Jun 2026livebench.aiT2History
31DeepSeek-V4-Pro-0813Open weightsDeepSeek · DeepSeek67.7%Official boardrelease2026-06-25Comparable-13.7 pt25 Jun 2026livebench.aiT2History
32Gemini 3.5 Flash-LiteClosedGoogle · Gemini 3.567.2%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-14.2 pt25 Jun 2026livebench.aiT2History
33gpt-5.4-nanoClosedOpenAI · GPT 5.467.2%Official boardrelease2026-06-25Comparable-14.2 pt25 Jun 2026livebench.aiT2History
34Claude Opus 4.7ClosedAnthropic · Claude66.7%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-14.7 pt25 Jun 2026livebench.aiT2History
35GPT-5.2-CodexClosedOpenAI · GPT 5.266.4%Official boardrelease2026-06-25Comparable-15.0 pt25 Jun 2026livebench.aiT2History
36DeepSeek V4 Flash (0731)Open weightsDeepSeek · DeepSeek65.5%Official boardrelease2026-06-25Comparable-15.9 pt25 Jun 2026livebench.aiT2History
37Grok Build 0.1ClosedxAI · Grok65.2%Official boardrelease2026-06-25Comparable-16.2 pt25 Jun 2026livebench.aiT2History
38gpt-5.6-terraClosedOpenAI · GPT 5.664.6%Official boardrelease2026-06-25Comparable-16.8 pt25 Jun 2026livebench.aiT2History
39Kimi K2.6Open weightsMoonshot AI · Kimi64.4%Official boardreasoningonrelease2026-06-25Partially comparable-17.1 pt25 Jun 2026livebench.aiT2History
40Claude Sonnet 5ClosedAnthropic · Claude63.9%Official boardreasoning_effortxhighrelease2026-06-25Partially comparable-17.6 pt25 Jun 2026livebench.aiT2History
41Claude Opus 5ClosedAnthropic · Claude63.8%Official boardreasoning_effortmaxrelease2026-06-25Partially comparable-17.6 pt25 Jun 2026livebench.aiT2History
42Claude Opus 4.6ClosedAnthropic · Claude63.3%Official boardreasoningonreasoning_efforthighrelease2026-06-25Partially comparable-18.1 pt25 Jun 2026livebench.aiT2History
43claude-sonnet-4-6-thinking-auto-medium-effort · Claude63.2%Official boardrelease2026-06-25Comparable-18.2 pt25 Jun 2026livebench.aiT2History
44deepseek-v4-flashOpen weightsDeepSeek · DeepSeek63.1%Official boardrelease2026-06-25Comparable-18.3 pt25 Jun 2026livebench.aiT2History
45Grok 4.3ClosedxAI · Grok62.8%Official boardrelease2026-06-25Comparable-18.7 pt25 Jun 2026livebench.aiT2History
46Claude Opus 4.5ClosedAnthropic · Claude62.5%Official boardreasoningonreasoning_efforthighthinking_budget64krelease2026-06-25Partially comparable-18.9 pt25 Jun 2026livebench.aiT2History
47deepseek-v4-proClosedDeepSeek · V462.4%Official boardrelease2026-06-25Comparable-19.1 pt25 Jun 2026livebench.aiT2History
48Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.262.3%Official boardrelease2026-06-25Comparable-19.1 pt25 Jun 2026livebench.aiT2History
49gpt-5.2ClosedOpenAI · GPT 5.261.8%Official boardreasoning_efforthighrelease2026-06-25Partially comparable-19.6 pt25 Jun 2026livebench.aiT2History
50ox-alpha-max60.3%Official boardrelease2026-06-25Comparable-21.2 pt25 Jun 2026livebench.aiT2History
51gpt-5.6-lunaClosedOpenAI · GPT 5.660.1%Official boardrelease2026-06-25Comparable-21.3 pt25 Jun 2026livebench.aiT2History
52gpt-5.4-miniClosedOpenAI · GPT 5.459.8%Official boardrelease2026-06-25Comparable-21.6 pt25 Jun 2026livebench.aiT2History
53Qwen3.6 PlusClosedQwen · Qwen3.658.3%Official boardrelease2026-06-25Comparable-23.1 pt25 Jun 2026livebench.aiT2History
54MiniMax-M3Open weightsMiniMax · MiniMax57.5%Official boardrelease2026-06-25Comparable-23.9 pt25 Jun 2026livebench.aiT2History
55Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi56.3%Official boardrelease2026-06-25Comparable-25.1 pt25 Jun 2026livebench.aiT2History
56Qwen3.6 27BOpen weightsQwen · Qwen3.653.2%Official boardrelease2026-06-25Comparable-28.2 pt25 Jun 2026livebench.aiT2History
57GLM 5.3 FlashOpen weightsZ.ai (Zhipu AI) · GLM5.352.8%Official boardrelease2026-06-25Comparable-28.6 pt25 Jun 2026livebench.aiT2History

57 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →