Skip to content
AI Atlas
BenchmarkActivecategory · general

LiveBench

livebench.ai

contamination-limited, monthly refreshed questions across 6 categories

quality57

Updated 3 h ago · first seen 11 Sept 2026

bench_01M293SPERF0D8QG7TSCGE8GGF

Metric
average score · %
Direction
Higher is better
Results
456
Leader
Claude Fable 5.1 Max Effort 97.01%

Leaderboard 456 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101Qwen3.7 MaxQwen83.34%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=qwen3.7-max25 Jun 2026livebench.aiT2 History
102#102Claude 4.6 Opus Thinking High EffortAnthropic83.27%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=claude-opus-4-6-thinking-auto-high-effort25 Jun 2026livebench.aiT2 History
103#103gpt-5.2-2025-12-11-high83.21%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=gpt-5.2-2025-12-11-high25 Jun 2026livebench.aiT2 History
104#104gpt-6-astraOpenAI82.97%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-6-astra-max25 Jun 2026livebench.aiT2 History
105#105Claude Fable 5 xHigh EffortAnthropic82.97%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=claude-fable-5-max-effort25 Jun 2026livebench.aiT2 History
106#106gpt-5.6-lunaOpenAI82.92%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gpt-5.6-luna-max25 Jun 2026livebench.aiT2 History
107#107gpt-5.6-terraOpenAI82.89%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=gpt-5.6-terra-max25 Jun 2026livebench.aiT2 History
108#108Kimi K2.7 CodeMoonshot AI82.81%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=kimi-k2.7-code25 Jun 2026livebench.aiT2 History
109#109Smaug Mini82.81%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=smaug-mini25 Jun 2026livebench.aiT2 History
110#110Grok 4.5xAI82.8%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=grok-4.525 Jun 2026livebench.aiT2 History
111#111muse-spark-1-3-xhighMeta AI82.79%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=muse-spark-1.3-xhigh25 Jun 2026livebench.aiT2 History
112#112deepseek-v4-proDeepSeek82.69%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=deepseek-v4-pro25 Jun 2026livebench.aiT2 History
113#113gpt-5.4OpenAI82.63%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=gpt-5.4-xhigh25 Jun 2026livebench.aiT2 History
114#114Smaug Agentic82.47%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=smaug-agentic25 Jun 2026livebench.aiT2 History
115#115gpt-6-astraOpenAI82.16%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-6-astra-max25 Jun 2026livebench.aiT2 History
116#116gpt-5.5OpenAI82.15%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026livebench.aiT2 History
117#117claude-opus-4-7-xhigh-effort82.09%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-opus-4-7-xhigh-effort25 Jun 2026livebench.aiT2 History
118#118DeepSeek-V4-Pro-0813DeepSeek82.07%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=deepseek-v4-pro-081325 Jun 2026livebench.aiT2 History
119#119gemini-3.5-flash-high82.01%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=gemini-3.5-flash-high25 Jun 2026livebench.aiT2 History
120#120Claude 4.8 Opus Thinking Max EffortAnthropic81.83%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-opus-4-8-max-effort25 Jun 2026livebench.aiT2 History
121#121muse-spark-1-3-xhighMeta AI81.59%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=muse-spark-1.3-xhigh25 Jun 2026livebench.aiT2 History
122#122gpt-5.5OpenAI81.58%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.5-xhigh25 Jun 2026livebench.aiT2 History
123#123claude-opus-5-max-effort81.45%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-opus-5-max-effort25 Jun 2026livebench.aiT2 History
124#124Kimi K3Moonshot AI81.45%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=kimi-k325 Jun 2026livebench.aiT2 History
125#125Gemini 3.8 FlashGoogle81.41%release=2026-06-25 · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=gemini-3.8-flash-high25 Jun 2026livebench.aiT2 History
126#126claude-opus-4-5-20251101-thinking-64k-high-effort81.26%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=claude-opus-4-5-20251101-thinking-64k-high-effort25 Jun 2026livebench.aiT2 History
127#127GLM 5.3 FlashZ.ai (Zhipu AI)81.25%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=glm-5.3-flash25 Jun 2026livebench.aiT2 History
128#128DeepSeek-V4.1-FlashDeepSeek81.19%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=deepseek-v4.1-flash-max25 Jun 2026livebench.aiT2 History
129#129DeepSeek-V4.1-FlashDeepSeek81.11%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=deepseek-v4.1-flash-max25 Jun 2026livebench.aiT2 History
130#130gpt-5.4-nanoOpenAI81.1%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=gpt-5.4-nano-xhigh25 Jun 2026livebench.aiT2 History
131#131muse-spark-1-3-xhighMeta AI81.06%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=muse-spark-1.3-xhigh25 Jun 2026livebench.aiT2 History
132#132gpt-5-6-solOpenAI81.05%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-5.6-sol-max25 Jun 2026livebench.aiT2 History
133#133Claude Sonnet 5 xHigh EffortAnthropic80.68%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-sonnet-5-xhigh-effort25 Jun 2026livebench.aiT2 History
134#134Claude Fable 5 xHigh EffortAnthropic80.54%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=claude-fable-5-max-effort25 Jun 2026livebench.aiT2 History
135#135DeepSeek V4 Flash Vision ExpDeepSeek80.36%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=deepseek-v4-flash-vision-exp25 Jun 2026livebench.aiT2 History
136#136gpt-6-astraOpenAI80.36%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gpt-6-astra-max25 Jun 2026livebench.aiT2 History
137#137Claude Fable 5.1 Max EffortAnthropic80.28%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=claude-fable-5-1-max-effort25 Jun 2026livebench.aiT2 History
138#138gpt-5.5OpenAI80.19%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-5.5-xhigh25 Jun 2026livebench.aiT2 History
139#139claude-opus-4-5-20251101-thinking-64k-high-effort80.09%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=claude-opus-4-5-20251101-thinking-64k-high-effort25 Jun 2026livebench.aiT2 History
140#140claude-opus-5-max-effort80.09%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=claude-opus-5-max-effort25 Jun 2026livebench.aiT2 History
141#141DeepSeek-V4.1-FlashDeepSeek80.04%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=deepseek-v4.1-flash-max25 Jun 2026livebench.aiT2 History
142#142qwen3-8-27b-non-reasoningAlibaba Group80.03%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=qwen3.8-27b25 Jun 2026livebench.aiT2 History
143#143Gemini 3.7 FlashGoogle79.93%release=2026-06-25 · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=gemini-3.7-flash-high25 Jun 2026livebench.aiT2 History
144#144Smaug Agentic79.9%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=smaug-agentic25 Jun 2026livebench.aiT2 History
145#145Qwen3.6 27BQwen79.87%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=qwen3.6-27b25 Jun 2026livebench.aiT2 History
146#146GLM 5.3Z.ai (Zhipu AI)79.86%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=glm-5.325 Jun 2026livebench.aiT2 History
147#147gpt-5-6-solOpenAI79.84%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.6-sol-max25 Jun 2026livebench.aiT2 History
148#148gpt-5.2-2025-12-11-high79.81%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=gpt-5.2-2025-12-11-high25 Jun 2026livebench.aiT2 History
149#149Qwen3.7 MaxQwen79.74%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=qwen3.7-max25 Jun 2026livebench.aiT2 History
150#150Qwen 3.8 MaxQwen79.69%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=qwen3.8-max25 Jun 2026livebench.aiT2 History
151#151Claude 4.8 Opus Thinking Max EffortAnthropic79.66%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=claude-opus-4-8-max-effort25 Jun 2026livebench.aiT2 History
152#152claude-opus-4-5-20251101-thinking-64k-high-effort79.65%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-opus-4-5-20251101-thinking-64k-high-effort25 Jun 2026livebench.aiT2 History
153#153Z.ai GLM 5.2Z.ai (Zhipu AI)79.65%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=glm-5.225 Jun 2026livebench.aiT2 History
154#154deepseek-v4-flashDeepSeek79.65%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=deepseek-v4-flash25 Jun 2026livebench.aiT2 History
155#155Kimi K2.7 CodeMoonshot AI79.6%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=kimi-k2.7-code25 Jun 2026livebench.aiT2 History
156#156muse-spark-1-3-xhighMeta AI79.57%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=muse-spark-1.3-xhigh25 Jun 2026livebench.aiT2 History
157#157Smaug Agentic79.51%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=smaug-agentic25 Jun 2026livebench.aiT2 History
158#158DeepSeek V4 Flash Vision ExpDeepSeek79.48%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=deepseek-v4-flash-vision-exp25 Jun 2026livebench.aiT2 History
159#159Kimi K2.6 ThinkingMoonshot AI79.38%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=kimi-k2.6-thinking25 Jun 2026livebench.aiT2 History
160#160DeepSeek V4 Flash (0731)DeepSeek79.33%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=deepseek-v4-flash-073125 Jun 2026livebench.aiT2 History
161#161gpt-5.4OpenAI79.31%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.4-xhigh25 Jun 2026livebench.aiT2 History
162#162gpt-5.6-terraOpenAI79.31%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.6-terra-max25 Jun 2026livebench.aiT2 History
163#163claude-sonnet-4-6-thinking-auto-medium-effort79.27%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-sonnet-4-6-thinking-auto-medium-effort25 Jun 2026livebench.aiT2 History
164#164DeepSeek-V4.1-FlashDeepSeek79.25%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=deepseek-v4.1-flash-max25 Jun 2026livebench.aiT2 History
165#165DeepSeek-V4-Pro-0813DeepSeek79.24%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=deepseek-v4-pro-081325 Jun 2026livebench.aiT2 History
166#166Smaug Flash79.21%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=smaug-flash25 Jun 2026livebench.aiT2 History
167#167Kimi K3Moonshot AI79.19%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=kimi-k325 Jun 2026livebench.aiT2 History
168#168DeepSeek V4 Flash (0731)DeepSeek79.18%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=deepseek-v4-flash-073125 Jun 2026livebench.aiT2 History
169#169Smaug Flash79.12%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=smaug-flash25 Jun 2026livebench.aiT2 History
170#170Gemini 3.1 Pro Preview HighGoogle79.1%release=2026-06-25 · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=gemini-3.1-pro-preview-high25 Jun 2026livebench.aiT2 History
171#171GLM 5.3 FlashZ.ai (Zhipu AI)78.95%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=glm-5.3-flash25 Jun 2026livebench.aiT2 History
172#172GLM 5.3Z.ai (Zhipu AI)78.95%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=glm-5.325 Jun 2026livebench.aiT2 History
173#173Gemini 3.7 FlashGoogle78.89%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gemini-3.7-flash-high25 Jun 2026livebench.aiT2 History
174#174Gemini 3.7 FlashGoogle78.83%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gemini-3.7-flash-high25 Jun 2026livebench.aiT2 History
175#175Smaug Mini78.81%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=smaug-mini25 Jun 2026livebench.aiT2 History
176#176Kimi K3Moonshot AI78.73%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=kimi-k325 Jun 2026livebench.aiT2 History
177#177Z.ai GLM 5.2Z.ai (Zhipu AI)78.63%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=glm-5.225 Jun 2026livebench.aiT2 History
178#178Muse Spark 1.2Meta AI78.58%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=muse-spark-1.2-xhigh25 Jun 2026livebench.aiT2 History
179#179Kimi K2.6 ThinkingMoonshot AI78.57%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=kimi-k2.6-thinking25 Jun 2026livebench.aiT2 History
180#180Gemini 3.1 Pro Preview HighGoogle78.54%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gemini-3.1-pro-preview-high25 Jun 2026livebench.aiT2 History
181#181gpt-5.4-miniOpenAI78.46%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=gpt-5.4-mini-xhigh25 Jun 2026livebench.aiT2 History
182#182Qwen 3.8 MaxQwen78.46%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=qwen3.8-max25 Jun 2026livebench.aiT2 History
183#183Grok Build 0.1xAI78.43%release=2026-06-25 · subtasks=["AMPS_Hard","integrals_with_game","math_comp","olympiad"] · livebench_model_id=grok-build-0.125 Jun 2026livebench.aiT2 History
184#184Qwen 3.8 MaxQwen78.41%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=qwen3.8-max25 Jun 2026livebench.aiT2 History
185#185Inkling xHigh Effort78.35%release=2026-06-25 · subtasks=["theory_of_mind","zebra_puzzle","spatial","logic_with_navigation"] · livebench_model_id=inkling-xhigh25 Jun 2026livebench.aiT2 History
186#186claude-opus-4-7-xhigh-effort78.26%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=claude-opus-4-7-xhigh-effort25 Jun 2026livebench.aiT2 History
187#187gpt-5.6-terraOpenAI78.25%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gpt-5.6-terra-max25 Jun 2026livebench.aiT2 History
188#188GPT-5.2-CodexOpenAI78.2%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.2-codex25 Jun 2026livebench.aiT2 History
189#189Qwen3.6 PlusQwen78.18%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=qwen3.6-plus25 Jun 2026livebench.aiT2 History
190#190Claude 4.6 Opus Thinking High EffortAnthropic78.18%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=claude-opus-4-6-thinking-auto-high-effort25 Jun 2026livebench.aiT2 History
191#191gemini-3.5-flash-high78.18%release=2026-06-25 · subtasks=["code_generation","code_completion"] · livebench_model_id=gemini-3.5-flash-high25 Jun 2026livebench.aiT2 History
192#192gpt-5.2-2025-12-11-high78.16%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.2-2025-12-11-high25 Jun 2026livebench.aiT2 History
193#193deepseek-v4-proDeepSeek78.13%release=2026-06-25 · subtasks=["connections","plot_unscrambling","typos"] · livebench_model_id=deepseek-v4-pro25 Jun 2026livebench.aiT2 History
194#194Grok 4.6xAI78.04%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=grok-4.625 Jun 2026livebench.aiT2 History
195#195gpt-5.6-lunaOpenAI78.03%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=gpt-5.6-luna-max25 Jun 2026livebench.aiT2 History
196#196muse-spark-1-3-xhighMeta AI78%release=2026-06-25 · subtasks=["paraphrase","simplify","story_generation","summarize"] · livebench_model_id=muse-spark-1.3-xhigh25 Jun 2026livebench.aiT2 History
197#197gpt-5.4OpenAI77.97%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-5.4-xhigh25 Jun 2026livebench.aiT2 History
198#198Muse Spark 1.2Meta AI77.96%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=muse-spark-1.2-xhigh25 Jun 2026livebench.aiT2 History
199#199claude-sonnet-4-6-thinking-auto-medium-effort77.95%release=2026-06-25 · subtasks=["consecutive_events","tablejoin","tablereformat"] · livebench_model_id=claude-sonnet-4-6-thinking-auto-medium-effort25 Jun 2026livebench.aiT2 History
200#200gpt-5.6-terraOpenAI77.94%release=2026-06-25 · aggregation=mean of category averages; category = mean of its subtasks · livebench_model_id=gpt-5.6-terra-max25 Jun 2026livebench.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.