Skip to content
AI Atlas
BenchmarkActivecategory · compositefamily · artificial-analysis-intelligence-index · variant index

Artificial Analysis Intelligence Index

artificialanalysis.ai

composite of several evaluations run by Artificial Analysis

data quality57

Updated 2 h ago · first seen 11 Sept 2026

Metric
index
Current results
1,272
Models
477
Current leader
Claude Fable 5.1 53.4

Score history · gpt-5.4 6 rows

Score history for gpt-5.4010203040Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26
  • gpt-5.4
  • 18.16aa_slug=gpt-5-4-non-reasoning · version=4.3 · estimated=true · reasoning=off12 Sept 2026
  • 27.58aa_slug=gpt-5-4-low · version=4.3 · estimated=true · reasoning_effort=low12 Sept 2026
  • 38.98aa_slug=gpt-5-4 · version=4.3 · estimated=true · reasoning_effort=xhigh12 Sept 2026
  • 18.16aa_slug=gpt-5-4-non-reasoning · version=4.3 · estimated=true · reasoning=off11 Sept 2026
  • 27.58aa_slug=gpt-5-4-low · version=4.3 · estimated=true · aa_variant_slug=gpt-5-4-low11 Sept 2026
  • 38.98aa_slug=gpt-5-4 · version=4.3 · estimated=true11 Sept 2026

Back to the leaderboard

Frontier over time · index

8 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 53.4Claude Fable 5.1 Anthropic Independent11 Sept 2026
  2. 53.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  3. 51.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  4. 51.0gpt-6-astra OpenAI Independent11 Sept 2026
  5. 49.7gpt-6-astra OpenAI Independent11 Sept 2026
  6. 45.1Claude Opus 5 Anthropic Independent11 Sept 2026
  7. 14.6grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
  8. 5.71llama-2-chat-7b Meta AI Independent11 Sept 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 477 models · trust independent-evaluator

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
101grok-4ClosedSpaceXAI · Grok 4 · best of 2 rows22.5Independentreasoningonversion4.3Partially comparable0.00obs. 12 Sept 2026artificialanalysis.aiT2History
102mimo-v2-0206Open weightsXiaomi · best of 2 rows22.4Independentreasoningonversion4.3Partially comparable-0.05obs. 12 Sept 2026artificialanalysis.aiT2History
103MiMo-V2.5Open weightsXiaomi · best of 2 rows22.3Independentreasoningonversion4.3Partially comparable-0.19obs. 12 Sept 2026artificialanalysis.aiT2History
104GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows22.2Independentreasoningonversion4.3Partially comparable-0.25obs. 12 Sept 2026artificialanalysis.aiT2History
105Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi · best of 2 rows22.0Independentreasoningonversion4.3Partially comparable-0.47obs. 12 Sept 2026artificialanalysis.aiT2History
106Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 4 rows21.9Independentreasoningonversion4.3Partially comparable-0.58obs. 12 Sept 2026artificialanalysis.aiT2History
107o3-proClosedOpenAI · OpenAI o-series · best of 2 rows21.9Independentreasoningonversion4.3Partially comparable-0.62obs. 12 Sept 2026artificialanalysis.aiT2History
108g9v3-39a5bOpen weightsAI9Stars · best of 2 rows21.8Independentreasoningonversion4.3Partially comparable-0.66obs. 12 Sept 2026artificialanalysis.aiT2History
109KAT-Coder-Pro V2ClosedKwaipilot · best of 2 rows21.7Independentreasoningoffversion4.3Partially comparable-0.79obs. 12 Sept 2026artificialanalysis.aiT2History
110DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 5 rows21.5Independentreasoningonversion4.3Partially comparable-1.00obs. 12 Sept 2026artificialanalysis.aiT2History
110DeepSeek V3.2Open weightsDeepSeek · DeepSeek-V321.5Independentversion4.3Partially comparable-1.00obs. 11 Sept 2026artificialanalysis.aiT2History
112Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 4 rows21.4Independentreasoningoffversion4.3Partially comparable-1.05obs. 12 Sept 2026artificialanalysis.aiT2History
113Qwen3 MaxClosedQwen · Qwen3 · best of 4 rows21.3Independentreasoningonversion4.3Partially comparable-1.23obs. 12 Sept 2026artificialanalysis.aiT2History
114gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 6 rows21.2Independentreasoning_effortxhighversion4.3Partially comparable-1.25obs. 12 Sept 2026artificialanalysis.aiT2History
115Claude Sonnet 4.5ClosedAnthropic · Claude · best of 4 rows21.2Independentreasoningonversion4.3Partially comparable-1.31obs. 12 Sept 2026artificialanalysis.aiT2History
116MiniMax M2.1Open weightsMiniMax · MiniMax · best of 2 rows20.9Independentreasoningonversion4.3Partially comparable-1.54obs. 12 Sept 2026artificialanalysis.aiT2History
117deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek · DeepSeek20.8Independentversion4.3Partially comparable-1.66obs. 11 Sept 2026artificialanalysis.aiT2History
118mimo-v2-flashOpen weightsXiaomi · best of 4 rows20.8Independentreasoningonversion4.3Partially comparable-1.67obs. 12 Sept 2026artificialanalysis.aiT2History
119Claude Opus 4ClosedAnthropic · Claude20.6Independentversion4.3Partially comparable-1.85obs. 11 Sept 2026artificialanalysis.aiT2History
119claude-4-opusClosedAnthropic · Claude 4 · best of 3 rows20.6Independentreasoningonversion4.3Partially comparable-1.85obs. 12 Sept 2026artificialanalysis.aiT2History
121gpt-5-miniClosedOpenAI · GPT 5 · best of 6 rows20.6Independentreasoning_effortmediumversion4.3Partially comparable-1.89obs. 12 Sept 2026artificialanalysis.aiT2History
122GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 · best of 2 rows20.4Independentreasoning_efforthighversion4.3Partially comparable-2.11obs. 12 Sept 2026artificialanalysis.aiT2History
122qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 · best of 2 rows20.4Independentreasoningoffversion4.3Partially comparable-2.11obs. 12 Sept 2026artificialanalysis.aiT2History
124grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 4 rows20.4Independentreasoningonversion4.3Partially comparable-2.12obs. 12 Sept 2026artificialanalysis.aiT2History
125o3ClosedOpenAI · OpenAI o-series · best of 2 rows20.2Independentreasoningonversion4.3Partially comparable-2.29obs. 12 Sept 2026artificialanalysis.aiT2History
126LongCat 2.0Open weightsMeituan · best of 2 rows19.7Independentreasoningonversion4.3Partially comparable-2.80obs. 12 Sept 2026artificialanalysis.aiT2History
126k-exaone-2-0-0803Open weightsLG AI Research · EXAONE 2.0 · best of 2 rows19.7Independentreasoningonversion4.3Partially comparable-2.80obs. 12 Sept 2026artificialanalysis.aiT2History
128Step 3.7 FlashOpen weightsStepFun · Step3.7 · best of 2 rows19.5Independentreasoningonversion4.3Partially comparable-3.01obs. 12 Sept 2026artificialanalysis.aiT2History
129Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 4 rows19.3Independentreasoningonversion4.3Partially comparable-3.16obs. 12 Sept 2026artificialanalysis.aiT2History
130Claude Sonnet 4ClosedAnthropic · Claude · best of 4 rows18.9Independentreasoningonversion4.3Partially comparable-3.57obs. 12 Sept 2026artificialanalysis.aiT2History
131deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek · DeepSeek18.9Independentversion4.3Partially comparable-3.61obs. 11 Sept 2026artificialanalysis.aiT2History
132Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 4 rows18.8Independentreasoningonversion4.3Partially comparable-3.68obs. 12 Sept 2026artificialanalysis.aiT2History
133jt-35b-flashClosedChina Mobile · best of 2 rows18.7Independentreasoningoffversion4.3Partially comparable-3.83obs. 12 Sept 2026artificialanalysis.aiT2History
134MiniMax M2Open weightsMiniMax · MiniMax · best of 2 rows18.6Independentreasoningonversion4.3Partially comparable-3.86obs. 12 Sept 2026artificialanalysis.aiT2History
135kat-coder-pro-v1ClosedKwaiKAT · best of 2 rows18.6Independentreasoningoffversion4.3Partially comparable-3.90obs. 12 Sept 2026artificialanalysis.aiT2History
136GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 4 rows18.5Independentreasoningonversion4.3Partially comparable-3.96obs. 12 Sept 2026artificialanalysis.aiT2History
137Muse Glimmer 30BOpen weightsMeta AI · best of 2 rows18.1Independentreasoning_efforthighversion4.3Partially comparable-4.42obs. 12 Sept 2026artificialanalysis.aiT2History
138grok-4-fastClosedSpaceXAI · Grok 4 · best of 4 rows17.9Independentreasoningonversion4.3Partially comparable-4.55obs. 12 Sept 2026artificialanalysis.aiT2History
139Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 4 rows17.8Independentreasoningoffversion4.3Partially comparable-4.74obs. 12 Sept 2026artificialanalysis.aiT2History
140Claude 3.7 SonnetClosedAnthropic · Claude · best of 4 rows17.7Independentreasoningonversion4.3Partially comparable-4.78obs. 12 Sept 2026artificialanalysis.aiT2History
141Claude Haiku 4.5ClosedAnthropic · Claude · best of 4 rows17.6Independentreasoningonversion4.3Partially comparable-4.90obs. 12 Sept 2026artificialanalysis.aiT2History
142ring-2-6-1tOpen weightsinclusionAI · best of 2 rows17.3Independentreasoningonversion4.3Partially comparable-5.21obs. 12 Sept 2026artificialanalysis.aiT2History
143ling-2-6-1tOpen weightsinclusionAI · best of 2 rows17Independentreasoningoffversion4.3Partially comparable-5.49obs. 12 Sept 2026artificialanalysis.aiT2History
144Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 4 rows17.0Independentreasoningonversion4.3Partially comparable-5.53obs. 12 Sept 2026artificialanalysis.aiT2History
145doubao-seed-codeClosedByteDance · Seed · best of 2 rows16.9Independentreasoningonversion4.3Partially comparable-5.54obs. 12 Sept 2026artificialanalysis.aiT2History
146Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 4 rows16.7Independentreasoningonversion4.3Partially comparable-5.82obs. 12 Sept 2026artificialanalysis.aiT2History
147Gemini 2.5 ProClosedGoogle · Gemini 2.5 · best of 2 rows16.7Independentreasoningonversion4.3Partially comparable-5.83obs. 12 Sept 2026artificialanalysis.aiT2History
148o4-miniClosedOpenAI · OpenAI o-series · best of 2 rows16.6Independentreasoning_efforthighversion4.3Partially comparable-5.84obs. 12 Sept 2026artificialanalysis.aiT2History
149DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 · best of 3 rows16.6Independentreasoningonversion4.3Partially comparable-5.91obs. 12 Sept 2026artificialanalysis.aiT2History
150qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 · best of 2 rows16.3Independentreasoningonversion4.3Partially comparable-6.20obs. 12 Sept 2026artificialanalysis.aiT2History
151Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 · best of 2 rows16.0Independentreasoningonversion4.3Partially comparable-6.46obs. 12 Sept 2026artificialanalysis.aiT2History
152gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 6 rows15.5Independentreasoningonversion4.3Partially comparable-7.02obs. 12 Sept 2026artificialanalysis.aiT2History
153Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 4 rows15.4Independentreasoningonversion4.3Partially comparable-7.07obs. 12 Sept 2026artificialanalysis.aiT2History
154DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 4 rows15.4Independentreasoningonversion4.3Partially comparable-7.09obs. 12 Sept 2026artificialanalysis.aiT2History
155Kimi K2 0905Open weightsMoonshot AI · Kimi · best of 2 rows15.3Independentreasoningoffversion4.3Partially comparable-7.20obs. 12 Sept 2026artificialanalysis.aiT2History
156o1ClosedOpenAI · OpenAI o-series · best of 2 rows15.2Independentreasoningonversion4.3Partially comparable-7.26obs. 12 Sept 2026artificialanalysis.aiT2History
157gemini-2-5-pro-03-25ClosedGoogle · Gemini 2.5 · best of 2 rows15.0Independentreasoningonversion4.3Partially comparable-7.53obs. 12 Sept 2026artificialanalysis.aiT2History
158Mistral Medium 3.5Open weightsMistral AI · Mistral · best of 2 rows14.9Independentreasoningonversion4.3Partially comparable-7.60obs. 12 Sept 2026artificialanalysis.aiT2History
159GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 4 rows14.9Independentreasoningonversion4.3Partially comparable-7.62obs. 12 Sept 2026artificialanalysis.aiT2History
160granite-4.2-30bOpen weightsIBM · Granite 4.2 · best of 2 rows14.8Independentreasoningonversion4.3Partially comparable-7.66obs. 12 Sept 2026artificialanalysis.aiT2History
161grok-3-mini-reasoningClosedSpaceXAI · Grok 3 · best of 2 rows14.6Independentreasoningonreasoning_efforthighversion4.3Partially comparable-7.87obs. 12 Sept 2026artificialanalysis.aiT2History
162gemini-2-5-pro-05-06ClosedGoogle · Gemini 2.5 · best of 2 rows14.5Independentreasoningonversion4.3Partially comparable-7.97obs. 12 Sept 2026artificialanalysis.aiT2History
163deepseek-v3-2-specialeOpen weightsDeepSeek · DeepSeek · best of 2 rows14.5Independentreasoningonversion4.3Partially comparable-8.03obs. 12 Sept 2026artificialanalysis.aiT2History
164k-exaoneOpen weightsLG AI Research · EXAONE · best of 4 rows14.4Independentreasoningonversion4.3Partially comparable-8.12obs. 12 Sept 2026artificialanalysis.aiT2History
165ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 · best of 2 rows14.3Independentreasoningonversion4.3Partially comparable-8.23obs. 12 Sept 2026artificialanalysis.aiT2History
166grok-4.20-0309-non-reasoningClosedxAI · Grok14.2Independentversion4.3Partially comparable-8.29obs. 11 Sept 2026artificialanalysis.aiT2History
167gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 4 rows14.2Independentreasoningonversion4.3Partially comparable-8.31obs. 12 Sept 2026artificialanalysis.aiT2History
168nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 6 rows14.2Independentreasoningonreasoning_effortmediumversion4.3Partially comparable-8.33obs. 12 Sept 2026artificialanalysis.aiT2History
169Grok Build 0.1ClosedxAI · Grok · best of 2 rows14.1Independentreasoningonversion4.3Partially comparable-8.43obs. 12 Sept 2026artificialanalysis.aiT2History
170command-a-plusOpen weightsCohere · Command · best of 2 rows13.9Independentreasoningonversion4.3Partially comparable-8.57obs. 12 Sept 2026artificialanalysis.aiT2History
171deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek13.9Independentversion4.3Partially comparable-8.61obs. 11 Sept 2026artificialanalysis.aiT2History
172apriel-v1-5-15b-thinkerOpen weightsServiceNow · best of 2 rows13.8Independentreasoningonversion4.3Partially comparable-8.67obs. 12 Sept 2026artificialanalysis.aiT2History
173DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 4 rows13.7Independentreasoningoffversion4.3Partially comparable-8.78obs. 12 Sept 2026artificialanalysis.aiT2History
174Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 4 rows13.7Independentreasoningonversion4.3Partially comparable-8.84obs. 12 Sept 2026artificialanalysis.aiT2History
174nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 6 rows13.7Independentreasoningonreasoning_effortmediumversion4.3Partially comparable-8.84obs. 12 Sept 2026artificialanalysis.aiT2History
176NVIDIA Nemotron 3.5 Lightning 30B A3BOpen weightsNVIDIA · Nemotron 3.5 · best of 2 rows13.6Independentreasoningonversion4.3Partially comparable-8.85obs. 12 Sept 2026artificialanalysis.aiT2History
177Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 · best of 2 rows13.6Independentreasoningonversion4.3Partially comparable-8.94obs. 12 Sept 2026artificialanalysis.aiT2History
178Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 4 rows13.4Independentreasoningonversion4.3Partially comparable-9.05obs. 12 Sept 2026artificialanalysis.aiT2History
179apriel-v1-6-15b-thinkerOpen weightsServiceNow · best of 2 rows13.4Independentreasoningonversion4.3Partially comparable-9.09obs. 12 Sept 2026artificialanalysis.aiT2History
180nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 8 rows13.4Independentreasoningonreasoning_efforthighversion4.3Partially comparable-9.12obs. 12 Sept 2026artificialanalysis.aiT2History
181exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 · best of 2 rows13.2Independentreasoningonversion4.3Partially comparable-9.28obs. 12 Sept 2026artificialanalysis.aiT2History
182minicpm5-2bOpen weightsOpenBMB · best of 2 rows13.1Independentreasoningonversion4.3Partially comparable-9.35obs. 12 Sept 2026artificialanalysis.aiT2History
183Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 4 rows13.1Independentreasoningonversion4.3Partially comparable-9.37obs. 12 Sept 2026artificialanalysis.aiT2History
183deepseek-r1Open weightsDeepSeek · DeepSeek-R1 · best of 2 rows13.1Independentreasoningonversion4.3Partially comparable-9.37obs. 12 Sept 2026artificialanalysis.aiT2History
185Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows13.1Independentreasoningonversion4.3Partially comparable-9.38obs. 11 Sept 2026artificialanalysis.aiT2History
186gpt-5-nanoClosedOpenAI · GPT 5 · best of 6 rows13.0Independentreasoning_efforthighversion4.3Partially comparable-9.50obs. 12 Sept 2026artificialanalysis.aiT2History
187North Mini Code (free)Open weightsCohere · best of 2 rows12.8Independentreasoningonversion4.3Partially comparable-9.65obs. 12 Sept 2026artificialanalysis.aiT2History
188GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 · best of 2 rows12.8Independentreasoningonversion4.3Partially comparable-9.72obs. 12 Sept 2026artificialanalysis.aiT2History
189Kimi K2 0711Open weightsMoonshot AI · Kimi · best of 2 rows12.7Independentreasoningoffversion4.3Partially comparable-9.77obs. 12 Sept 2026artificialanalysis.aiT2History
190Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 4 rows12.7Independentreasoningonversion4.3Partially comparable-9.78obs. 12 Sept 2026artificialanalysis.aiT2History
191gpt-4.1ClosedOpenAI · GPT 4.1 · best of 2 rows12.7Independentreasoningoffversion4.3Partially comparable-9.80obs. 12 Sept 2026artificialanalysis.aiT2History
192qwen3-max-previewClosedAlibaba Group · Qwen3 · best of 2 rows12.6Independentreasoningoffversion4.3Partially comparable-9.90obs. 12 Sept 2026artificialanalysis.aiT2History
193o3-miniClosedOpenAI · OpenAI o-series · best of 4 rows12.5Independentreasoningonversion4.3Partially comparable-10.0obs. 12 Sept 2026artificialanalysis.aiT2History
193qwen3-5-omni-flashClosedAlibaba Group · Qwen3.5 · best of 2 rows12.5Independentreasoningoffversion4.3Partially comparable-10.0obs. 12 Sept 2026artificialanalysis.aiT2History
195o1-proClosedOpenAI · OpenAI o-series · best of 2 rows12.4Independentreasoningonversion4.3Partially comparable-10.1obs. 12 Sept 2026artificialanalysis.aiT2History
196gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 4 rows12.3Independentreasoning_efforthighversion4.3Partially comparable-10.1obs. 12 Sept 2026artificialanalysis.aiT2History
197jt-miniClosedChina Mobile · best of 2 rows12.2Independentreasoningoffversion4.3Partially comparable-10.3obs. 12 Sept 2026artificialanalysis.aiT2History
198grok-3ClosedSpaceXAI · Grok 3 · best of 4 rows12.1Independentreasoningoffversion4.3Partially comparable-10.4obs. 12 Sept 2026artificialanalysis.aiT2History
199Seed-OSS-36B-InstructOpen weightsByteDance · Seed · best of 2 rows12.1Independentreasoningonversion4.3Partially comparable-10.4obs. 12 Sept 2026artificialanalysis.aiT2History
200qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder · best of 2 rows11.9Independentreasoningoffversion4.3Partially comparable-10.6obs. 12 Sept 2026artificialanalysis.aiT2History

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →