Skip to content
AI Atlas
BenchmarkActivecategory · compositefamily · artificial-analysis-intelligence-index · variant index

Artificial Analysis Intelligence Index

artificialanalysis.ai

composite of several evaluations run by Artificial Analysis

data quality57

Updated 3 h ago · first seen 11 Sept 2026

Metric
index
Current results
1,272
Models
477
Current leader
Claude Fable 5.1 53.4

Score history · minicpm5-2b 2 rows

Score history for minicpm5-2b051015Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26
  • minicpm5-2b
  • 13.14aa_slug=minicpm5-2b · version=4.3 · estimated=false · reasoning=on12 Sept 2026
  • 13.14aa_slug=minicpm5-2b · version=4.3 · estimated=false11 Sept 2026

Back to the leaderboard

Frontier over time · index

8 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 53.4Claude Fable 5.1 Anthropic Independent11 Sept 2026
  2. 53.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  3. 51.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  4. 51.0gpt-6-astra OpenAI Independent11 Sept 2026
  5. 49.7gpt-6-astra OpenAI Independent11 Sept 2026
  6. 45.1Claude Opus 5 Anthropic Independent11 Sept 2026
  7. 14.6grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
  8. 5.71llama-2-chat-7b Meta AI Independent11 Sept 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 477 models · trust independent-evaluator

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
301Qwen2.5 72B InstructOpen weightsQwen · Qwen2.5 · best of 2 rows7.73Independentreasoningoffversion4.3Partially comparable0.00obs. 12 Sept 2026artificialanalysis.aiT2History
302step-3-vl-10bOpen weightsStepFun · Step3 · best of 2 rows7.69Independentreasoningonversion4.3Partially comparable-0.04obs. 12 Sept 2026artificialanalysis.aiT2History
303Llama 3.3 70BOpen weightsMeta AI · Llama 3.3 · best of 2 rows7.66Independentreasoningoffversion4.3Partially comparable-0.07obs. 12 Sept 2026artificialanalysis.aiT2History
304qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 4 rows7.63Independentreasoningonversion4.3Partially comparable-0.10obs. 12 Sept 2026artificialanalysis.aiT2History
305Sonar ProClosedPerplexity AI · Sonar · best of 2 rows7.61Independentreasoningoffversion4.3Partially comparable-0.12obs. 12 Sept 2026artificialanalysis.aiT2History
306devstral-smallOpen weightsMistral AI · Devstral · best of 2 rows7.60Independentreasoningoffversion4.3Partially comparable-0.13obs. 12 Sept 2026artificialanalysis.aiT2History
307QwQ-32B-PreviewOpen weightsAlibaba Group · Qwen · best of 2 rows7.59Independentreasoningonversion4.3Partially comparable-0.14obs. 12 Sept 2026artificialanalysis.aiT2History
308GLM 4.5VOpen weightsZ.ai (Zhipu AI) · GLM4.5 · best of 4 rows7.56Independentreasoningonversion4.3Partially comparable-0.17obs. 12 Sept 2026artificialanalysis.aiT2History
308mistral-large-2Open weightsMistral AI · Mistral · best of 2 rows7.56Independentreasoningoffversion4.3Partially comparable-0.17obs. 12 Sept 2026artificialanalysis.aiT2History
310llama-3-1-nemotron-ultra-253b-v1-reasoningOpen weightsNVIDIA · Llama 3.1 · best of 2 rows7.53Independentreasoningonversion4.3Partially comparable-0.20obs. 12 Sept 2026artificialanalysis.aiT2History
311ernie-4-5-300b-a47bOpen weightsBaidu · ERNIE 4.5 · best of 2 rows7.50Independentreasoningoffversion4.3Partially comparable-0.23obs. 12 Sept 2026artificialanalysis.aiT2History
312Hermes 4 405BOpen weightsNous Research · Hermes 47.49Independentversion4.3Partially comparable-0.24obs. 11 Sept 2026artificialanalysis.aiT2History
312hermes-4-llama-3-1-405bOpen weightsNous Research · Llama 3.1 · best of 3 rows7.49Independentreasoningonversion4.3Partially comparable-0.24obs. 12 Sept 2026artificialanalysis.aiT2History
314nvidia-nemotron-nano-12b-v2-vlOpen weightsNVIDIA · Nemotron · best of 4 rows7.48Independentreasoningonversion4.3Partially comparable-0.25obs. 12 Sept 2026artificialanalysis.aiT2History
315granite-4.1-30bOpen weightsIBM · Granite 4.1 · best of 2 rows7.44Independentreasoningoffversion4.3Partially comparable-0.29obs. 12 Sept 2026artificialanalysis.aiT2History
316NVIDIA-Nemotron-Nano-9B-v2Open weightsNVIDIA · Nemotron · best of 4 rows7.43Independentreasoningonversion4.3Partially comparable-0.30obs. 12 Sept 2026artificialanalysis.aiT2History
317gemini-2-0-flash-lite-001ClosedGoogle · Gemini 2.0 · best of 2 rows7.41Independentreasoningoffversion4.3Partially comparable-0.32obs. 12 Sept 2026artificialanalysis.aiT2History
318nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 · best of 2 rows7.38Independentreasoningonversion4.3Partially comparable-0.35obs. 12 Sept 2026artificialanalysis.aiT2History
319Mistral Small 3.1Open weightsMistral AI · Mistral · best of 2 rows7.37Independentreasoningoffversion4.3Partially comparable-0.36obs. 12 Sept 2026artificialanalysis.aiT2History
320qwen3-32b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows7.34Independentreasoningoffversion4.3Partially comparable-0.39obs. 12 Sept 2026artificialanalysis.aiT2History
321GPT-4o (2024-05-13)ClosedOpenAI · GPT 4 · best of 2 rows7.33Independentreasoningoffversion4.3Partially comparable-0.40obs. 12 Sept 2026artificialanalysis.aiT2History
321gemini-2-0-flash-lite-previewClosedGoogle · Gemini 2.0 · best of 2 rows7.33Independentreasoningoffversion4.3Partially comparable-0.40obs. 12 Sept 2026artificialanalysis.aiT2History
323llama-3-1-nemotron-nano-4b-reasoningOpen weightsNVIDIA · Llama 3.1 · best of 2 rows7.31Independentreasoningonversion4.3Partially comparable-0.42obs. 12 Sept 2026artificialanalysis.aiT2History
324Kimi-Linear-48B-A3B-InstructOpen weightsMoonshot AI · Kimi · best of 2 rows7.30Independentreasoningoffversion4.3Partially comparable-0.43obs. 12 Sept 2026artificialanalysis.aiT2History
325Llama-3.1-405BRestricted weightsMeta AI · Llama 3.1 · best of 2 rows7.29Independentreasoningoffversion4.3Partially comparable-0.44obs. 12 Sept 2026artificialanalysis.aiT2History
326Qwen3-4BOpen weightsQwen · Qwen37.23Independentversion4.3Partially comparable-0.50obs. 11 Sept 2026artificialanalysis.aiT2History
326qwen3-4b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows7.23Independentreasoningonversion4.3Partially comparable-0.50obs. 12 Sept 2026artificialanalysis.aiT2History
328LFM2.5-8B-A1BOpen weightsLiquid AI · LFM2.5 · best of 2 rows7.22Independentreasoningonversion4.3Partially comparable-0.51obs. 12 Sept 2026artificialanalysis.aiT2History
328Qwen3 32BOpen weightsQwen · Qwen37.22Independentversion4.3Partially comparable-0.51obs. 11 Sept 2026artificialanalysis.aiT2History
330claude-35-sonnet-june-24ClosedAnthropic · Claude 35 · best of 2 rows7.21Independentreasoningoffversion4.3Partially comparable-0.52obs. 12 Sept 2026artificialanalysis.aiT2History
331tulu3-405bOpen weightsAllen Institute for AI · best of 2 rows7.20Independentreasoningoffversion4.3Partially comparable-0.53obs. 12 Sept 2026artificialanalysis.aiT2History
332gpt-4o-chatgptClosedOpenAI · GPT 4 · best of 2 rows7.19Independentreasoningoffversion4.3Partially comparable-0.54obs. 12 Sept 2026artificialanalysis.aiT2History
333Pixtral LargeOpen weightsMistral AI · Pixtral · best of 2 rows7.15Independentreasoningoffversion4.3Partially comparable-0.58obs. 12 Sept 2026artificialanalysis.aiT2History
333ring-flash-2-0Open weightsinclusionAI · best of 2 rows7.15Independentreasoningonversion4.3Partially comparable-0.58obs. 12 Sept 2026artificialanalysis.aiT2History
335olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 3 rows7.12Independentreasoningonversion4.3Partially comparable-0.61obs. 12 Sept 2026artificialanalysis.aiT2History
336grok-2Open weightsxAI · Grok 2 · best of 2 rows7.11Independentreasoningoffversion4.3Partially comparable-0.62obs. 12 Sept 2026artificialanalysis.aiT2History
337gemini-1-5-flashClosedGoogle · Gemini 1.5 · best of 2 rows7.07Independentreasoningoffversion4.3Partially comparable-0.66obs. 12 Sept 2026artificialanalysis.aiT2History
338Qwen3-VL-4B-InstructOpen weightsQwen · Qwen3 · best of 4 rows7.05Independentreasoningonversion4.3Partially comparable-0.68obs. 12 Sept 2026artificialanalysis.aiT2History
339gpt-4-turboClosedOpenAI · GPT 4 · best of 2 rows7.04Independentreasoningoffversion4.3Partially comparable-0.69obs. 12 Sept 2026artificialanalysis.aiT2History
340Command AOpen weightsCohere · Command · best of 2 rows6.96Independentreasoningoffversion4.3Partially comparable-0.77obs. 12 Sept 2026artificialanalysis.aiT2History
340Mistral Small 3.2Open weightsMistral AI · Mistral · best of 2 rows6.96Independentreasoningoffversion4.3Partially comparable-0.77obs. 12 Sept 2026artificialanalysis.aiT2History
340nova-proClosedAmazon Web Services · Nova · best of 2 rows6.96Independentreasoningoffversion4.3Partially comparable-0.77obs. 12 Sept 2026artificialanalysis.aiT2History
343Qwen3.5-2BOpen weightsQwen · Qwen3.5 · best of 4 rows6.94Independentreasoningonversion4.3Partially comparable-0.79obs. 12 Sept 2026artificialanalysis.aiT2History
343llama-3-1-nemotron-instruct-70bOpen weightsNVIDIA · Llama 3.1 · best of 2 rows6.94Independentreasoningoffversion4.3Partially comparable-0.79obs. 12 Sept 2026artificialanalysis.aiT2History
345Llama 3.1 8BRestricted weightsMeta AI · Llama 3.1 · best of 2 rows6.93Independentreasoningoffversion4.3Partially comparable-0.80obs. 12 Sept 2026artificialanalysis.aiT2History
346grok-betaClosedSpaceXAI · Grok · best of 2 rows6.89Independentreasoningoffversion4.3Partially comparable-0.84obs. 12 Sept 2026artificialanalysis.aiT2History
347qwen2.5-32b-instructOpen weightsAlibaba Group · Qwen2.5 · best of 2 rows6.87Independentreasoningoffversion4.3Partially comparable-0.86obs. 12 Sept 2026artificialanalysis.aiT2History
348Mistral Large 2.0Open weightsMistral AI · Mistral · best of 2 rows6.80Independentreasoningoffversion4.3Partially comparable-0.93obs. 12 Sept 2026artificialanalysis.aiT2History
349Qwen2.5 Coder 32B InstructOpen weightsQwen · Qwen2.5 · best of 2 rows6.74Independentreasoningoffversion4.3Partially comparable-0.99obs. 12 Sept 2026artificialanalysis.aiT2History
350gpt-4ClosedOpenAI · GPT 4 · best of 2 rows6.70Independentreasoningoffversion4.3Partially comparable-1.03obs. 12 Sept 2026artificialanalysis.aiT2History
350qwen3-14b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows6.70Independentreasoningoffversion4.3Partially comparable-1.03obs. 12 Sept 2026artificialanalysis.aiT2History
352Mistral Small 3Open weightsMistral AI · Mistral · best of 2 rows6.67Independentreasoningoffversion4.3Partially comparable-1.06obs. 12 Sept 2026artificialanalysis.aiT2History
352nova-liteClosedAmazon Web Services · Nova · best of 2 rows6.67Independentreasoningoffversion4.3Partially comparable-1.06obs. 12 Sept 2026artificialanalysis.aiT2History
354gpt-4o-miniClosedOpenAI · GPT 4 · best of 2 rows6.66Independentreasoningoffversion4.3Partially comparable-1.07obs. 12 Sept 2026artificialanalysis.aiT2History
355deepseek-v2-5Open weightsDeepSeek · DeepSeek · best of 2 rows6.62Independentreasoningoffversion4.3Partially comparable-1.11obs. 12 Sept 2026artificialanalysis.aiT2History
356Llama-3.1-70BOpen weightsMeta AI · Llama 3.1 · best of 2 rows6.60Independentreasoningoffversion4.3Partially comparable-1.13obs. 12 Sept 2026artificialanalysis.aiT2History
357granite-4.1-8bOpen weightsIBM · Granite 4.1 · best of 2 rows6.57Independentreasoningoffversion4.3Partially comparable-1.16obs. 12 Sept 2026artificialanalysis.aiT2History
358gemini-2-0-flash-thinking-exp-1219ClosedGoogle · Gemini 2.0 · best of 2 rows6.56Independentreasoningonversion4.3Partially comparable-1.17obs. 12 Sept 2026artificialanalysis.aiT2History
358sarvam-30bOpen weightsSarvam · best of 2 rows6.56Independentreasoning_efforthighversion4.3Partially comparable-1.17obs. 12 Sept 2026artificialanalysis.aiT2History
360deepseek-v2-5-sep-2024Open weightsDeepSeek · DeepSeek · best of 2 rows6.55Independentreasoningoffversion4.3Partially comparable-1.18obs. 12 Sept 2026artificialanalysis.aiT2History
361Mistral SabaClosedMistral AI · Mistral · best of 2 rows6.49Independentreasoningoffversion4.3Partially comparable-1.24obs. 12 Sept 2026artificialanalysis.aiT2History
362deepseek-r1-distill-llama-8bOpen weightsDeepSeek · Llama · best of 2 rows6.48Independentreasoningonversion4.3Partially comparable-1.25obs. 12 Sept 2026artificialanalysis.aiT2History
363olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows6.47Independentreasoningonversion4.3Partially comparable-1.26obs. 12 Sept 2026artificialanalysis.aiT2History
364Llama 4 ScoutOpen weightsMeta AI · Llama 4 · best of 2 rows6.45Independentreasoningoffversion4.3Partially comparable-1.28obs. 12 Sept 2026artificialanalysis.aiT2History
365gemini-1-5-pro-may-2024ClosedGoogle · Gemini 1.5 · best of 2 rows6.44Independentreasoningoffversion4.3Partially comparable-1.29obs. 12 Sept 2026artificialanalysis.aiT2History
365r1-1776Open weightsPerplexity AI · best of 2 rows6.44Independentreasoningonversion4.3Partially comparable-1.29obs. 12 Sept 2026artificialanalysis.aiT2History
367qwen-turboClosedAlibaba Group · Qwen · best of 2 rows6.43Independentreasoningoffversion4.3Partially comparable-1.30obs. 12 Sept 2026artificialanalysis.aiT2History
367reka-flashClosedrekaai · best of 2 rows6.43Independentreasoningoffversion4.3Partially comparable-1.30obs. 12 Sept 2026artificialanalysis.aiT2History
369llama-3-2-instruct-90b-visionOpen weightsMeta AI · Llama 3.2 · best of 2 rows6.41Independentreasoningoffversion4.3Partially comparable-1.32obs. 12 Sept 2026artificialanalysis.aiT2History
369solar-miniOpen weightsUpstage · Solar · best of 2 rows6.41Independentreasoningoffversion4.3Partially comparable-1.32obs. 12 Sept 2026artificialanalysis.aiT2History
371Qwen3 14BOpen weightsQwen · Qwen36.39Independentversion4.3Partially comparable-1.34obs. 11 Sept 2026artificialanalysis.aiT2History
372celeris-1ClosedCeleris · best of 2 rows6.35Independentreasoningoffversion4.3Partially comparable-1.38obs. 12 Sept 2026artificialanalysis.aiT2History
373grok-1Open weightsxAI · Grok 1 · best of 2 rows6.34Independentreasoningoffversion4.3Partially comparable-1.39obs. 12 Sept 2026artificialanalysis.aiT2History
374phi-4-miniOpen weightsMicrosoft · Phi4 · best of 2 rows6.33Independentreasoningoffversion4.3Partially comparable-1.40obs. 12 Sept 2026artificialanalysis.aiT2History
374qwen2-72b-instructOpen weightsAlibaba Group · Qwen2 · best of 2 rows6.33Independentreasoningoffversion4.3Partially comparable-1.40obs. 12 Sept 2026artificialanalysis.aiT2History
376gemini-1-5-flash-8bClosedGoogle · Gemini 1.5 · best of 2 rows6.15Independentreasoningoffversion4.3Partially comparable-1.58obs. 12 Sept 2026artificialanalysis.aiT2History
377Qwen3.5-0.8BOpen weightsQwen · Qwen3.5 · best of 4 rows6.13Independentreasoningonversion4.3Partially comparable-1.60obs. 12 Sept 2026artificialanalysis.aiT2History
378deephermes-3-mistral-24b-previewOpen weightsNous Research · Mistral · best of 2 rows6.07Independentreasoningoffversion4.3Partially comparable-1.66obs. 12 Sept 2026artificialanalysis.aiT2History
378jamba-1-7-largeOpen weightsAI21 Labs · Jamba 1.7 · best of 2 rows6.07Independentreasoningoffversion4.3Partially comparable-1.66obs. 12 Sept 2026artificialanalysis.aiT2History
380granite-4-0-h-smallOpen weightsIBM · Granite 4.0 · best of 2 rows6.05Independentreasoningoffversion4.3Partially comparable-1.68obs. 12 Sept 2026artificialanalysis.aiT2History
381Ministral 3 14BOpen weightsMistral AI · Ministral 3 · best of 2 rows6.04Independentreasoningoffversion4.3Partially comparable-1.69obs. 12 Sept 2026artificialanalysis.aiT2History
382jamba-1-5-largeOpen weightsAI21 Labs · Jamba 1.5 · best of 2 rows6.01Independentreasoningoffversion4.3Partially comparable-1.72obs. 12 Sept 2026artificialanalysis.aiT2History
383Hermes 3 70B InstructOpen weightsNous Research · Hermes 3 · best of 2 rows6Independentreasoningoffversion4.3Partially comparable-1.73obs. 12 Sept 2026artificialanalysis.aiT2History
384qwen3-8b-instructOpen weightsAlibaba Group · Qwen3 · best of 3 rows5.99Independentreasoningoffversion4.3Partially comparable-1.74obs. 12 Sept 2026artificialanalysis.aiT2History
385deepseek-coder-v2Open weightsDeepSeek · DeepSeek · best of 2 rows5.98Independentreasoningoffversion4.3Partially comparable-1.75obs. 12 Sept 2026artificialanalysis.aiT2History
386jamba-1-6-largeOpen weightsAI21 Labs · Jamba 1.6 · best of 2 rows5.97Independentreasoningoffversion4.3Partially comparable-1.76obs. 12 Sept 2026artificialanalysis.aiT2History
386olmo-2-32bOpen weightsAllen Institute for AI · OLMo 2 · best of 2 rows5.97Independentreasoningoffversion4.3Partially comparable-1.76obs. 12 Sept 2026artificialanalysis.aiT2History
388lfm2-24b-a2bOpen weightsLiquid AI · LFM2 · best of 2 rows5.95Independentreasoningoffversion4.3Partially comparable-1.78obs. 12 Sept 2026artificialanalysis.aiT2History
389gemini-1-5-flash-may-2024ClosedGoogle · Gemini 1.5 · best of 2 rows5.94Independentreasoningoffversion4.3Partially comparable-1.79obs. 12 Sept 2026artificialanalysis.aiT2History
390Phi 4Open weightsMicrosoft · Phi4 · best of 2 rows5.92Independentreasoningoffversion4.3Partially comparable-1.81obs. 12 Sept 2026artificialanalysis.aiT2History
391claude-3-sonnetClosedAnthropic · Claude 3 · best of 2 rows5.88Independentreasoningoffversion4.3Partially comparable-1.85obs. 12 Sept 2026artificialanalysis.aiT2History
391nova-microClosedAmazon Web Services · Nova · best of 2 rows5.88Independentreasoningoffversion4.3Partially comparable-1.85obs. 12 Sept 2026artificialanalysis.aiT2History
393granite-4.1-3bOpen weightsIBM · Granite 4.1 · best of 2 rows5.86Independentreasoningoffversion4.3Partially comparable-1.87obs. 12 Sept 2026artificialanalysis.aiT2History
394mistral-smallOpen weightsMistral AI · Mistral · best of 2 rows5.85Independentreasoningoffversion4.3Partially comparable-1.88obs. 12 Sept 2026artificialanalysis.aiT2History
395gemini-1-0-ultraClosedGoogle · Gemini 1.0 · best of 2 rows5.84Independentreasoningoffversion4.3Partially comparable-1.89obs. 12 Sept 2026artificialanalysis.aiT2History
396phi-3-miniOpen weightsMicrosoft · Phi3 · best of 2 rows5.82Independentreasoningoffversion4.3Partially comparable-1.91obs. 12 Sept 2026artificialanalysis.aiT2History
397gemma-3n-e4b-preview-0520Open weightsGoogle · Gemma 3 · best of 2 rows5.81Independentreasoningoffversion4.3Partially comparable-1.92obs. 12 Sept 2026artificialanalysis.aiT2History
397phi-4-multimodalOpen weightsMicrosoft · Phi4 · best of 2 rows5.81Independentreasoningoffversion4.3Partially comparable-1.92obs. 12 Sept 2026artificialanalysis.aiT2History
399Qwen2.5-Coder-7BOpen weightsQwen · Qwen2.5 · best of 2 rows5.79Independentreasoningoffversion4.3Partially comparable-1.94obs. 12 Sept 2026artificialanalysis.aiT2History
400Mistral LargeClosedMistral AI · Mistral · best of 2 rows5.76Independentreasoningoffversion4.3Partially comparable-1.97obs. 12 Sept 2026artificialanalysis.aiT2History

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →