Skip to content
AI Atlas
BenchmarkActivecategory · compositefamily · artificial-analysis-intelligence-index · variant index

Artificial Analysis Intelligence Index

artificialanalysis.ai

composite of several evaluations run by Artificial Analysis

data quality57

Updated 5 h ago · first seen 11 Sept 2026

Metric
index
Current results
1,272
Models
477
Current leader
Claude Fable 5.1 53.4

Score history · hermes-4-llama-3-1-405b 3 rows

Score history for hermes-4-llama-3-1-405b02468Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26Sept 26
  • hermes-4-llama-3-1-405b
  • 7.49aa_slug=hermes-4-llama-3-1-405b-reasoning · version=4.3 · estimated=true · reasoning=on12 Sept 2026
  • 7.41aa_slug=hermes-4-llama-3-1-405b · version=4.3 · estimated=true · reasoning=off12 Sept 2026
  • 7.41aa_slug=hermes-4-llama-3-1-405b · version=4.3 · estimated=true11 Sept 2026

Back to the leaderboard

Frontier over time · index

8 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.

  1. 53.4Claude Fable 5.1 Anthropic Independent11 Sept 2026
  2. 53.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  3. 51.2Claude Fable 5.1 Anthropic Independent11 Sept 2026
  4. 51.0gpt-6-astra OpenAI Independent11 Sept 2026
  5. 49.7gpt-6-astra OpenAI Independent11 Sept 2026
  6. 45.1Claude Opus 5 Anthropic Independent11 Sept 2026
  7. 14.6grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
  8. 5.71llama-2-chat-7b Meta AI Independent11 Sept 2026

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 477 models · trust independent-evaluator

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
401Mixtral 8x22BOpen weightsMistral AI · Mixtral 8 · best of 2 rows5.74Independentreasoningoffversion4.3Partially comparable0.00obs. 12 Sept 2026artificialanalysis.aiT2History
402llama-2-chat-7bOpen weightsMeta AI · Llama 2 · best of 2 rows5.71Independentreasoningoffversion4.3Partially comparable-0.03obs. 12 Sept 2026artificialanalysis.aiT2History
403Llama-3.2-3BRestricted weightsMeta AI · Llama 3.2 · best of 2 rows5.70Independentreasoningoffversion4.3Partially comparable-0.04obs. 12 Sept 2026artificialanalysis.aiT2History
404minicpm-v4-6-1-3bOpen weightsOpenBMB · best of 2 rows5.69Independentreasoningoffversion4.3Partially comparable-0.05obs. 12 Sept 2026artificialanalysis.aiT2History
405jamba-reasoning-3bOpen weightsAI21 Labs · Jamba · best of 2 rows5.67Independentreasoningonversion4.3Partially comparable-0.07obs. 12 Sept 2026artificialanalysis.aiT2History
406Reka Flash 3Open weightsrekaai · best of 2 rows5.65Independentreasoningonversion4.3Partially comparable-0.09obs. 12 Sept 2026artificialanalysis.aiT2History
406qwen1.5-110b-chatOpen weightsAlibaba Group · Qwen1.5 · best of 2 rows5.65Independentreasoningoffversion4.3Partially comparable-0.09obs. 12 Sept 2026artificialanalysis.aiT2History
408Olmo-3-7B-ThinkOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows5.62Independentreasoningonversion4.3Partially comparable-0.12obs. 12 Sept 2026artificialanalysis.aiT2History
409claude-21ClosedAnthropic · Claude 21 · best of 2 rows5.59Independentreasoningoffversion4.3Partially comparable-0.15obs. 12 Sept 2026artificialanalysis.aiT2History
410Claude 3 HaikuClosedAnthropic · Claude · best of 2 rows5.58Independentreasoningoffversion4.3Partially comparable-0.16obs. 12 Sept 2026artificialanalysis.aiT2History
410olmo-2-7bOpen weightsAllen Institute for AI · OLMo 2 · best of 2 rows5.58Independentreasoningoffversion4.3Partially comparable-0.16obs. 12 Sept 2026artificialanalysis.aiT2History
412molmo-7b-dOpen weightsAllen Institute for AI · Molmo · best of 2 rows5.56Independentreasoningoffversion4.3Partially comparable-0.18obs. 12 Sept 2026artificialanalysis.aiT2History
413ling-mini-2-0Open weightsinclusionAI · best of 2 rows5.54Independentreasoningoffversion4.3Partially comparable-0.20obs. 12 Sept 2026artificialanalysis.aiT2History
414DeepSeek-R1-Distill-Qwen-1.5BOpen weightsDeepSeek · Qwen · best of 2 rows5.51Independentreasoningonversion4.3Partially comparable-0.23obs. 12 Sept 2026artificialanalysis.aiT2History
414claude-2ClosedAnthropic · Claude 2 · best of 2 rows5.51Independentreasoningoffversion4.3Partially comparable-0.23obs. 12 Sept 2026artificialanalysis.aiT2History
414deepseek-v2Open weightsDeepSeek · DeepSeek · best of 2 rows5.51Independentreasoningoffversion4.3Partially comparable-0.23obs. 12 Sept 2026artificialanalysis.aiT2History
417Mistral Small 1.0ClosedMistral AI · Mistral · best of 2 rows5.50Independentreasoningoffversion4.3Partially comparable-0.24obs. 12 Sept 2026artificialanalysis.aiT2History
418gpt-3.5-turboClosedOpenAI · GPT 3.5 · best of 2 rows5.49Independentreasoningoffversion4.3Partially comparable-0.25obs. 12 Sept 2026artificialanalysis.aiT2History
418mistral-mediumClosedMistral AI · Mistral · best of 2 rows5.49Independentreasoningoffversion4.3Partially comparable-0.25obs. 12 Sept 2026artificialanalysis.aiT2History
420Ministral 3 8BOpen weightsMistral AI · Ministral 3 · best of 2 rows5.48Independentreasoningoffversion4.3Partially comparable-0.26obs. 12 Sept 2026artificialanalysis.aiT2History
421llama-3-instruct-70bOpen weightsMeta AI · Llama 3 · best of 2 rows5.45Independentreasoningoffversion4.3Partially comparable-0.29obs. 12 Sept 2026artificialanalysis.aiT2History
422arctic-instructOpen weightsSnowflake · best of 2 rows5.44Independentreasoningoffversion4.3Partially comparable-0.30obs. 12 Sept 2026artificialanalysis.aiT2History
422qwen-chat-72bOpen weightsAlibaba Group · Qwen · best of 2 rows5.44Independentreasoningoffversion4.3Partially comparable-0.30obs. 12 Sept 2026artificialanalysis.aiT2History
424lfm-40bClosedLiquid AI · LFM · best of 2 rows5.42Independentreasoningoffversion4.3Partially comparable-0.32obs. 12 Sept 2026artificialanalysis.aiT2History
425llama-3-2-instruct-11b-visionOpen weightsMeta AI · Llama 3.2 · best of 2 rows5.41Independentreasoningoffversion4.3Partially comparable-0.33obs. 12 Sept 2026artificialanalysis.aiT2History
426palm-2ClosedGoogle · PaLM 2 · best of 2 rows5.37Independentreasoningoffversion4.3Partially comparable-0.37obs. 12 Sept 2026artificialanalysis.aiT2History
427deepseek-coder-v2-liteOpen weightsDeepSeek · DeepSeek · best of 2 rows5.34Independentreasoningoffversion4.3Partially comparable-0.40obs. 12 Sept 2026artificialanalysis.aiT2History
427gemini-1-0-proClosedGoogle · Gemini 1.0 · best of 2 rows5.34Independentreasoningoffversion4.3Partially comparable-0.40obs. 12 Sept 2026artificialanalysis.aiT2History
429sarvam-m-reasoningOpen weightsSarvam · best of 2 rows5.31Independentreasoningonversion4.3Partially comparable-0.43obs. 12 Sept 2026artificialanalysis.aiT2History
430command-r-plus-04-2024Open weightsCohere · Command · best of 2 rows5.30Independentreasoningoffversion4.3Partially comparable-0.44obs. 12 Sept 2026artificialanalysis.aiT2History
430deepseek-llm-67b-chatOpen weightsDeepSeek · DeepSeek · best of 2 rows5.30Independentreasoningoffversion4.3Partially comparable-0.44obs. 12 Sept 2026artificialanalysis.aiT2History
430llama-2-chat-13bOpen weightsMeta AI · Llama 2 · best of 2 rows5.30Independentreasoningoffversion4.3Partially comparable-0.44obs. 12 Sept 2026artificialanalysis.aiT2History
430llama-2-chat-70bOpen weightsMeta AI · Llama 2 · best of 2 rows5.30Independentreasoningoffversion4.3Partially comparable-0.44obs. 12 Sept 2026artificialanalysis.aiT2History
434dbrxOpen weightsDatabricks · best of 2 rows5.29Independentreasoningoffversion4.3Partially comparable-0.45obs. 12 Sept 2026artificialanalysis.aiT2History
434openchat-35Open weightsOpenChat · best of 2 rows5.29Independentreasoningoffversion4.3Partially comparable-0.45obs. 12 Sept 2026artificialanalysis.aiT2History
436exaone-4-0-1-2bOpen weightsLG AI Research · EXAONE 4.0 · best of 4 rows5.27Independentreasoningonversion4.3Partially comparable-0.47obs. 12 Sept 2026artificialanalysis.aiT2History
437Olmo-3-7B-InstructOpen weightsAllen Institute for AI · OLMo 3 · best of 2 rows5.24Independentreasoningoffversion4.3Partially comparable-0.50obs. 12 Sept 2026artificialanalysis.aiT2History
438jamba-1-7-miniOpen weightsAI21 Labs · Jamba 1.7 · best of 2 rows5.22Independentreasoningoffversion4.3Partially comparable-0.52obs. 12 Sept 2026artificialanalysis.aiT2History
438lfm2-5-1-2b-thinkingOpen weightsLiquid AI · LFM2.5 · best of 2 rows5.22Independentreasoningonversion4.3Partially comparable-0.52obs. 12 Sept 2026artificialanalysis.aiT2History
440LFM2.5-1.2B-InstructOpen weightsLiquid AI · LFM2.5 · best of 2 rows5.21Independentreasoningoffversion4.3Partially comparable-0.53obs. 12 Sept 2026artificialanalysis.aiT2History
440jamba-1-5-miniOpen weightsAI21 Labs · Jamba 1.5 · best of 2 rows5.21Independentreasoningoffversion4.3Partially comparable-0.53obs. 12 Sept 2026artificialanalysis.aiT2History
440lfm2-2-6bOpen weightsLiquid AI · LFM2.2 · best of 2 rows5.21Independentreasoningoffversion4.3Partially comparable-0.53obs. 12 Sept 2026artificialanalysis.aiT2History
443granite-4-0-h-nano-1bOpen weightsIBM · Granite 4.0 · best of 2 rows5.19Independentreasoningoffversion4.3Partially comparable-0.55obs. 12 Sept 2026artificialanalysis.aiT2History
443qwen3-1.7b-instructOpen weightsAlibaba Group · Qwen3.1 · best of 4 rows5.19Independentreasoningonversion4.3Partially comparable-0.55obs. 12 Sept 2026artificialanalysis.aiT2History
445Qwen3 8BOpen weightsQwen · Qwen35.16Independentversion4.3Partially comparable-0.58obs. 11 Sept 2026artificialanalysis.aiT2History
445jamba-1-6-miniOpen weightsAI21 Labs · Jamba 1.6 · best of 2 rows5.16Independentreasoningoffversion4.3Partially comparable-0.58obs. 12 Sept 2026artificialanalysis.aiT2History
447Mixtral 8x7BOpen weightsMistral AI · Mixtral 8 · best of 2 rows5.12Independentreasoningoffversion4.3Partially comparable-0.62obs. 12 Sept 2026artificialanalysis.aiT2History
447gemma-3-270mOpen weightsGoogle · Gemma 3 · best of 2 rows5.12Independentreasoningoffversion4.3Partially comparable-0.62obs. 12 Sept 2026artificialanalysis.aiT2History
449Granite 4.0 MicroOpen weightsIBM · Granite 4.0 · best of 2 rows5.11Independentreasoningoffversion4.3Partially comparable-0.63obs. 12 Sept 2026artificialanalysis.aiT2History
449apertus-70b-instructOpen weightsSwiss AI Initiative · best of 2 rows5.11Independentreasoningoffversion4.3Partially comparable-0.63obs. 12 Sept 2026artificialanalysis.aiT2History
451deephermes-3-llama-3-1-8b-previewOpen weightsNous Research · Llama 3.1 · best of 2 rows5.08Independentreasoningoffversion4.3Partially comparable-0.66obs. 12 Sept 2026artificialanalysis.aiT2History
452Mistral 7BOpen weightsMistral AI · Mistral · best of 2 rows5.03Independentreasoningoffversion4.3Partially comparable-0.71obs. 12 Sept 2026artificialanalysis.aiT2History
452claude-instantClosedAnthropic · Claude · best of 2 rows5.03Independentreasoningoffversion4.3Partially comparable-0.71obs. 12 Sept 2026artificialanalysis.aiT2History
452command-r-03-2024Open weightsCohere · Command · best of 2 rows5.03Independentreasoningoffversion4.3Partially comparable-0.71obs. 12 Sept 2026artificialanalysis.aiT2History
452llama-65bOpen weightsMeta AI · Llama · best of 2 rows5.03Independentreasoningoffversion4.3Partially comparable-0.71obs. 12 Sept 2026artificialanalysis.aiT2History
452qwen-chat-14bOpen weightsAlibaba Group · Qwen · best of 2 rows5.03Independentreasoningoffversion4.3Partially comparable-0.71obs. 12 Sept 2026artificialanalysis.aiT2History
457granite-4-0-nano-1bOpen weightsIBM · Granite 4.0 · best of 2 rows5.01Independentreasoningoffversion4.3Partially comparable-0.73obs. 12 Sept 2026artificialanalysis.aiT2History
458Molmo2-8BOpen weightsAllen Institute for AI · best of 2 rows5Independentreasoningoffversion4.3Partially comparable-0.74obs. 12 Sept 2026artificialanalysis.aiT2History
459lfm2-8b-a1bOpen weightsLiquid AI · LFM2 · best of 2 rows4.93Independentreasoningoffversion4.3Partially comparable-0.81obs. 12 Sept 2026artificialanalysis.aiT2History
460granite-3-3-8b-instructOpen weightsIBM · Granite 3.3 · best of 2 rows4.92Independentreasoningoffversion4.3Partially comparable-0.82obs. 12 Sept 2026artificialanalysis.aiT2History
461Gemma 3 27BOpen weightsGoogle · Gemma 3 · best of 2 rows4.85Independentreasoningoffversion4.3Partially comparable-0.89obs. 12 Sept 2026artificialanalysis.aiT2History
462Ministral 3 3BOpen weightsMistral AI · Ministral 3 · best of 2 rows4.84Independentreasoningoffversion4.3Partially comparable-0.90obs. 12 Sept 2026artificialanalysis.aiT2History
463Gemma 3 4BRestricted weightsGoogle · Gemma 3 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463LFM2-1.2BOpen weightsLiquid AI · LFM2.1 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463LFM2.5-VL-1.6BOpen weightsLiquid AI · LFM2.5 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463Llama-3.2-1BRestricted weightsMeta AI · Llama 3.2 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463Qwen3-0.6BOpen weightsQwen · Qwen3.04.83Independentversion4.3Partially comparable-0.91obs. 11 Sept 2026artificialanalysis.aiT2History
463apertus-8b-instructOpen weightsSwiss AI Initiative · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463gemma-3-1bOpen weightsGoogle · Gemma 3 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463gemma-3n-e2bOpen weightsGoogle · Gemma 3 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463gemma-3n-e4bOpen weightsGoogle · Gemma 3 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463granite-4-0-350mOpen weightsIBM · Granite 4.0 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463granite-4-0-h-350mOpen weightsIBM · Granite 4.0 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463llama-3-instruct-8bOpen weightsMeta AI · Llama 3 · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463qwen3-0.6b-instructOpen weightsAlibaba Group · Qwen3.0 · best of 3 rows4.83Independentreasoningonversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
463tiny-aya-globalRestricted weightsCohere · Aya · best of 2 rows4.83Independentreasoningoffversion4.3Partially comparable-0.91obs. 12 Sept 2026artificialanalysis.aiT2History
477Gemma 3 12BOpen weightsGoogle · Gemma 3 · best of 2 rows3.75Independentreasoningoffversion4.3Partially comparable-1.99obs. 12 Sept 2026artificialanalysis.aiT2History

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →