Skip to content
AI Atlas
BenchmarkActivecategory · composite

Artificial Analysis Intelligence Index

artificialanalysis.ai

composite of several evaluations run by Artificial Analysis

quality57

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPG0EAFKRT01VFHFK9SC

Metric
index
Direction
Higher is better
Results
638 · 147 filtered
Leader
Claude Fable 5.1 53.37

Score history · gpt-5.5 1 row

Not enough history to chart — a single observation (38.63 on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 38.63aa_slug=gpt-5-5 · version=4.3 · estimated=false11 Sept 2026

Back to the full leaderboard

Leaderboard 147 current results · config contains “false”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101claude-4-5-haiku-reasoningAnthropic17.59aa_slug=claude-4-5-haiku-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102gpt-5-miniOpenAI17.41aa_slug=gpt-5-mini · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103ring-2-6-1tinclusionAI17.28aa_slug=ring-2-6-1t · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104Gemini 2.5 ProGoogle16.66aa_slug=gemini-2-5-pro · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105Qwen3.5-122B-A10BQwen16.19aa_slug=qwen3-5-122b-a10b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106gemini-3-1-flash-lite-previewGoogle16.03aa_slug=gemini-3-1-flash-lite-preview · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107Gemma 4 31BGoogle15.42aa_slug=gemma-4-31b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108deepseek-v3-1-terminus-reasoningDeepSeek15.4aa_slug=deepseek-v3-1-terminus-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109Mistral Medium 3.5Mistral AI14.89aa_slug=mistral-medium-3-5 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110grok-4-3-non-reasoningSpaceXAI14.54aa_slug=grok-4-3-non-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111command-a-plusCohere13.92aa_slug=command-a-plus · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112Nemotron 3.5 LightningNVIDIA13.64aa_slug=nemotron-3-5-lightning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113Nemotron 3 SuperNVIDIA13.55aa_slug=nvidia-nemotron-3-super-120b-a12b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114minicpm5-2bOpenBMB13.14aa_slug=minicpm5-2b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115Qwen3 235B A22B Instruct 2507Qwen12.71aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116gpt-oss-120bOpenAI12.35aa_slug=gpt-oss-120b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117ling-3-0-tinyinclusionAI11.87aa_slug=ling-3-0-tiny · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118Granite 4.2 8BIBM11.81aa_slug=granite-4-2-8b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119Mercury 2Inception11.51aa_slug=mercury-2 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120Mistral Small 4Mistral AI11.45aa_slug=mistral-small-4 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121deepseek-r1-0120DeepSeek11.41aa_slug=deepseek-r1-0120 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122o3 Mini HighOpenAI10.96aa_slug=o3-mini-high · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123Trinity Large ThinkingArcee AI10.88aa_slug=trinity-large-thinking · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124Qwen3 Coder NextQwen10.05aa_slug=qwen3-coder-next · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125qwen3-30b-a3b-2507-reasoningAlibaba Group9.81aa_slug=qwen3-30b-a3b-2507-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126DeepSeek V3 0324DeepSeek9.72aa_slug=deepseek-v3-0324 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127Mistral Large 3Mistral AI9.71aa_slug=mistral-large-3 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128Devstral 2Mistral AI9.41aa_slug=devstral-2 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129Llama 4 MaverickMeta AI9.3aa_slug=llama-4-maverick · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130granite-4.2-3bIBM9.06aa_slug=granite-4-2-3b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131gpt-oss-20bOpenAI9.04aa_slug=gpt-oss-20b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA8.9aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133deepseek-v3DeepSeek8.49aa_slug=deepseek-v3 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134Devstral Small 2Mistral AI8.36aa_slug=devstral-small-2 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135Solar Pro 3Upstage7.82aa_slug=solar-pro-3 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136Mistral Small 3.1Mistral AI7.37aa_slug=mistral-small-3-1 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137Qwen3 32BQwen7.22aa_slug=qwen3-32b-instruct-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138Mistral Small 3.2Mistral AI6.96aa_slug=mistral-small-3-2 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139Llama 4 ScoutMeta AI6.45aa_slug=llama-4-scout · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140Qwen3 14BQwen6.39aa_slug=qwen3-14b-instruct-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141celeris-1Celeris6.35aa_slug=celeris-1 · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142Ministral 3 14BMistral AI6.04aa_slug=ministral-3-14b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143Ministral 3 8BMistral AI5.48aa_slug=ministral-3-8b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144Qwen3 8BQwen5.16aa_slug=qwen3-8b-instruct-reasoning · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145Gemma 3 27BGoogle4.85aa_slug=gemma-3-27b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146Ministral 3 3BMistral AI4.84aa_slug=ministral-3-3b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147Gemma 3 12BGoogle3.75aa_slug=gemma-3-12b · version=4.3 · estimated=false(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.