Skip to content
AI Atlas

Benchmarks / Matrix

Benchmark matrix

Canonical models × benchmarks. Each cell is the best current score in the benchmark's comparability group; hover for score, rank, trust and comparability, click to open the leaderboard.

60 models × 12 benchmarks

Benchmark matrix: models × benchmarks, best comparable current score, coloured by within-column rank
ModelArtificial Analysis I…index · 477 modelsGPQA Diamondaccuracy · 459 modelsHumanity's Last Examaccuracy · 453 modelsIFBenchaccuracy · 333 modelsτ²-benchpass^1 · 323 modelsTerminal-Benchaccuracy · 315 modelsMMMU-Proaccuracy · 156 modelsSciCodeaccuracy · 126 modelsAider polyglotpass_rate_2 · 61 modelsAider polyglot — well…percent_cases_well_formed · 61 modelsLiveBenchglobal_average · 57 modelsLiveBench Reasoningaverage score · 57 models
gpt-5.5OpenAI · 202638.693.5%45.8%75.8%93.9%60.6%81.2%56.1%80.2%89.7%
gpt-5.6-solOpenAI · 202647.194.1%49.5%72.7%85.1%65.9%83.4%57.8%81.1%91.7%
Gemini 3.1 Pro PreviewGoogle · 202630.494.1%47.0%77.1%95.6%53.8%82.4%58.7%77.0%84.0%
Gemini 3.5 FlashGoogle · 202633.692.2%42.7%76.3%95.6%46.2%84.3%53.9%74.6%82.0%
gpt-5.6-terraOpenAI · 202642.392.5%42.9%71.2%86.3%62.9%80.7%55.0%77.9%90.6%
Kimi K2.6Moonshot AI · 202631.391.1%37.5%76.0%95.9%43.9%79.4%51.5%70.5%79.4%
MiniMax-M3MiniMax · 202629.692.9%39.0%82.9%88.9%42.4%78.5%47.1%67.3%74.5%
Grok 4.3xAI · 202625.490.1%37.2%83.3%97.7%37.9%78.1%48.3%62.2%70.8%
gpt-5.4-miniOpenAI · 202624.687.5%28.1%73.3%83.3%52.3%73.3%52.1%66.4%71.3%
gpt-5.4-nanoOpenAI · 202621.281.7%28.3%75.9%76.0%42.4%65.4%47.2%69.6%81.1%
Qwen3.6 27BQwen · 202621.984.2%23.1%67.5%94.2%34.9%74.6%42.8%64.0%70.3%
Llama 4 MaverickMeta AI · 20259.3067.1%4.91%43.0%17.8%6.82%62.1%31.7%15.6%99.1%
Gemma 3 27BGoogle · 20254.8542.8%4.40%31.8%10.5%3.79%48.0%23.3%4.90%100%
Claude Fable 5Anthropic · 202649.792.6%55.5%63.5%98.5%62.9%61%83.0%89.7%
Claude Opus 4.8Anthropic · 202642.092.0%48.7%62.2%94.4%58.3%54.4%76.2%89.2%
gpt-5.4OpenAI · 202639.092.0%43.7%74.0%87.1%57.6%78.4%78.0%88.1%
Qwen3.7 MaxQwen · 202629.992.3%40.5%80.5%94.7%50.8%49.5%73.1%83.3%
Z.ai GLM 5.2Z.ai (Zhipu AI) · 202638.689.5%41.1%73.3%99.1%50.8%51.2%73.2%78.6%
Claude Opus 4.7Anthropic · 202640.791.4%42.3%58.6%88.6%54.5%78.8%76.5%87.2%
GPT-5.2-CodexOpenAI · 202628.589.9%35.7%77.6%92.1%37.1%76.3%74.0%77.7%
gpt-5.2OpenAI · 202530.490.3%37.7%75.4%84.8%47.0%74.6%74.6%83.2%
Claude Opus 4.6Anthropic · 202631.989.6%39.9%53.1%92.1%48.5%75.4%74.5%88.7%
Qwen3.6 PlusQwen · 202627.088.2%27.9%75.2%97.7%43.9%78.0%68.9%75.8%
Kimi K2.7 CodeMoonshot AI · 202626.389.6%35.0%63.1%90.1%44.7%47.8%68.4%82.8%
Claude Opus 4.5Anthropic · 202529.186.6%30.1%58.0%89.5%47.0%74.0%72.6%80.1%
gpt-5OpenAI · 202523.085.3%28.5%73.1%86.5%37.9%74.3%86.7%88.4%
Nemotron 3 UltraNVIDIA · 202623.486.7%28.4%81.4%83.3%36.4%40.3%67.4%74.7%
grok-4SpaceXAI22.587.7%26.7%53.7%74.8%37.9%68.8%79.6%97.3%
o3OpenAI · 202520.282.7%20.1%71.4%80.7%37.1%70.1%81.3%94.7%
o4-miniOpenAI · 202516.678.4%16.5%68.7%55.6%15.2%69.3%72%90.7%
Claude Sonnet 4Anthropic · 202518.977.7%10.7%54.7%64.6%31.1%62.4%61.3%98.2%
gpt-oss-120bOpenAI · 202512.378.2%19.6%69.0%65.8%23.5%34.0%41.8%79.1%
Claude 3.7 SonnetAnthropic17.777.2%9.67%48.3%54.7%21.2%60.1%60.4%93.3%
o3-miniOpenAI · 202512.577.3%12.0%67.1%31.3%6.82%42.8%60.4%95.1%
DeepSeek V3 0324DeepSeek · 20259.7265.5%4.74%41.0%47.1%15.2%39%55.1%99.6%
gpt-4.1OpenAI · 202512.766.6%4.18%43.0%47.1%13.6%61.2%52.4%98.2%
gpt-4.1-miniOpenAI · 202510.266.4%5.02%38.3%52.9%7.58%58.7%32.4%92.4%
Qwen3 32BQwen · 20257.2266.8%7.41%36.3%29.8%3.03%36%40%83.6%
GPT-4o (2024-08-06)OpenAI · 20247.7452.1%2.33%36.0%28.9%8.33%56.3%23.1%94.2%
Claude Haiku 3.5Anthropic8.9440.8%3.63%42.8%24.6%2.27%45.6%28%91.1%
gpt-4.1-nanoOpenAI · 20257.8251.2%3.75%32.0%17.3%3.79%40.1%8.90%94.2%
Qwen 3.7 PlusQwen · 202625.890%35.6%78.0%93.0%47.0%80.5%46.1%
Qwen3.5 397B A17BQwen · 202621.489.3%29.0%78.8%95.6%40.9%77.3%44.8%
Claude Sonnet 4.6Anthropic · 202630.487.5%33.6%56.6%79.5%53.0%73.3%50.1%
MiMo-V2.5Xiaomi · 202622.385.0%27.2%67.1%90.6%41.7%75.4%43.9%
Qwen3.5-122B-A10BQwen · 202617.885.7%25.2%75.7%93.6%31.1%75.0%39.7%
Step 3.7 FlashStepFun · 202619.580.9%21.4%67.3%98.5%35.6%75.3%43.9%
Qwen3.6 35B A3BQwen · 202618.884.1%22.2%64.3%95.3%34.9%75.0%36.6%
Gemma 4 31BGoogle · 202615.485.7%23.6%75.6%65.5%36.4%73.4%45.5%
gpt-5-miniOpenAI · 202520.682.8%21.5%75.4%71.0%33.3%70.1%39%
Claude Sonnet 4.5Anthropic · 202521.283.4%17.8%57.3%78.1%35.6%68.7%45.7%
Claude Opus 4Anthropic · 202520.679.6%12.3%53.7%73.4%31.1%72%98.7%
Gemini 3.1 Flash-Lite PreviewGoogle · 202616.082.2%17.2%77.2%31.3%24.2%75.5%43.4%
Mistral Medium 3.5Mistral AI · 202614.974.8%13.8%68.8%94.2%33.3%64.9%40.2%
Gemini 2.5 ProGoogle · 202516.784.4%22.5%48.7%54.1%26.5%74.9%46.3%
command-a-plusCohere13.976.1%12.0%74.0%80.7%25%63.2%38.5%
o1OpenAI · 202415.274.8%7.01%70.3%62.6%12.9%61.7%91.5%
Claude Haiku 4.5Anthropic · 202517.667.2%10.4%54.3%54.7%27.3%58.5%42.3%
Kimi K2 0711Moonshot AI · 202512.776.6%7.41%41.5%61.1%15.9%59.1%92.9%
Grok Build 0.1xAI · 202614.172.7%8.02%41.4%75.7%17.4%67.8%76.4%

Rows are the models with at least 3 cells, ordered by mean rank; columns are the 12 benchmarks with the most current results. Empty = no current result in the group, never interpolated.