Updated 8 h ago · first seen 11 Sept 2026
bench_01M293SPE8YX533DB8C6AE1Q1S
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 614
- Leader
- gpt-6-astra-xhigh 96.26%
Score history · gpt-5-4-low 1 row
Not enough history to chart — a single observation (87.07% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 87.07%aa_slug=gpt-5-4-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 614 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #101gpt-5.4-miniOpenAI | 87.47% | aa_slug=gpt-5-4-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #102claude-sonnet-4-6-adaptiveAnthropic | 87.47% | aa_slug=claude-sonnet-4-6-adaptive · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #103MiniMax M2.7MiniMax | 87.37% | aa_slug=minimax-m2-7 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #104gpt-5.1OpenAI | 87.27% | aa_slug=gpt-5-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #105k2-horizon-375b-a23bMBZUAI Institute of Foundation Models | 87.27% | aa_slug=k2-horizon-375b-a23b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #106gpt-5-6-terra-mediumOpenAI | 87.17% | aa_slug=gpt-5-6-terra-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #107InklingThinking Machines | 87.17% | aa_slug=inkling · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #108gpt-5-4-lowOpenAI | 87.07% | aa_slug=gpt-5-4-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #109deepseek-v3-2-specialeDeepSeek | 87.07% | aa_slug=deepseek-v3-2-speciale · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #110mimo-v2-proXiaomi | 86.97% | aa_slug=mimo-v2-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #111motif-0714Motif Technologies | 86.87% | aa_slug=motif-0714 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #112GLM 5.1Z.ai (Zhipu AI) | 86.77% | aa_slug=glm-5-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #113deepseek-v4-flash-0420-highDeepSeek | 86.67% | aa_slug=deepseek-v4-flash-0420-high · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #114Nemotron 3 UltraNVIDIA | 86.67% | aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #115Hy3 previewTencent | 86.67% | aa_slug=hy3-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #116MiMo-V2.5-ProXiaomi | 86.57% | aa_slug=mimo-v2-5-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #117claude-opus-4-5-thinkingAnthropic | 86.57% | aa_slug=claude-opus-4-5-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #118apodex-1-1Apodex | 86.36% | aa_slug=apodex-1-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #119gpt-5-2-mediumOpenAI | 86.36% | aa_slug=gpt-5-2-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #120Ling 3.0 Flash VLinclusionAI | 86.16% | aa_slug=ling-3-0-flash-vl · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #121qwen3-5-397b-a17b-non-reasoningAlibaba Group | 86.06% | aa_slug=qwen3-5-397b-a17b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #122Qwen3 Max ThinkingQwen | 86.06% | aa_slug=qwen3-max-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #123GPT-5.1-CodexOpenAI | 85.96% | aa_slug=gpt-5-1-codex · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #124gpt-5-6-luna-mediumOpenAI | 85.86% | aa_slug=gpt-5-6-luna-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #125GLM 4.7Z.ai (Zhipu AI) | 85.86% | aa_slug=glm-4-7 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #126Qwen3.5-27BQwen | 85.76% | aa_slug=qwen3-5-27b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #127Gemma 4 31BGoogle | 85.66% | aa_slug=gemma-4-31b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #128Qwen3.5-122B-A10BQwen | 85.66% | aa_slug=qwen3-5-122b-a10b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #129solar-open2-250bUpstage | 85.66% | aa_slug=solar-open2-250b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #130ring-2-6-1tinclusionAI | 85.66% | aa_slug=ring-2-6-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #131a-x-k2SK Telecom | 85.66% | aa_slug=a-x-k2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #132Ling 3.0 FlashinclusionAI | 85.45% | aa_slug=ling-3-0-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #133mimo-v2-omni-0327Xiaomi | 85.45% | aa_slug=mimo-v2-omni-0327 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #134KAT-Coder-Pro V2Kwaipilot | 85.45% | aa_slug=kat-coder-pro-v2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #135gpt-5OpenAI | 85.35% | aa_slug=gpt-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #136grok-4-1-fast-reasoningSpaceXAI | 85.25% | aa_slug=grok-4-1-fast-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #137nanbeige4-1-3bNanbeige | 84.95% | aa_slug=nanbeige4-1-3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #138MiMo-V2.5Xiaomi | 84.95% | aa_slug=mimo-v2-5-0424 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #139MiniMax M2.5MiniMax | 84.85% | aa_slug=minimax-m2-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #140grok-4-fast-reasoningSpaceXAI | 84.75% | aa_slug=grok-4-fast-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #141GLM 5 TurboZ.ai (Zhipu AI) | 84.75% | aa_slug=glm-5-turbo · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #142gpt-5-5-instant-05-26OpenAI | 84.65% | aa_slug=gpt-5-5-instant-05-26 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #143mimo-v2-flash-reasoningXiaomi | 84.65% | aa_slug=mimo-v2-flash-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #144o3-proOpenAI | 84.55% | aa_slug=o3-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #145qwen3-8-27b-mediumAlibaba Group | 84.55% | aa_slug=qwen3-8-27b-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #146Qwen3.5-35B-A3BQwen | 84.55% | aa_slug=qwen3-5-35b-a3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #147jt-4-1-flash-236b-a21bChina Mobile | 84.55% | aa_slug=jt-4-1-flash-236b-a21b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #148qwen3-8-27b-lowAlibaba Group | 84.55% | aa_slug=qwen3-8-27b-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #149Gemini 2.5 ProGoogle | 84.44% | aa_slug=gemini-2-5-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #150grok-4-3-lowSpaceXAI | 84.34% | aa_slug=grok-4-3-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #151gpt-5-6-terra-lowOpenAI | 84.34% | aa_slug=gpt-5-6-terra-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #152qwen3-5-27b-non-reasoningAlibaba Group | 84.24% | aa_slug=qwen3-5-27b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #153kimi-k3-lowMoonshot AI | 84.24% | aa_slug=kimi-k3-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #154Qwen3.6 27BQwen | 84.24% | aa_slug=qwen3-6-27b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #155gpt-5 (medium)OpenAI | 84.18% | aa_slug=gpt-5-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #156Qwen3.6 35B A3BQwen | 84.14% | aa_slug=qwen3-6-35b-a3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #157DeepSeek V3.2DeepSeek | 84.04% | aa_slug=deepseek-v3-2-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #158Claude Opus 4.6Anthropic | 84.04% | aa_slug=claude-opus-4-6 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #159glm-5-1-non-reasoningZ.ai (Zhipu AI) | 83.94% | aa_slug=glm-5-1-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #160Kimi K2 ThinkingMoonshot AI | 83.84% | aa_slug=kimi-k2-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #161Gemini 3.5 Flash-LiteGoogle | 83.84% | aa_slug=gemini-3-5-flash-lite · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #162GPT-5-CodexOpenAI | 83.74% | aa_slug=gpt-5-codex · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #163gemini-2-5-pro-03-25Google | 83.64% | aa_slug=gemini-2-5-pro-03-25 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #164Muse Glimmer 30BMeta AI | 83.54% | aa_slug=muse-glimmer · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #165gpt-5-6-luna-lowOpenAI | 83.54% | aa_slug=gpt-5-6-luna-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #166mimo-v2-0206Xiaomi | 83.54% | aa_slug=mimo-v2-0206 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #167claude-4-5-sonnet-thinkingAnthropic | 83.43% | aa_slug=claude-4-5-sonnet-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #168motif-3Motif Technologies | 83.43% | aa_slug=motif-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #169Step 3.5 FlashStepFun | 83.13% | aa_slug=step-3-5-flash-0202 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #170MiniMax M2.1MiniMax | 83.03% | aa_slug=minimax-m2-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #171k-exaone-2-0-0803LG AI Research | 82.93% | aa_slug=k-exaone-2-0-0803 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #172qwen3-6-27b-non-reasoningAlibaba Group | 82.93% | aa_slug=qwen3-6-27b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #173jt-35b-flashChina Mobile | 82.93% | aa_slug=jt-35b-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #174gemini-3-5-flash-minimalGoogle | 82.83% | aa_slug=gemini-3-5-flash-minimal · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #175gpt-5-miniOpenAI | 82.83% | aa_slug=gpt-5-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #176mimo-v2-omniXiaomi | 82.83% | aa_slug=mimo-v2-omni · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #177qwen3-5-122b-a10b-non-reasoningAlibaba Group | 82.73% | aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #178o3OpenAI | 82.73% | aa_slug=o3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #179step-3-5-flashStepFun | 82.63% | aa_slug=step-3-5-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #180qwen3-5-omni-plusAlibaba Group | 82.63% | aa_slug=qwen3-5-omni-plus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #181gpt-5-4-mini-mediumOpenAI | 82.32% | aa_slug=gpt-5-4-mini-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #182gpt-5-5-instant-06-26OpenAI | 82.32% | aa_slug=gpt-5-5-instant-06-26 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #183gemini-3-1-flash-lite-previewGoogle | 82.22% | aa_slug=gemini-3-1-flash-lite-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #184gemini-2-5-pro-05-06Google | 82.22% | aa_slug=gemini-2-5-pro-05-06 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #185GLM 5Z.ai (Zhipu AI) | 82.02% | aa_slug=glm-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #186qwen3-5-35b-a3b-non-reasoningAlibaba Group | 81.92% | aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #187qwen3-8-27b-non-reasoningAlibaba Group | 81.82% | aa_slug=qwen3-8-27b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #188gpt-5.4-nanoOpenAI | 81.72% | aa_slug=gpt-5-4-nano · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #189qwen3-6-35b-a3b-non-reasoningAlibaba Group | 81.72% | aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #190deepseek-r1DeepSeek | 81.31% | aa_slug=deepseek-r1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #191GPT-5.1-Codex MiniOpenAI | 81.31% | aa_slug=gpt-5-1-codex-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #192gemini-3-flashGoogle | 81.21% | aa_slug=gemini-3-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #193ernie-4-5-300b-a47bBaidu | 81.11% | aa_slug=ernie-4-5-300b-a47b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #194nova-2-0-lite-reasoningAmazon Web Services | 81.11% | aa_slug=nova-2-0-lite-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #195Claude Opus 4.5Anthropic | 81.01% | aa_slug=claude-opus-4-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #196Step 3.7 FlashStepFun | 80.91% | aa_slug=step-3-7-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #197GLM 5V TurboZ.ai (Zhipu AI) | 80.91% | aa_slug=glm-5v-turbo · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #198claude-4-1-opus-thinkingAnthropic | 80.9% | aa_slug=claude-4-1-opus-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #199gpt-5 (low)OpenAI | 80.81% | aa_slug=gpt-5-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #200Qwen3.5-9BQwen | 80.61% | aa_slug=qwen3-5-9b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
Definition
- Category
- reasoning
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Task
- graduate-level science questions
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Direction
- Higher is better
- Paper
- https://arxiv.org/abs/2311.12022
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- llama-2-chat-7b, grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, gemini-2.0-flash-exp, GPT-5.1-Codex Mini +606(614 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| reasoning | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Paperpaper1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://arxiv.org/abs/2311.12022 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| graduate-level science questions | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://github.com/idavidrein/gpqa | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 6 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.