Updated 8 h ago · first seen 11 Sept 2026
bench_01M293SPE8YX533DB8C6AE1Q1S
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 614
- Leader
- gpt-6-astra-xhigh 96.26%
Score history · glm-5-2-non-reasoning 1 row
Not enough history to chart — a single observation (68.59% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 68.59%aa_slug=glm-5-2-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 614 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #201g9v3-39a5bAI9Stars | 80.51% | aa_slug=g9v3-39a5b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #202gpt-5-mini-mediumOpenAI | 80.3% | aa_slug=gpt-5-mini-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #203claude-sonnet-5-non-reasoningAnthropic | 80% | aa_slug=claude-sonnet-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #204Nemotron 3 SuperNVIDIA | 80% | aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #205Claude Sonnet 4.6Anthropic | 79.9% | aa_slug=claude-sonnet-4-6 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #206claude-sonnet-4-6-non-reasoning-low-effortAnthropic | 79.7% | aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #207DeepSeek V3.2 ExpDeepSeek | 79.7% | aa_slug=deepseek-v3-2-reasoning-0925 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #208Claude Opus 4Anthropic | 79.6% | aa_slug=claude-4-opus-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #209exaone-4-5-33bLG AI Research | 79.39% | aa_slug=exaone-4-5-33b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #210gemini-2-5-flash-preview-09-2025-reasoningGoogle | 79.29% | aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #211deepseek-v3-1-terminus-reasoningDeepSeek | 79.19% | aa_slug=deepseek-v3-1-terminus-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #212Gemma 4 26B A4BGoogle | 79.19% | aa_slug=gemma-4-26b-a4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #213grok-3-mini-reasoningSpaceXAI | 79.09% | aa_slug=grok-3-mini-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #214Qwen3 235B A22B Instruct 2507Qwen | 78.99% | aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #215gpt-5-6-sol-non-reasoningOpenAI | 78.99% | aa_slug=gpt-5-6-sol-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #216gemini-2-5-flash-reasoningGoogle | 78.99% | aa_slug=gemini-2-5-flash-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #217kimi-k2-5-non-reasoningMoonshot AI | 78.89% | aa_slug=kimi-k2-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #218kimi-k2-6-non-reasoningMoonshot AI | 78.79% | aa_slug=kimi-k2-6-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #219qwen3-5-9b-non-reasoningAlibaba Group | 78.59% | aa_slug=qwen3-5-9b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #220nova-2-0-pro-reasoning-mediumAmazon Web Services | 78.48% | aa_slug=nova-2-0-pro-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #221grok-4-20-0309-non-reasoningSpaceXAI | 78.48% | aa_slug=grok-4-20-0309-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #222o4-miniOpenAI | 78.38% | aa_slug=o4-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #223k-exaoneLG AI Research | 78.28% | aa_slug=k-exaone · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #224GLM 4.5Z.ai (Zhipu AI) | 78.18% | aa_slug=glm-4.5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #225gpt-oss-120bOpenAI | 78.18% | aa_slug=gpt-oss-120b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #226glm-4-6-reasoningZ.ai (Zhipu AI) | 77.98% | aa_slug=glm-4-6-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #227LongCat 2.0Meituan | 77.98% | aa_slug=longcat-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #228deepseek-v3-1-reasoningDeepSeek | 77.88% | aa_slug=deepseek-v3-1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #229ernie-5-0-thinking-previewBaidu | 77.68% | aa_slug=ernie-5-0-thinking-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #230claude-4-sonnet-thinkingAnthropic | 77.68% | aa_slug=claude-4-sonnet-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #231MiniMax M2MiniMax | 77.68% | aa_slug=minimax-m2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #232qwen3-max-thinking-previewAlibaba Group | 77.58% | aa_slug=qwen3-max-thinking-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #233grok-4.20-0309-non-reasoningxAI | 77.58% | aa_slug=grok-4-20-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #234ring-1tinclusionAI | 77.37% | aa_slug=ring-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #235o3 Mini HighOpenAI | 77.27% | aa_slug=o3-mini-high · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #236claude-3-7-sonnet-thinkingAnthropic | 77.17% | aa_slug=claude-3-7-sonnet-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #237qwen3-vl-235b-a22b-reasoningAlibaba Group | 77.17% | aa_slug=qwen3-vl-235b-a22b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #238Qwen3.5-4BQwen | 77.07% | aa_slug=qwen3-5-4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #239Mercury 2Inception | 76.97% | aa_slug=mercury-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #240Mistral Small 4Mistral AI | 76.87% | aa_slug=mistral-small-4 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #241gpt-5-5-non-reasoningOpenAI | 76.77% | aa_slug=gpt-5-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #242cogito-v2-1-reasoningDeep Cogito | 76.77% | aa_slug=cogito-v2-1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #243nova-2-0-lite-reasoning-mediumAmazon Web Services | 76.77% | aa_slug=nova-2-0-lite-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #244Kimi K2 0905Moonshot AI | 76.67% | aa_slug=kimi-k2-0905 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #245Kimi K2 0711Moonshot AI | 76.57% | aa_slug=kimi-k2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #246gemini-2-5-flash-preview-09-2025Google | 76.57% | aa_slug=gemini-2-5-flash-preview-09-2025 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #247o1 PreviewOpenAI | 76.46% | aa_slug=o1-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #248kat-coder-pro-v1KwaiKAT | 76.36% | aa_slug=kat-coder-pro-v1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #249doubao-seed-codeByteDance | 76.36% | aa_slug=doubao-seed-code · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #250qwen3-max-previewAlibaba Group | 76.36% | aa_slug=qwen3-max-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #251Qwen3 MaxQwen | 76.36% | aa_slug=qwen3-max · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #252gemma-4-31b-non-reasoningGoogle | 76.26% | aa_slug=gemma-4-31b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #253mimo-v2-5-pro-non-reasoningXiaomi | 76.16% | aa_slug=mimo-v2-5-pro-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #254command-a-plusCohere | 76.06% | aa_slug=command-a-plus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #255intellect-3Prime Intellect | 76.06% | aa_slug=intellect-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #256gpt-5-4-nano-mediumOpenAI | 76.06% | aa_slug=gpt-5-4-nano-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #257nova-2-0-omni-reasoning-mediumAmazon Web Services | 75.96% | aa_slug=nova-2-0-omni-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #258qwen3-next-80b-a3b-reasoningAlibaba Group | 75.86% | aa_slug=qwen3-next-80b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #259nemotron-cascade-2-30b-a3bNVIDIA | 75.76% | aa_slug=nemotron-cascade-2-30b-a3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #260nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA | 75.66% | aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #261North Mini Code (free)Cohere | 75.66% | aa_slug=north-mini-code · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #262qwen3-235b-a22b-instruct-2507Alibaba Group | 75.25% | aa_slug=qwen3-235b-a22b-instruct-2507 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #263gemma-4-12BGoogle | 75.25% | aa_slug=gemma-4-12b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #264ling-2-6-1tinclusionAI | 75.15% | aa_slug=ling-2-6-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #265Trinity Large ThinkingArcee AI | 75.15% | aa_slug=trinity-large-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #266DeepSeek V3.1 TerminusDeepSeek | 75.05% | aa_slug=deepseek-v3-1-terminus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #267nova-2-0-pro-reasoning-lowAmazon Web Services | 75.05% | aa_slug=nova-2-0-pro-reasoning-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #268DeepSeek V3DeepSeek | 75.05% | aa_slug=deepseek-v3-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #269llama-nemotron-super-49b-v1-5-reasoningNVIDIA | 74.85% | aa_slug=llama-nemotron-super-49b-v1-5-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #270o3-miniOpenAI | 74.85% | aa_slug=o3-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #271gpt-5-4-non-reasoningOpenAI | 74.85% | aa_slug=gpt-5-4-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #272Mistral Medium 3.5Mistral AI | 74.85% | aa_slug=mistral-medium-3-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #273o1OpenAI | 74.75% | aa_slug=o1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #274gpt-5-6-terra-non-reasoningOpenAI | 74.65% | aa_slug=gpt-5-6-terra-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #275Nemotron 3.5 LightningNVIDIA | 74.34% | aa_slug=nemotron-3-5-lightning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #276qwen3-5-omni-flashAlibaba Group | 74.24% | aa_slug=qwen3-5-omni-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #277exaone-4-0-32b-reasoningLG AI Research | 73.94% | aa_slug=exaone-4-0-32b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #278Magistral Medium 1.2Mistral AI | 73.94% | aa_slug=magistral-medium-2509 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #279Qwen3 Next 80B A3B InstructQwen | 73.84% | aa_slug=qwen3-next-80b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #280sarvam-105bSarvam | 73.84% | aa_slug=sarvam-105b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #281deepseek-v3-2-0925DeepSeek | 73.84% | aa_slug=deepseek-v3-2-0925 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #282Qwen3 Coder NextQwen | 73.74% | aa_slug=qwen3-coder-next · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #283DeepSeek V3.1DeepSeek | 73.54% | aa_slug=deepseek-v3-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #284ling-3-0-tinyinclusionAI | 73.43% | aa_slug=ling-3-0-tiny · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #285GLM 4.5 AirZ.ai (Zhipu AI) | 73.33% | aa_slug=glm-4-5-air · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #286apriel-v1-6-15b-thinkerServiceNow | 73.33% | aa_slug=apriel-v1-6-15b-thinker · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #287qwen3-vl-32b-reasoningAlibaba Group | 73.33% | aa_slug=qwen3-vl-32b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #288hypernova-60bMultiverse Computing | 73.33% | aa_slug=hypernova-60b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #289quasar-438bMultiverse Computing | 73.23% | aa_slug=quasar-438b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #290hy3-non-reasoningTencent | 73.23% | aa_slug=hy3-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #291llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA | 72.83% | aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #292Claude Sonnet 4.5Anthropic | 72.73% | aa_slug=claude-4-5-sonnet · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #293Grok Build 0.1xAI | 72.73% | aa_slug=grok-code-fast-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #294Hermes 4 405BNous Research | 72.73% | aa_slug=hermes-4-llama-3-1-405b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #295Seed-OSS-36B-InstructByteDance | 72.63% | aa_slug=seed-oss-36b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #296qwen3-omni-30b-a3b-reasoningAlibaba Group | 72.63% | aa_slug=qwen3-omni-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #297ring-flash-2-0inclusionAI | 72.53% | aa_slug=ring-flash-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #298Solar Pro 3Upstage | 72.42% | aa_slug=solar-pro-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #299midm-250-pro-rsnsftKorea Telecom | 72.22% | aa_slug=midm-250-pro-rsnsft · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #300qwen3-vl-30b-a3b-reasoningAlibaba Group | 72.02% | aa_slug=qwen3-vl-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
Definition
- Category
- reasoning
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Task
- graduate-level science questions
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Direction
- Higher is better
- Paper
- https://arxiv.org/abs/2311.12022
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- llama-2-chat-7b, grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, gemini-2.0-flash-exp, GPT-5.1-Codex Mini +606(614 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| reasoning | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Paperpaper1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://arxiv.org/abs/2311.12022 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| graduate-level science questions | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://github.com/idavidrein/gpqa | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 6 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.