Updated 9 h ago · first seen 11 Sept 2026
bench_01M293SPE8YX533DB8C6AE1Q1S
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 614
- Leader
- gpt-6-astra-xhigh 96.26%
Score history · qwen3-5-4b-non-reasoning 1 row
Not enough history to chart — a single observation (71.21% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 71.21%aa_slug=qwen3-5-4b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 614 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #401tri-21b-think-v0-5Trillion Labs | 60.1% | aa_slug=tri-21b-think-v0-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #402claude-35-sonnetAnthropic | 59.9% | aa_slug=claude-35-sonnet · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #403k2-v2-mediumMBZUAI Institute of Foundation Models | 59.8% | aa_slug=k2-v2-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #404Devstral 2Mistral AI | 59.39% | aa_slug=devstral-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #405gemini-2-5-flash-04-2025Google | 59.39% | aa_slug=gemini-2-5-flash-04-2025 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #406ling-2-6-flashinclusionAI | 59.29% | aa_slug=ling-2-6-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #407QwQ-32BAlibaba Group | 59.29% | aa_slug=qwq-32b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #408olmo-3-1-32b-thinkAllen Institute for AI | 59.09% | aa_slug=olmo-3-1-32b-think · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #409Qwen3 8BQwen | 58.89% | aa_slug=qwen3-8b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #410gemini-1-5-proGoogle | 58.89% | aa_slug=gemini-1-5-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #411Mistral Medium 3.1Mistral AI | 58.79% | aa_slug=mistral-medium-3-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #412Llama 4 ScoutMeta AI | 58.69% | aa_slug=llama-4-scout · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #413qwen-2-5-maxAlibaba Group | 58.69% | aa_slug=qwen-2-5-max · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #414GLM 4.7 FlashZ.ai (Zhipu AI) | 58.08% | aa_slug=glm-4-7-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #415qwen3-vl-8b-reasoningAlibaba Group | 57.88% | aa_slug=qwen3-vl-8b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #416Mistral Medium 3Mistral AI | 57.78% | aa_slug=mistral-medium-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #417Sonar ProPerplexity AI | 57.78% | aa_slug=sonar-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #418solar-pro-2-preview-reasoningUpstage | 57.78% | aa_slug=solar-pro-2-preview-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #419gemma-4-E4BGoogle | 57.58% | aa_slug=gemma-4-e4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #420Phi 4Microsoft | 57.47% | aa_slug=phi-4 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #421glm-4-5vZ.ai (Zhipu AI) | 57.27% | aa_slug=glm-4-5v · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #422nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA | 57.17% | aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #423Ministral 3 14BMistral AI | 57.17% | aa_slug=ministral-3-14b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #424mistral-small-4-non-reasoningMistral AI | 57.07% | aa_slug=mistral-small-4-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #425NVIDIA-Nemotron-Nano-9B-v2NVIDIA | 56.97% | aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #426nova-premierAmazon Web Services | 56.87% | aa_slug=nova-premier · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #427glm-4-6vZ.ai (Zhipu AI) | 56.57% | aa_slug=glm-4-6v · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #428ling-mini-2-0inclusionAI | 56.16% | aa_slug=ling-mini-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #429solar-pro-2Upstage | 56.06% | aa_slug=solar-pro-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #430claude-35-sonnet-june-24Anthropic | 55.96% | aa_slug=claude-35-sonnet-june-24 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #431granite-4.2-3bIBM | 55.86% | aa_slug=granite-4-2-3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #432LFM2.5-2.6B (free)Liquid AI | 55.76% | aa_slug=lfm2-5-2-6b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #433gpt-5-4-nano-non-reasoningOpenAI | 55.76% | aa_slug=gpt-5-4-nano-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #434deepseek-v3DeepSeek | 55.66% | aa_slug=deepseek-v3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #435QwQ-32B-PreviewAlibaba Group | 55.66% | aa_slug=QwQ-32B-Preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #436nvidia-nemotron-nano-9b-v2NVIDIA | 55.66% | aa_slug=nvidia-nemotron-nano-9b-v2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #437nova-2-0-omniAmazon Web Services | 55.45% | aa_slug=nova-2-0-omni · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #438gemma-4-e4b-non-reasoningGoogle | 54.95% | aa_slug=gemma-4-e4b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #439solar-pro-2-previewUpstage | 54.44% | aa_slug=solar-pro-2-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #440gpt-4oOpenAI | 54.34% | aa_slug=gpt-4o · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #441gemini-2-0-flash-lite-previewGoogle | 54.24% | aa_slug=gemini-2-0-flash-lite-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #442k2-v2-lowMBZUAI Institute of Foundation Models | 54.14% | aa_slug=k2-v2-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #443olmo-3-1-32b-instructAllen Institute for AI | 53.94% | aa_slug=olmo-3-1-32b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #444tri-21b-think-previewTrillion Labs | 53.84% | aa_slug=tri-21b-think-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #445hermes-4-llama-3-1-405bNous Research | 53.64% | aa_slug=hermes-4-llama-3-1-405b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #446gemini-2-0-flash-lite-001Google | 53.54% | aa_slug=gemini-2-0-flash-lite-001 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #447qwen3-32b-instructAlibaba Group | 53.54% | aa_slug=qwen3-32b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #448Devstral Small 2Mistral AI | 53.23% | aa_slug=devstral-small-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #449Reka Flash 3rekaai | 52.93% | aa_slug=reka-flash-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #450Command ACohere | 52.73% | aa_slug=command-a · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #451GPT-4o (2024-05-13)OpenAI | 52.63% | aa_slug=gpt-4o-2024-05-13 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #452Qwen3-4BQwen | 52.22% | aa_slug=qwen3-4b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #453GPT-4o (2024-08-06)OpenAI | 52.12% | aa_slug=gpt-4o-2024-08-06 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #454qwen3-4b-2507-instructAlibaba Group | 51.72% | aa_slug=qwen3-4b-2507-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #455llama-3-3-nemotron-super-49bNVIDIA | 51.72% | aa_slug=llama-3-3-nemotron-super-49b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #456Qwen3 Coder 30B A3B InstructQwen | 51.62% | aa_slug=qwen3-coder-30b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #457tulu3-405bAllen Institute for AI | 51.62% | aa_slug=tulu3-405b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #458Olmo-3-7B-ThinkAllen Institute for AI | 51.62% | aa_slug=olmo-3-7b-think · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #459qwen3-30b-a3b-instructAlibaba Group | 51.52% | aa_slug=qwen3-30b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #460Llama-3.1-405BMeta AI | 51.52% | aa_slug=llama-3-1-instruct-405b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #461exaone-4-0-1-2b-reasoningLG AI Research | 51.52% | aa_slug=exaone-4-0-1-2b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #462nvidia-nemotron-3-nano-4bNVIDIA | 51.31% | aa_slug=nvidia-nemotron-3-nano-4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #463LFM2.5-8B-A1BLiquid AI | 51.31% | aa_slug=lfm2-5-8b-a1b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #464gpt-4.1-nanoOpenAI | 51.21% | aa_slug=gpt-4-1-nano · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #465gpt-4o-chatgptOpenAI | 51.11% | aa_slug=gpt-4o-chatgpt · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #466grok-2xAI | 51.01% | aa_slug=grok-2-1212 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #467Mistral Small 3.2Mistral AI | 50.51% | aa_slug=mistral-small-3-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #468Pixtral LargeMistral AI | 50.51% | aa_slug=pixtral-large-2411 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #469nova-proAmazon Web Services | 49.9% | aa_slug=nova-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #470Llama 3.3 70BMeta AI | 49.8% | aa_slug=llama-3-3-instruct-70b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #471qwen3-vl-4b-reasoningAlibaba Group | 49.39% | aa_slug=qwen3-vl-4b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #472devstral-mediumMistral AI | 49.19% | aa_slug=devstral-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #473qwen2-5-72b-instructAlibaba Group | 49.09% | aa_slug=qwen2-5-72b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #474hermes-4-llama-3-1-70bNous Research | 49.09% | aa_slug=hermes-4-llama-3-1-70b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #475claude-3-opusAnthropic | 48.89% | aa_slug=claude-3-opus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #476mistral-large-2Mistral AI | 48.59% | aa_slug=mistral-large-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #477deepseek-r1-distill-qwen-14bDeepSeek | 48.38% | aa_slug=deepseek-r1-distill-qwen-14b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #478granite-4.1-30bIBM | 48.08% | aa_slug=granite-4-1-30b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #479llama-nemotron-super-49b-v1-5NVIDIA | 48.08% | aa_slug=llama-nemotron-super-49b-v1-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #480gemini-2-5-flash-liteGoogle | 47.37% | aa_slug=gemini-2-5-flash-lite · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #481lfm2-24b-a2bLiquid AI | 47.37% | aa_slug=lfm2-24b-a2b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #482Mistral Large 2.0Mistral AI | 47.17% | aa_slug=mistral-large-2407 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #483grok-betaSpaceXAI | 47.07% | aa_slug=grok-beta · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #484Ministral 3 8BMistral AI | 47.07% | aa_slug=ministral-3-8b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #485SonarPerplexity AI | 47.07% | aa_slug=sonar · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #486qwen3-14b-instructAlibaba Group | 46.97% | aa_slug=qwen3-14b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #487nemotron-3-nano-omni-30b-a3bNVIDIA | 46.87% | aa_slug=nemotron-3-nano-omni-30b-a3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #488qwen2.5-32b-instructAlibaba Group | 46.57% | aa_slug=qwen2.5-32b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #489llama-3-1-nemotron-instruct-70bNVIDIA | 46.46% | aa_slug=llama-3-1-nemotron-instruct-70b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #490gemini-1-5-flashGoogle | 46.26% | aa_slug=gemini-1-5-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #491Mistral Small 3Mistral AI | 46.16% | aa_slug=mistral-small-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #492Qwen3.5-2BQwen | 45.56% | aa_slug=qwen3-5-2b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #493Mistral Small 3.1Mistral AI | 45.35% | aa_slug=mistral-small-3-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #494qwen3-8b-instructAlibaba Group | 45.15% | aa_slug=qwen3-8b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #495glm-4-7-flash-non-reasoningZ.ai (Zhipu AI) | 45.15% | aa_slug=glm-4-7-flash-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #496nvidia-nemotron-nano-12b-v2-vlNVIDIA | 43.94% | aa_slug=nvidia-nemotron-nano-12b-v2-vl · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #497g9v3-3bAI9Stars | 43.84% | aa_slug=g9v3-3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #498qwen3-5-2b-non-reasoningAlibaba Group | 43.84% | aa_slug=qwen3-5-2b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #499Devstral Small 1.0Mistral AI | 43.43% | aa_slug=devstral-small-2505 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #500granite-4.1-8bIBM | 43.33% | aa_slug=granite-4-1-8b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
Definition
- Category
- reasoning
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Task
- graduate-level science questions
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Direction
- Higher is better
- Paper
- https://arxiv.org/abs/2311.12022
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- llama-2-chat-7b, grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, gemini-2.0-flash-exp, GPT-5.1-Codex Mini +606(614 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| reasoning | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Paperpaper1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://arxiv.org/abs/2311.12022 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| graduate-level science questions | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://github.com/idavidrein/gpqa | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 8 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.