Skip to content
AI Atlas
BenchmarkActivecategory · reasoning

GPQA

github.com/idavidrein/gpqa

graduate-level science questions

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPE8YX533DB8C6AE1Q1S

Metric
accuracy · %
Direction
Higher is better
Results
614
Leader
gpt-6-astra-xhigh 96.26%

Score history · GPT-5-Codex 1 row

Not enough history to chart — a single observation (83.74% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 83.74%aa_slug=gpt-5-codex · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 614 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
601#601Qwen3-0.6BQwen23.94%aa_slug=qwen3-0.6b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
602#602gemma-3-1bGoogle23.74%aa_slug=gemma-3-1b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
603#603qwen3-5-0-8b-non-reasoningAlibaba Group23.64%aa_slug=qwen3-5-0-8b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
604#604qwen3-0.6b-instructAlibaba Group23.13%aa_slug=qwen3-0.6b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
605#605openchat-35OpenChat23.03%aa_slug=openchat-35 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
606#606gemma-3n-e2bGoogle22.93%aa_slug=gemma-3n-e2b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
607#607LFM2-1.2BLiquid AI22.83%aa_slug=lfm2-1-2b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
608#608llama-2-chat-7bMeta AI22.73%aa_slug=llama-2-chat-7b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
609#609gemma-3-270mGoogle22.42%aa_slug=gemma-3-270m · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
610#610llama-3-2-instruct-11b-visionMeta AI22.12%aa_slug=llama-3-2-instruct-11b-vision · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
611#611Llama-3.2-1BMeta AI19.6%aa_slug=llama-3-2-instruct-1b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
612#612Mistral 7BMistral AI17.68%aa_slug=mistral-7b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
613#613Qwen3.5-0.8BQwen11.11%aa_slug=qwen3-5-0-8b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
614#614DeepSeek-R1-Distill-Qwen-1.5BDeepSeek9.8%aa_slug=deepseek-r1-distill-qwen-1-5b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.