Skip to content
AI Atlas
BenchmarkActivecategory · reasoning

GPQA

github.com/idavidrein/gpqa

graduate-level science questions

quality57

Updated 8 h ago · first seen 11 Sept 2026

bench_01M293SPE8YX533DB8C6AE1Q1S

Metric
accuracy · %
Direction
Higher is better
Results
614
Leader
gpt-6-astra-xhigh 96.26%

Score history · MiniMax M2.5 1 row

Not enough history to chart — a single observation (84.85% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 84.85%aa_slug=minimax-m2-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 614 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
301#301ling-1tinclusionAI71.92%aa_slug=ling-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
302#302GLM 4.6VZ.ai (Zhipu AI)71.92%aa_slug=glm-4-6v-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
303#303deepseek-v4-pro-0424-non-reasoningDeepSeek71.72%aa_slug=deepseek-v4-pro-0424-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
304#304deepseek-v4-flash-0420-non-reasoningDeepSeek71.62%aa_slug=deepseek-v4-flash-0420-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
305#305gemma-4-26b-a4b-non-reasoningGoogle71.41%aa_slug=gemma-4-26b-a4b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
306#306k2-think-v2MBZUAI Institute of Foundation Models71.31%aa_slug=k2-think-v2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
307#307apriel-v1-5-15b-thinkerServiceNow71.31%aa_slug=apriel-v1-5-15b-thinker · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
308#308Qwen3 VL 235B A22B InstructQwen71.21%aa_slug=qwen3-vl-235b-a22b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
309#309gpt-5-2-non-reasoningOpenAI71.21%aa_slug=gpt-5-2-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
310#310qwen3-5-4b-non-reasoningAlibaba Group71.21%aa_slug=qwen3-5-4b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
311#311gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle70.91%aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
312#312deepseek-r1-0120DeepSeek70.81%aa_slug=deepseek-r1-0120 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
313#313qwen3-30b-a3b-2507-reasoningAlibaba Group70.71%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
314#314minicpm5-2bOpenBMB70.2%aa_slug=minicpm5-2b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
315#315gemini-2.0-flash-thinking-exp-01-21Google70.1%aa_slug=gemini-2-0-flash-thinking-exp-0121 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
316#316claude-4-opusAnthropic70.1%aa_slug=claude-4-opus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
317#317mi-dm-k-2-5-pro-dec28Korea Telecom70.1%aa_slug=mi-dm-k-2-5-pro-dec28 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
318#318qwen3-235b-a22b-instruct-reasoningAlibaba Group70%aa_slug=qwen3-235b-a22b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
319#319Hermes-4-70BNous Research69.9%aa_slug=hermes-4-llama-3-1-70b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
320#320nova-2-0-omni-reasoning-lowAmazon Web Services69.9%aa_slug=nova-2-0-omni-reasoning-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
321#321gemini-2-5-flash-reasoning-04-2025Google69.8%aa_slug=gemini-2-5-flash-reasoning-04-2025 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
322#322nova-2-0-lite-reasoning-lowAmazon Web Services69.8%aa_slug=nova-2-0-lite-reasoning-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
323#323MiniMax-M1-80kMiniMax69.7%aa_slug=minimax-m1-80k · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
324#324motif-2-12-7bMotif Technologies69.49%aa_slug=motif-2-12-7b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
325#325k-exaone-non-reasoningLG AI Research69.49%aa_slug=k-exaone-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
326#326Qwen3 VL 30B A3B InstructQwen69.49%aa_slug=qwen3-vl-30b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
327#327grok-3SpaceXAI69.29%aa_slug=grok-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
328#328step-3-vl-10bStepFun68.99%aa_slug=step-3-vl-10b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
329#329gpt-oss-20bOpenAI68.79%aa_slug=gpt-oss-20b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
330#330gpt-5-mini-minimalOpenAI68.69%aa_slug=gpt-5-mini-minimal · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
331#331solar-pro-2-reasoningUpstage68.69%aa_slug=solar-pro-2-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
332#332gpt-5-chatgptOpenAI68.59%aa_slug=gpt-5-chatgpt · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
333#333glm-5-2-non-reasoningZ.ai (Zhipu AI)68.59%aa_slug=glm-5-2-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
334#334GLM 4.5VZ.ai (Zhipu AI)68.38%aa_slug=glm-4-5v-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
335#335Gemini 2.5 FlashGoogle68.28%aa_slug=gemini-2-5-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
336#336Claude Sonnet 4Anthropic68.28%aa_slug=claude-4-sonnet · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
337#337MiniMax-M1-40kMiniMax68.18%aa_slug=minimax-m1-40k · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
338#338k2-v2MBZUAI Institute of Foundation Models68.08%aa_slug=k2-v2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
339#339Mistral Large 3Mistral AI67.98%aa_slug=mistral-large-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
340#340magistral-mediumMistral AI67.88%aa_slug=magistral-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
341#341gpt-5-nanoOpenAI67.58%aa_slug=gpt-5-nano · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
342#342jt-miniChina Mobile67.58%aa_slug=jt-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
343#343gpt-5-minimalOpenAI67.27%aa_slug=gpt-5-minimal · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
344#344gpt-oss-120b-lowOpenAI67.17%aa_slug=gpt-oss-120b-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
345#345claude-4-5-haiku-reasoningAnthropic67.17%aa_slug=claude-4-5-haiku-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
346#346Qwen3 VL 32B InstructQwen67.07%aa_slug=qwen3-vl-32b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
347#347Llama 4 MaverickMeta AI67.07%aa_slug=llama-4-maverick · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
348#348gpt-5-nano-mediumOpenAI66.97%aa_slug=gpt-5-nano-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
349#349diffusiongemma-26b-a4bGoogle66.87%aa_slug=diffusiongemma-26b-a4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
350#350Qwen3 32BQwen66.77%aa_slug=qwen3-32b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
351#351qwen3-4b-2507-instruct-reasoningAlibaba Group66.67%aa_slug=qwen3-4b-2507-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
352#352gpt-4.1OpenAI66.57%aa_slug=gpt-4-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
353#353glm-5-non-reasoningZ.ai (Zhipu AI)66.57%aa_slug=glm-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
354#354glm-4-7-non-reasoningZ.ai (Zhipu AI)66.36%aa_slug=glm-4-7-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
355#355gpt-4.1-miniOpenAI66.36%aa_slug=gpt-4-1-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
356#356Magistral Small 1.2Mistral AI66.26%aa_slug=magistral-small-2509 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
357#357falcon-h1r-7bTII UAE66.06%aa_slug=falcon-h1r-7b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
358#358gemma-4-12b-non-reasoningGoogle66.06%aa_slug=gemma-4-12b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
359#359qwen3-30b-a3b-2507Alibaba Group65.86%aa_slug=qwen3-30b-a3b-2507 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
360#360grok-4-3-non-reasoningSpaceXAI65.76%aa_slug=grok-4-3-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
361#361solar-open-100b-reasoningUpstage65.66%aa_slug=solar-open-100b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
362#362ling-flash-2-0inclusionAI65.66%aa_slug=ling-flash-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
363#363mimo-v2-flashXiaomi65.56%aa_slug=mimo-v2-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
364#364Claude 3.7 SonnetAnthropic65.56%aa_slug=claude-3-7-sonnet · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
365#365DeepSeek V3 0324DeepSeek65.45%aa_slug=deepseek-v3-0324 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
366#366gpt-4o-chatgpt-03-25OpenAI65.45%aa_slug=gpt-4o-chatgpt-03-25 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
367#367gemini-2-5-flash-lite-preview-09-2025Google65.05%aa_slug=gemini-2-5-flash-lite-preview-09-2025 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
368#368Claude Haiku 4.5Anthropic64.65%aa_slug=claude-4-5-haiku · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
369#369gpt-5-6-luna-non-reasoningOpenAI64.55%aa_slug=gpt-5-6-luna-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
370#370granite-4.2-30bIBM64.44%aa_slug=granite-4-2-30b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
371#371gpt-5-1-non-reasoningOpenAI64.34%aa_slug=gpt-5-1-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
372#372llama-3-3-nemotron-super-49b-reasoningNVIDIA64.34%aa_slug=llama-3-3-nemotron-super-49b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
373#373magistral-smallMistral AI64.14%aa_slug=magistral-small · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
374#374grok-4-1-fastSpaceXAI63.74%aa_slug=grok-4-1-fast · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
375#375longcat-flash-liteLongCat63.64%aa_slug=longcat-flash-lite · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
376#376nova-2-0-proAmazon Web Services63.64%aa_slug=nova-2-0-pro · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
377#377gemini-2.0-flash-expGoogle63.64%aa_slug=gemini-2-0-flash-experimental · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
378#378sarvam-30bSarvam63.33%aa_slug=sarvam-30b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
379#379GLM 4.6Z.ai (Zhipu AI)63.23%aa_slug=glm-4-6 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
380#380Granite 4.2 8BIBM63.13%aa_slug=granite-4-2-8b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
381#381celeris-1Celeris63.13%aa_slug=celeris-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
382#382exaone-4-0-32bLG AI Research62.83%aa_slug=exaone-4-0-32b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
383#383Gemini 2.5 Flash-LiteGoogle62.53%aa_slug=gemini-2-5-flash-lite-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
384#384sonar-reasoningPerplexity AI62.32%aa_slug=sonar-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
385#385Gemini 2.0 FlashGoogle62.32%aa_slug=gemini-2-0-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
386#386gemini-2-0-pro-experimental-02-05Google62.22%aa_slug=gemini-2-0-pro-experimental-02-05 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
387#387qwen3-omni-30b-a3b-instructAlibaba Group62.02%aa_slug=qwen3-omni-30b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
388#388qwen3-coder-480b-a35b-instructAlibaba Group61.82%aa_slug=qwen3-coder-480b-a35b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
389#389qwen3-30b-a3b-instruct-reasoningAlibaba Group61.62%aa_slug=qwen3-30b-a3b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
390#390hyperclova-x-seed-think-32bNaver61.52%aa_slug=hyperclova-x-seed-think-32b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
391#391DeepSeek-R1-Distill-Qwen-32BDeepSeek61.52%aa_slug=deepseek-r1-distill-qwen-32b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
392#392qwen3-235b-a22b-instructAlibaba Group61.31%aa_slug=qwen3-235b-a22b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
393#393DeepSeek-R1-0528-Qwen3-8BDeepSeek61.21%aa_slug=deepseek-r1-qwen3-8b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
394#394gpt-oss-20b-lowOpenAI61.11%aa_slug=gpt-oss-20b-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
395#395olmo-3-32b-thinkAllen Institute for AI61.01%aa_slug=olmo-3-32b-think · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
396#396grok-4-fastSpaceXAI60.61%aa_slug=grok-4-fast · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
397#397gpt-5-4-mini-non-reasoningOpenAI60.61%aa_slug=gpt-5-4-mini-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
398#398Qwen3 14BQwen60.4%aa_slug=qwen3-14b-instruct-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
399#399o1-miniOpenAI60.3%aa_slug=o1-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
400#400nova-2-0-liteAmazon Web Services60.3%aa_slug=nova-2-0-lite · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.