Skip to content
AI Atlas
BenchmarkActivecategory · reasoning

GPQA

github.com/idavidrein/gpqa

graduate-level science questions

quality57

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPE8YX533DB8C6AE1Q1S

Metric
accuracy · %
Direction
Higher is better
Results
614
Leader
gpt-6-astra-xhigh 96.26%

Score history · claude-fable-5-1-medium 1 row

Not enough history to chart — a single observation (88.59% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 88.59%aa_slug=claude-fable-5-1-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 614 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201g9v3-39a5bAI9Stars80.51%aa_slug=g9v3-39a5b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202gpt-5-mini-mediumOpenAI80.3%aa_slug=gpt-5-mini-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203claude-sonnet-5-non-reasoningAnthropic80%aa_slug=claude-sonnet-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204Nemotron 3 SuperNVIDIA80%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205Claude Sonnet 4.6Anthropic79.9%aa_slug=claude-sonnet-4-6 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206claude-sonnet-4-6-non-reasoning-low-effortAnthropic79.7%aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207DeepSeek V3.2 ExpDeepSeek79.7%aa_slug=deepseek-v3-2-reasoning-0925 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208Claude Opus 4Anthropic79.6%aa_slug=claude-4-opus-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209exaone-4-5-33bLG AI Research79.39%aa_slug=exaone-4-5-33b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210gemini-2-5-flash-preview-09-2025-reasoningGoogle79.29%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211deepseek-v3-1-terminus-reasoningDeepSeek79.19%aa_slug=deepseek-v3-1-terminus-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212Gemma 4 26B A4BGoogle79.19%aa_slug=gemma-4-26b-a4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213grok-3-mini-reasoningSpaceXAI79.09%aa_slug=grok-3-mini-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214Qwen3 235B A22B Instruct 2507Qwen78.99%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215gpt-5-6-sol-non-reasoningOpenAI78.99%aa_slug=gpt-5-6-sol-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216gemini-2-5-flash-reasoningGoogle78.99%aa_slug=gemini-2-5-flash-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217kimi-k2-5-non-reasoningMoonshot AI78.89%aa_slug=kimi-k2-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218kimi-k2-6-non-reasoningMoonshot AI78.79%aa_slug=kimi-k2-6-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219qwen3-5-9b-non-reasoningAlibaba Group78.59%aa_slug=qwen3-5-9b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220nova-2-0-pro-reasoning-mediumAmazon Web Services78.48%aa_slug=nova-2-0-pro-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221grok-4-20-0309-non-reasoningSpaceXAI78.48%aa_slug=grok-4-20-0309-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222o4-miniOpenAI78.38%aa_slug=o4-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223k-exaoneLG AI Research78.28%aa_slug=k-exaone · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224GLM 4.5Z.ai (Zhipu AI)78.18%aa_slug=glm-4.5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225gpt-oss-120bOpenAI78.18%aa_slug=gpt-oss-120b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226glm-4-6-reasoningZ.ai (Zhipu AI)77.98%aa_slug=glm-4-6-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227LongCat 2.0Meituan77.98%aa_slug=longcat-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228deepseek-v3-1-reasoningDeepSeek77.88%aa_slug=deepseek-v3-1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229ernie-5-0-thinking-previewBaidu77.68%aa_slug=ernie-5-0-thinking-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230claude-4-sonnet-thinkingAnthropic77.68%aa_slug=claude-4-sonnet-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231MiniMax M2MiniMax77.68%aa_slug=minimax-m2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232qwen3-max-thinking-previewAlibaba Group77.58%aa_slug=qwen3-max-thinking-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233grok-4.20-0309-non-reasoningxAI77.58%aa_slug=grok-4-20-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234ring-1tinclusionAI77.37%aa_slug=ring-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235o3 Mini HighOpenAI77.27%aa_slug=o3-mini-high · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236claude-3-7-sonnet-thinkingAnthropic77.17%aa_slug=claude-3-7-sonnet-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237qwen3-vl-235b-a22b-reasoningAlibaba Group77.17%aa_slug=qwen3-vl-235b-a22b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238Qwen3.5-4BQwen77.07%aa_slug=qwen3-5-4b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
239#239Mercury 2Inception76.97%aa_slug=mercury-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
240#240Mistral Small 4Mistral AI76.87%aa_slug=mistral-small-4 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
241#241gpt-5-5-non-reasoningOpenAI76.77%aa_slug=gpt-5-5-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
242#242cogito-v2-1-reasoningDeep Cogito76.77%aa_slug=cogito-v2-1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
243#243nova-2-0-lite-reasoning-mediumAmazon Web Services76.77%aa_slug=nova-2-0-lite-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
244#244Kimi K2 0905Moonshot AI76.67%aa_slug=kimi-k2-0905 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
245#245Kimi K2 0711Moonshot AI76.57%aa_slug=kimi-k2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
246#246gemini-2-5-flash-preview-09-2025Google76.57%aa_slug=gemini-2-5-flash-preview-09-2025 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
247#247o1 PreviewOpenAI76.46%aa_slug=o1-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
248#248kat-coder-pro-v1KwaiKAT76.36%aa_slug=kat-coder-pro-v1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
249#249doubao-seed-codeByteDance76.36%aa_slug=doubao-seed-code · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
250#250qwen3-max-previewAlibaba Group76.36%aa_slug=qwen3-max-preview · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
251#251Qwen3 MaxQwen76.36%aa_slug=qwen3-max · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
252#252gemma-4-31b-non-reasoningGoogle76.26%aa_slug=gemma-4-31b-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
253#253mimo-v2-5-pro-non-reasoningXiaomi76.16%aa_slug=mimo-v2-5-pro-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
254#254command-a-plusCohere76.06%aa_slug=command-a-plus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
255#255intellect-3Prime Intellect76.06%aa_slug=intellect-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
256#256gpt-5-4-nano-mediumOpenAI76.06%aa_slug=gpt-5-4-nano-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
257#257nova-2-0-omni-reasoning-mediumAmazon Web Services75.96%aa_slug=nova-2-0-omni-reasoning-medium · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
258#258qwen3-next-80b-a3b-reasoningAlibaba Group75.86%aa_slug=qwen3-next-80b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
259#259nemotron-cascade-2-30b-a3bNVIDIA75.76%aa_slug=nemotron-cascade-2-30b-a3b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
260#260nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA75.66%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
261#261North Mini Code (free)Cohere75.66%aa_slug=north-mini-code · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
262#262qwen3-235b-a22b-instruct-2507Alibaba Group75.25%aa_slug=qwen3-235b-a22b-instruct-2507 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
263#263gemma-4-12BGoogle75.25%aa_slug=gemma-4-12b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
264#264ling-2-6-1tinclusionAI75.15%aa_slug=ling-2-6-1t · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
265#265Trinity Large ThinkingArcee AI75.15%aa_slug=trinity-large-thinking · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
266#266DeepSeek V3.1 TerminusDeepSeek75.05%aa_slug=deepseek-v3-1-terminus · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
267#267nova-2-0-pro-reasoning-lowAmazon Web Services75.05%aa_slug=nova-2-0-pro-reasoning-low · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
268#268DeepSeek V3DeepSeek75.05%aa_slug=deepseek-v3-2 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
269#269llama-nemotron-super-49b-v1-5-reasoningNVIDIA74.85%aa_slug=llama-nemotron-super-49b-v1-5-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
270#270o3-miniOpenAI74.85%aa_slug=o3-mini · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
271#271gpt-5-4-non-reasoningOpenAI74.85%aa_slug=gpt-5-4-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
272#272Mistral Medium 3.5Mistral AI74.85%aa_slug=mistral-medium-3-5 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
273#273o1OpenAI74.75%aa_slug=o1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
274#274gpt-5-6-terra-non-reasoningOpenAI74.65%aa_slug=gpt-5-6-terra-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
275#275Nemotron 3.5 LightningNVIDIA74.34%aa_slug=nemotron-3-5-lightning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
276#276qwen3-5-omni-flashAlibaba Group74.24%aa_slug=qwen3-5-omni-flash · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
277#277exaone-4-0-32b-reasoningLG AI Research73.94%aa_slug=exaone-4-0-32b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
278#278Magistral Medium 1.2Mistral AI73.94%aa_slug=magistral-medium-2509 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
279#279Qwen3 Next 80B A3B InstructQwen73.84%aa_slug=qwen3-next-80b-a3b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
280#280sarvam-105bSarvam73.84%aa_slug=sarvam-105b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
281#281deepseek-v3-2-0925DeepSeek73.84%aa_slug=deepseek-v3-2-0925 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
282#282Qwen3 Coder NextQwen73.74%aa_slug=qwen3-coder-next · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
283#283DeepSeek V3.1DeepSeek73.54%aa_slug=deepseek-v3-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
284#284ling-3-0-tinyinclusionAI73.43%aa_slug=ling-3-0-tiny · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
285#285GLM 4.5 AirZ.ai (Zhipu AI)73.33%aa_slug=glm-4-5-air · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
286#286apriel-v1-6-15b-thinkerServiceNow73.33%aa_slug=apriel-v1-6-15b-thinker · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
287#287qwen3-vl-32b-reasoningAlibaba Group73.33%aa_slug=qwen3-vl-32b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
288#288hypernova-60bMultiverse Computing73.33%aa_slug=hypernova-60b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
289#289quasar-438bMultiverse Computing73.23%aa_slug=quasar-438b · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
290#290hy3-non-reasoningTencent73.23%aa_slug=hy3-non-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
291#291llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA72.83%aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
292#292Claude Sonnet 4.5Anthropic72.73%aa_slug=claude-4-5-sonnet · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
293#293Grok Build 0.1xAI72.73%aa_slug=grok-code-fast-1 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
294#294Hermes 4 405BNous Research72.73%aa_slug=hermes-4-llama-3-1-405b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
295#295Seed-OSS-36B-InstructByteDance72.63%aa_slug=seed-oss-36b-instruct · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
296#296qwen3-omni-30b-a3b-reasoningAlibaba Group72.63%aa_slug=qwen3-omni-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
297#297ring-flash-2-0inclusionAI72.53%aa_slug=ring-flash-2-0 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
298#298Solar Pro 3Upstage72.42%aa_slug=solar-pro-3 · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
299#299midm-250-pro-rsnsftKorea Telecom72.22%aa_slug=midm-250-pro-rsnsft · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
300#300qwen3-vl-30b-a3b-reasoningAlibaba Group72.02%aa_slug=qwen3-vl-30b-a3b-reasoning · variant=GPQA Diamond · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.