Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 8 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · gpt-6-astra-medium 2 rows

Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 89.51%aa_slug=gpt-6-astra-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 49.49%aa_slug=gpt-6-astra-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
401#401nova-2-0-lite-reasoning-mediumAmazon Web Services17.42%aa_slug=nova-2-0-lite-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
402#402Grok Build 0.1xAI17.42%aa_slug=grok-code-fast-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
403#403Mistral Small 4Mistral AI17.42%aa_slug=mistral-small-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
404#404gpt-5-nano-mediumOpenAI17.42%aa_slug=gpt-5-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
405#405nova-2-0-pro-reasoning-lowAmazon Web Services17.42%aa_slug=nova-2-0-pro-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
406#406grok-3-mini-reasoningSpaceXAI17.42%aa_slug=grok-3-mini-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
407#407qwen3-max-thinking-previewAlibaba Group17.42%aa_slug=qwen3-max-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
408#408nova-2-0-proAmazon Web Services17.23%aa_slug=nova-2-0-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
409#409grok-4-6-xhighSpaceXAI17.17%aa_slug=grok-4-6-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
410#410deepseek-v3DeepSeek16.85%aa_slug=deepseek-v3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
411#411nova-2-0-lite-reasoningAmazon Web Services16.67%aa_slug=nova-2-0-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
412#412cogito-v2-1-reasoningDeep Cogito16.67%aa_slug=cogito-v2-1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
413#413grok-4.20-0309-non-reasoningxAI16.67%aa_slug=grok-4-20-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
414#414gemini-2-5-flash-preview-09-2025-reasoningGoogle16.67%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
415#415muse-spark-1-3-xhighMeta AI16.67%aa_slug=muse-spark-1-3-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
416#416nova-2-0-proAmazon Web Services16.67%aa_slug=nova-2-0-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
417#417Devstral Small 2Mistral AI16.67%aa_slug=devstral-small-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
418#418nova-2-0-lite-reasoningAmazon Web Services16.1%aa_slug=nova-2-0-lite-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
419#419Kimi K2 0711Moonshot AI15.91%aa_slug=kimi-k2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
420#420deepseek-r1DeepSeek15.91%aa_slug=deepseek-r1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
421#421Mistral Large 3Mistral AI15.91%aa_slug=mistral-large-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
422#422DeepSeek V3 0324DeepSeek15.15%aa_slug=deepseek-v3-0324 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
423#423Qwen3 Coder 30B A3B InstructQwen15.15%aa_slug=qwen3-coder-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
424#424qwen3-235b-a22b-instruct-2507Alibaba Group15.15%aa_slug=qwen3-235b-a22b-instruct-2507 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
425#425o4-miniOpenAI15.15%aa_slug=o4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
426#426k2-think-v2MBZUAI Institute of Foundation Models14.98%aa_slug=k2-think-v2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
427#427gpt-5.5OpenAI14.65%aa_slug=gpt-5-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
428#428gpt-5-6-sol-mediumOpenAI14.65%aa_slug=gpt-5-6-sol-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
429#429deepseek-v4-pro-0424DeepSeek14.65%aa_slug=deepseek-v4-pro-0424 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
430#430grok-4-1-fastSpaceXAI14.39%aa_slug=grok-4-1-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
431#431gpt-5-mini-minimalOpenAI14.39%aa_slug=gpt-5-mini-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
432#432gemini-2-5-flash-preview-09-2025Google14.39%aa_slug=gemini-2-5-flash-preview-09-2025 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
433#433apriel-v1-6-15b-thinkerServiceNow14.39%aa_slug=apriel-v1-6-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
434#434GLM 4.6VZ.ai (Zhipu AI)14.39%aa_slug=glm-4-6v-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
435#435deepseek-v4-proDeepSeek14.14%aa_slug=deepseek-v4-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
436#436Claude Sonnet 5Anthropic14.14%aa_slug=claude-sonnet-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
437#437gpt-oss-120b-lowOpenAI13.86%aa_slug=gpt-oss-120b-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
438#438granite-4.2-3bIBM13.86%aa_slug=granite-4-2-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
439#439Mistral Medium 3.1Mistral AI13.86%aa_slug=mistral-medium-3-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
440#440DeepSeek V3 0324DeepSeek13.86%aa_slug=deepseek-v3-0324 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
441#441gpt-oss-20bOpenAI13.86%aa_slug=gpt-oss-20b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
442#442Gemma 4 26B A4BGoogle13.64%aa_slug=gemma-4-26b-a4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
443#443gpt-4.1OpenAI13.64%aa_slug=gpt-4-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
444#444gemini-2-5-flash-reasoningGoogle13.64%aa_slug=gemini-2-5-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
445#445nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA13.64%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
446#446Gemini 3.7 FlashGoogle13.64%aa_slug=gemini-3-7-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
447#447Qwen3 235B A22B Instruct 2507Qwen13.64%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
448#448grok-4-6-mediumSpaceXAI13.13%aa_slug=grok-4-6-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
449#449gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle12.88%aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
450#450gpt-5-chatgptOpenAI12.88%aa_slug=gpt-5-chatgpt · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
451#451Magistral Medium 1.2Mistral AI12.88%aa_slug=magistral-medium-2509 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
452#452o1OpenAI12.88%aa_slug=o1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
453#453gpt-5-5-instant-06-26OpenAI12.63%aa_slug=gpt-5-5-instant-06-26 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
454#454Kimi K3Moonshot AI12.63%aa_slug=kimi-k3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
455#455Magistral Medium 1.2Mistral AI12.36%aa_slug=magistral-medium-2509 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
456#456diffusiongemma-26b-a4bGoogle12.36%aa_slug=diffusiongemma-26b-a4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
457#457Gemini 2.5 FlashGoogle12.12%aa_slug=gemini-2-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
458#458gpt-5-nanoOpenAI12.12%aa_slug=gpt-5-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
459#459Nemotron 3 Nano 30B A3BNVIDIA12.12%aa_slug=nvidia-nemotron-3-nano-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
460#460deepseek-v4-flash-visionDeepSeek12.12%aa_slug=deepseek-v4-flash-vision · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
461#461deepseek-v4-flashDeepSeek12.12%aa_slug=deepseek-v4-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
462#462grok-4-fastSpaceXAI12.12%aa_slug=grok-4-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
463#463hyperclova-x-seed-think-32bNaver12.12%aa_slug=hyperclova-x-seed-think-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
464#464Qwen3 235B A22B Instruct 2507Qwen11.99%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
465#465Mistral Large 3Mistral AI11.99%aa_slug=mistral-large-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
466#466Solar Pro 3Upstage11.99%aa_slug=solar-pro-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
467#467gpt-5.6-lunaOpenAI11.62%aa_slug=gpt-5-6-luna · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
468#468gemma-4-12b-non-reasoningGoogle11.36%aa_slug=gemma-4-12b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
469#469Hermes 4 405BNous Research11.36%aa_slug=hermes-4-llama-3-1-405b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
470#470grok-3SpaceXAI11.36%aa_slug=grok-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
471#471qwen3-vl-235b-a22b-reasoningAlibaba Group11.36%aa_slug=qwen3-vl-235b-a22b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
472#472qwen3-5-4b-non-reasoningAlibaba Group11.36%aa_slug=qwen3-5-4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
473#473Kimi-Linear-48B-A3B-InstructMoonshot AI11.36%aa_slug=kimi-linear-48b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
474#474celeris-1Celeris11.24%aa_slug=celeris-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
475#475Qwen3.8 2.4T A95BQwen11.11%aa_slug=qwen3-8-2-4t-a95b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
476#476ling-flash-2-0inclusionAI10.61%aa_slug=ling-flash-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
477#477Mistral Medium 3.1Mistral AI10.61%aa_slug=mistral-medium-3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
478#478Grok 4.5xAI10.61%aa_slug=grok-4-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
479#479qwen3-5-35b-a3b-non-reasoningAlibaba Group10.61%aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
480#480gpt-oss-20bOpenAI10.61%aa_slug=gpt-oss-20b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
481#481ling-1tinclusionAI10.61%aa_slug=ling-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
482#482mistral-small-4-non-reasoningMistral AI10.61%aa_slug=mistral-small-4-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
483#483longcat-flash-liteLongCat10.61%aa_slug=longcat-flash-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
484#484apriel-v1-5-15b-thinkerServiceNow10.61%aa_slug=apriel-v1-5-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
485#485Claude Haiku 3.5Anthropic10.11%aa_slug=claude-3-5-haiku · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
486#486gpt-4.1-miniOpenAI10.11%aa_slug=gpt-4-1-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
487#487gemini-3-8-flash-lowGoogle10.1%aa_slug=gemini-3-8-flash-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
488#488gpt-5-6-terra-xhighOpenAI10.1%aa_slug=gpt-5-6-terra-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
489#489hermes-4-llama-3-1-405bNous Research9.85%aa_slug=hermes-4-llama-3-1-405b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
490#490k2-v2MBZUAI Institute of Foundation Models9.85%aa_slug=k2-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
491#491qwen3-next-80b-a3b-reasoningAlibaba Group9.85%aa_slug=qwen3-next-80b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
492#492Ministral 3 14BMistral AI9.74%aa_slug=ministral-3-14b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
493#493kat-coder-pro-v1KwaiKAT9.09%aa_slug=kat-coder-pro-v1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
494#494intellect-3Prime Intellect9.09%aa_slug=intellect-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
495#495gpt-5-5-highOpenAI9.09%aa_slug=gpt-5-5-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
496#496devstral-mediumMistral AI9.09%aa_slug=devstral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
497#497magistral-mediumMistral AI9.09%aa_slug=magistral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
498#498minicpm5-2bOpenBMB8.61%aa_slug=minicpm5-2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
499#499gemma-4-E4BGoogle8.33%aa_slug=gemma-4-e4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
500#500GPT-4o (2024-08-06)OpenAI8.33%aa_slug=gpt-4o-2024-08-06 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.