Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · grok-4-6-xhigh 2 rows

Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 88.01%aa_slug=grok-4-6-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 17.17%aa_slug=grok-4-6-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
501#501Qwen3 VL 32B InstructQwen8.33%aa_slug=qwen3-vl-32b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
502#502k2-v2-mediumMBZUAI Institute of Foundation Models8.33%aa_slug=k2-v2-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
503#503qwen3-5-omni-flashAlibaba Group8.33%aa_slug=qwen3-5-omni-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
504#504gpt-4oOpenAI8.33%aa_slug=gpt-4o · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
505#505nemotron-3-nano-omni-30b-a3bNVIDIA8.33%aa_slug=nemotron-3-nano-omni-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
506#506Llama 4 MaverickMeta AI7.87%aa_slug=llama-4-maverick · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
507#507qwen3-vl-32b-reasoningAlibaba Group7.58%aa_slug=qwen3-vl-32b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
508#508Qwen3 Next 80B A3B InstructQwen7.58%aa_slug=qwen3-next-80b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
509#509Mistral Small 3.1Mistral AI7.58%aa_slug=mistral-small-3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
510#510gpt-4.1-miniOpenAI7.58%aa_slug=gpt-4-1-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
511#511ring-flash-2-0inclusionAI7.58%aa_slug=ring-flash-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
512#512Solar Pro 3Upstage7.58%aa_slug=solar-pro-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
513#513gemma-4-e4b-non-reasoningGoogle7.58%aa_slug=gemma-4-e4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
514#514gemini-2-5-flash-lite-preview-09-2025Google7.58%aa_slug=gemini-2-5-flash-lite-preview-09-2025 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
515#515Gemini 3.6 FlashGoogle7.07%aa_slug=gemini-3-6-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
516#516claude-sonnet-5-xhighAnthropic7.07%aa_slug=claude-sonnet-5-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
517#517agnes-3-0-flashSapiens AI7.07%aa_slug=agnes-3-0-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
518#518Muse Spark 1.2Meta AI7.07%aa_slug=muse-spark-1-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
519#519o3-miniOpenAI6.82%aa_slug=o3-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
520#520Seed-OSS-36B-InstructByteDance6.82%aa_slug=seed-oss-36b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
521#521nova-2-0-liteAmazon Web Services6.82%aa_slug=nova-2-0-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
522#522nvidia-nemotron-3-nano-4bNVIDIA6.82%aa_slug=nvidia-nemotron-3-nano-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
523#523Llama-3.1-405BMeta AI6.82%aa_slug=llama-3-1-instruct-405b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
524#524k2-think-v2MBZUAI Institute of Foundation Models6.82%aa_slug=k2-think-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
525#525glm-4-5vZ.ai (Zhipu AI)6.82%aa_slug=glm-4-5v · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
526#526nova-premierAmazon Web Services6.82%aa_slug=nova-premier · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
527#527Llama 4 MaverickMeta AI6.82%aa_slug=llama-4-maverick · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
528#528ring-1tinclusionAI6.82%aa_slug=ring-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
529#529qwen3-30b-a3b-instructAlibaba Group6.82%aa_slug=qwen3-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
530#530deepseek-v3DeepSeek6.82%aa_slug=deepseek-v3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
531#531Qwen3 VL 235B A22B InstructQwen6.82%aa_slug=qwen3-vl-235b-a22b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
532#532gpt-5-nano-minimalOpenAI6.82%aa_slug=gpt-5-nano-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
533#533nova-2-0-omniAmazon Web Services6.82%aa_slug=nova-2-0-omni · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
534#534k-exaone-non-reasoningLG AI Research6.82%aa_slug=k-exaone-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
535#535Mistral Small 3.2Mistral AI6.82%aa_slug=mistral-small-3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
536#536qwen3-next-80b-a3b-reasoningAlibaba Group6.74%aa_slug=qwen3-next-80b-a3b-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
537#537nemotron-3-nano-omni-30b-a3bNVIDIA6.74%aa_slug=nemotron-3-nano-omni-30b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
538#538nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA6.74%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
539#539Gemini 3.5 FlashGoogle6.57%aa_slug=gemini-3-5-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
540#540devstral-smallMistral AI6.06%aa_slug=devstral-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
541#541mistral-large-2Mistral AI6.06%aa_slug=mistral-large-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
542#542qwen3-235b-a22b-instruct-reasoningAlibaba Group6.06%aa_slug=qwen3-235b-a22b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
543#543qwen3-235b-a22b-instructAlibaba Group6.06%aa_slug=qwen3-235b-a22b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
544#544deepseek-r1-0120DeepSeek6.06%aa_slug=deepseek-r1-0120 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
545#545nova-proAmazon Web Services6.06%aa_slug=nova-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
546#546qwen3-30b-a3b-2507Alibaba Group6.06%aa_slug=qwen3-30b-a3b-2507 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
547#547o3 Mini HighOpenAI6.06%aa_slug=o3-mini-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
548#548Qwen3 VL 30B A3B InstructQwen6.06%aa_slug=qwen3-vl-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
549#549Devstral Small 1.0Mistral AI6.06%aa_slug=devstral-small-2505 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
550#550Muse Spark 1.1Meta AI6.06%aa_slug=muse-spark-1-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
551#551ernie-4-5-300b-a47bBaidu6.06%aa_slug=ernie-4-5-300b-a47b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
552#552g9v3-3bAI9Stars5.99%aa_slug=g9v3-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
553#553gpt-4o-miniOpenAI5.62%aa_slug=gpt-4o-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
554#554Mistral Small 3.2Mistral AI5.62%aa_slug=mistral-small-3-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
555#555Qwen3.8 27BQwen5.56%aa_slug=qwen3-8-27b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
556#556gpt-oss-120b-lowOpenAI5.3%aa_slug=gpt-oss-120b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
557#557qwen3-vl-30b-a3b-reasoningAlibaba Group5.3%aa_slug=qwen3-vl-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
558#558GLM 4.5VZ.ai (Zhipu AI)5.3%aa_slug=glm-4-5v-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
559#559qwen3-14b-instructAlibaba Group5.3%aa_slug=qwen3-14b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
560#560qwen3-30b-a3b-2507-reasoningAlibaba Group5.3%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
561#561llama-nemotron-super-49b-v1-5-reasoningNVIDIA5.3%aa_slug=llama-nemotron-super-49b-v1-5-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
562#562step-3-vl-10bStepFun5.3%aa_slug=step-3-vl-10b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
563#563Qwen3 32BQwen5.24%aa_slug=qwen3-32b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
564#564gpt-5-5-mediumOpenAI5.05%aa_slug=gpt-5-5-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
565#565claude-sonnet-5-highAnthropic5.05%aa_slug=claude-sonnet-5-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
566#566qwen3-8-27b-mediumAlibaba Group5.05%aa_slug=qwen3-8-27b-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
567#567Llama 3.3 70BMeta AI4.87%aa_slug=llama-3-3-instruct-70b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
568#568Qwen3 14BQwen4.87%aa_slug=qwen3-14b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
569#569qwen2-5-72b-instructAlibaba Group4.55%aa_slug=qwen2-5-72b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
570#570llama-3-1-nemotron-instruct-70bNVIDIA4.55%aa_slug=llama-3-1-nemotron-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
571#571Gemini 2.5 Flash-LiteGoogle4.55%aa_slug=gemini-2-5-flash-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
572#572Ministral 3 14BMistral AI4.55%aa_slug=ministral-3-14b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
573#573Magistral Small 1.2Mistral AI4.55%aa_slug=magistral-small-2509 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
574#574gpt-oss-20b-lowOpenAI4.55%aa_slug=gpt-oss-20b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
575#575magistral-smallMistral AI4.55%aa_slug=magistral-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
576#576Hermes-4-70BNous Research4.55%aa_slug=hermes-4-llama-3-1-70b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
577#577k2-v2-lowMBZUAI Institute of Foundation Models4.55%aa_slug=k2-v2-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
578#578qwen3-4b-2507-instructAlibaba Group4.55%aa_slug=qwen3-4b-2507-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
579#579LFM2.5-8B-A1BLiquid AI4.55%aa_slug=lfm2-5-8b-a1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
580#580Ministral 3 8BMistral AI4.55%aa_slug=ministral-3-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
581#581solar-pro-2Upstage4.55%aa_slug=solar-pro-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
582#582nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA4.55%aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
583#583nova-2-0-omni-reasoning-mediumAmazon Web Services4.55%aa_slug=nova-2-0-omni-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
584#584Gemma 3 27BGoogle4.49%aa_slug=gemma-3-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
585#585LFM2.5-2.6B (free)Liquid AI4.49%aa_slug=lfm2-5-2-6b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
586#586o3 Mini HighOpenAI4.49%aa_slug=o3-mini-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
587#587Magistral Small 1.2Mistral AI4.49%aa_slug=magistral-small-2509 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
588#588Ministral 3 8BMistral AI4.12%aa_slug=ministral-3-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
589#589Gemini 3.1 Pro PreviewGoogle4.04%aa_slug=gemini-3-1-pro-preview · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
590#590exaone-4-0-32b-reasoningLG AI Research3.79%aa_slug=exaone-4-0-32b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
591#591qwen3-vl-8b-reasoningAlibaba Group3.79%aa_slug=qwen3-vl-8b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
592#592Qwen3.5-2BQwen3.79%aa_slug=qwen3-5-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
593#593Gemini 2.0 FlashGoogle3.79%aa_slug=gemini-2-0-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
594#594Mistral Medium 3Mistral AI3.79%aa_slug=mistral-medium-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
595#595motif-2-12-7bMotif Technologies3.79%aa_slug=motif-2-12-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
596#596qwen3-5-2b-non-reasoningAlibaba Group3.79%aa_slug=qwen3-5-2b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
597#597Phi 4Microsoft3.79%aa_slug=phi-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
598#598glm-4-7-flash-non-reasoningZ.ai (Zhipu AI)3.79%aa_slug=glm-4-7-flash-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
599#599Gemma 3 27BGoogle3.79%aa_slug=gemma-3-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
600#600llama-nemotron-super-49b-v1-5NVIDIA3.79%aa_slug=llama-nemotron-super-49b-v1-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.