Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · quasar-438b 2 rows

Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 69.29%aa_slug=quasar-438b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 1.01%aa_slug=quasar-438b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
601#601nova-2-0-lite-reasoning-lowAmazon Web Services3.79%aa_slug=nova-2-0-lite-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
602#602nova-2-0-omni-reasoning-lowAmazon Web Services3.79%aa_slug=nova-2-0-omni-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
603#603gpt-4.1-nanoOpenAI3.79%aa_slug=gpt-4-1-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
604#604qwen3-omni-30b-a3b-reasoningAlibaba Group3.79%aa_slug=qwen3-omni-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
605#605Qwen3 14BQwen3.79%aa_slug=qwen3-14b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
606#606nvidia-nemotron-3-nano-4bNVIDIA3.75%aa_slug=nvidia-nemotron-3-nano-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
607#607gpt-5-miniOpenAI3.75%aa_slug=gpt-5-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
608#608gpt-4.1-nanoOpenAI3.75%aa_slug=gpt-4-1-nano · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
609#609Llama 4 ScoutMeta AI3.75%aa_slug=llama-4-scout · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
610#610gpt-5-6-luna-xhighOpenAI3.54%aa_slug=gpt-5-6-luna-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
611#611granite-4.1-8bIBM3.37%aa_slug=granite-4-1-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
612#612midm-250-pro-rsnsftKorea Telecom3.03%aa_slug=midm-250-pro-rsnsft · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
613#613grok-4-6-lowSpaceXAI3.03%aa_slug=grok-4-6-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
614#614claude-sonnet-4-6-adaptiveAnthropic3.03%aa_slug=claude-sonnet-4-6-adaptive · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
615#615Llama-3.1-70BMeta AI3.03%aa_slug=llama-3-1-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
616#616solar-pro-2-reasoningUpstage3.03%aa_slug=solar-pro-2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
617#617agnes-2-5-pro-alphaSapiens AI3.03%aa_slug=agnes-2-5-pro-alpha · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
618#618glm-4-6vZ.ai (Zhipu AI)3.03%aa_slug=glm-4-6v · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
619#619Qwen3 32BQwen3.03%aa_slug=qwen3-32b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
620#620MiniMax-M1-80kMiniMax3.03%aa_slug=minimax-m1-80k · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
621#621gemma-4-E2BGoogle3.03%aa_slug=gemma-4-e2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
622#622deepseek-v4-flash-0420-highDeepSeek3.03%aa_slug=deepseek-v4-flash-0420-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
623#623Llama 3.3 70BMeta AI3.03%aa_slug=llama-3-3-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
624#624Qwen3.5-2BQwen3%aa_slug=qwen3-5-2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
625#625granite-4.1-30bIBM2.62%aa_slug=granite-4-1-30b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
626#626deepseek-v4-flash-0420DeepSeek2.53%aa_slug=deepseek-v4-flash-0420 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
627#627qwen3-8-27b-lowAlibaba Group2.53%aa_slug=qwen3-8-27b-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
628#628claude-sonnet-5-lowAnthropic2.53%aa_slug=claude-sonnet-5-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
629#629gpt-5-6-luna-highOpenAI2.53%aa_slug=gpt-5-6-luna-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
630#630mi-dm-k-2-5-pro-dec28Korea Telecom2.27%aa_slug=mi-dm-k-2-5-pro-dec28 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
631#631Claude Haiku 3.5Anthropic2.27%aa_slug=claude-3-5-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
632#632gemma-4-e2b-non-reasoningGoogle2.27%aa_slug=gemma-4-e2b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
633#633granite-4.1-3bIBM2.27%aa_slug=granite-4-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
634#634sarvam-30bSarvam2.27%aa_slug=sarvam-30b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
635#635granite-4.1-30bIBM2.27%aa_slug=granite-4-1-30b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
636#636qwen3-30b-a3b-instruct-reasoningAlibaba Group2.27%aa_slug=qwen3-30b-a3b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
637#637falcon-h1r-7bTII UAE2.27%aa_slug=falcon-h1r-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
638#638Qwen3 VL 8B InstructQwen2.27%aa_slug=qwen3-vl-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
639#639solar-open-100b-reasoningUpstage2.27%aa_slug=solar-open-100b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
640#640tri-21b-think-previewTrillion Labs2.27%aa_slug=tri-21b-think-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
641#641MiniMax-M1-40kMiniMax2.27%aa_slug=minimax-m1-40k · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
642#642llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA2.27%aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
643#643sarvam-m-reasoningSarvam2.27%aa_slug=sarvam-m-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
644#644gemma-3n-e4bGoogle2.27%aa_slug=gemma-3n-e4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
645#645qwen3-8b-instructAlibaba Group2.27%aa_slug=qwen3-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
646#646jamba-1-7-largeAI21 Labs2.27%aa_slug=jamba-1-7-large · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
647#647Qwen3 8BQwen2.27%aa_slug=qwen3-8b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
648#648granite-4-0-h-smallIBM2.27%aa_slug=granite-4-0-h-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
649#649gemini-2-5-flash-liteGoogle2.27%aa_slug=gemini-2-5-flash-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
650#650Qwen3 8BQwen2.25%aa_slug=qwen3-8b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
651#651gpt-5.4-miniOpenAI2.02%aa_slug=gpt-5-4-mini · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
652#652MiniMax M3MiniMax2.02%aa_slug=minimax-m3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
653#653GLM 5.1Z.ai (Zhipu AI)2.02%aa_slug=glm-5-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
654#654claude-sonnet-5-mediumAnthropic2.02%aa_slug=claude-sonnet-5-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
655#655gemma-4-E4BGoogle1.87%aa_slug=gemma-4-e4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
656#656Granite 4.0 MicroIBM1.52%aa_slug=granite-4-0-micro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
657#657gpt-5-6-terra-highOpenAI1.52%aa_slug=gpt-5-6-terra-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
658#658Qwen3.7 MaxQwen1.52%aa_slug=qwen3-7-max · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
659#659DeepSeek-R1-0528-Qwen3-8BDeepSeek1.52%aa_slug=deepseek-r1-qwen3-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
660#660R1 Distill Llama 70BDeepSeek1.52%aa_slug=deepseek-r1-distill-llama-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
661#661Llama 4 ScoutMeta AI1.52%aa_slug=llama-4-scout · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
662#662sarvam-105bSarvam1.52%aa_slug=sarvam-105b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
663#663nova-microAmazon Web Services1.52%aa_slug=nova-micro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
664#664exaone-4-0-32bLG AI Research1.52%aa_slug=exaone-4-0-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
665#665qwen3-4b-2507-instruct-reasoningAlibaba Group1.52%aa_slug=qwen3-4b-2507-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
666#666olmo-3-32b-thinkAllen Institute for AI1.52%aa_slug=olmo-3-32b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
667#667gpt-5-6-terra-lowOpenAI1.52%aa_slug=gpt-5-6-terra-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
668#668qwen3-omni-30b-a3b-instructAlibaba Group1.52%aa_slug=qwen3-omni-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
669#669NVIDIA-Nemotron-Nano-9B-v2NVIDIA1.52%aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
670#670qwen3-vl-4b-reasoningAlibaba Group1.52%aa_slug=qwen3-vl-4b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
671#671qwen3-30b-a3b-2507-reasoningAlibaba Group1.5%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
672#672Llama 3.1 8BMeta AI1.5%aa_slug=llama-3-1-instruct-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
673#673nanbeige4-1-3bNanbeige1.12%aa_slug=nanbeige4-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
674#674granite-4.1-3bIBM1.12%aa_slug=granite-4-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
675#675Qwen 3.7 PlusQwen1.01%aa_slug=qwen3-7-plus · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
676#676quasar-438bMultiverse Computing1.01%aa_slug=quasar-438b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
677#677gpt-5-6-terra-mediumOpenAI1.01%aa_slug=gpt-5-6-terra-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
678#678Inkling SmallThinking Machines1.01%aa_slug=inkling-small · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
679#679Kimi K2.7 CodeMoonshot AI1.01%aa_slug=kimi-k2-7-code · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
680#680gpt-5-6-sol-lowOpenAI1.01%aa_slug=gpt-5-6-sol-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
681#681Gemini 3.5 Flash-LiteGoogle1.01%aa_slug=gemini-3-5-flash-lite · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
682#682InklingThinking Machines1.01%aa_slug=inkling · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
683#683Gemma 3 4BGoogle0.76%aa_slug=gemma-3-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
684#684gemma-3n-e2bGoogle0.76%aa_slug=gemma-3n-e2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
685#685llama-3-instruct-70bMeta AI0.76%aa_slug=llama-3-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
686#686tri-21b-think-v0-5Trillion Labs0.76%aa_slug=tri-21b-think-v0-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
687#687Command ACohere0.76%aa_slug=command-a · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
688#688nova-liteAmazon Web Services0.76%aa_slug=nova-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
689#689ling-mini-2-0inclusionAI0.76%aa_slug=ling-mini-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
690#690Llama 3.1 8BMeta AI0.76%aa_slug=llama-3-1-instruct-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
691#691Claude 3 HaikuAnthropic0.76%aa_slug=claude-3-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
692#692Gemma 3 12BGoogle0.76%aa_slug=gemma-3-12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
693#693llama-3-2-instruct-11b-visionMeta AI0.76%aa_slug=llama-3-2-instruct-11b-vision · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
694#694jamba-reasoning-3bAI21 Labs0.76%aa_slug=jamba-reasoning-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
695#695Olmo-3-7B-ThinkAllen Institute for AI0.76%aa_slug=olmo-3-7b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
696#696nvidia-nemotron-nano-9b-v2NVIDIA0.76%aa_slug=nvidia-nemotron-nano-9b-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
697#697lfm2-2-6bLiquid AI0.76%aa_slug=lfm2-2-6b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
698#698gemma-3n-e4bGoogle0.75%aa_slug=gemma-3n-e4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
699#699Nemotron 3.5 LightningNVIDIA0.51%aa_slug=nemotron-3-5-lightning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
700#700command-a-plusCohere0.51%aa_slug=command-a-plus · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.