Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · Kimi K2.7 Code 3 rows

Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 44.7%aa_slug=kimi-k2-7-code · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 67.42%aa_slug=kimi-k2-7-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 1.01%aa_slug=kimi-k2-7-code · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
801#801Qwen3 235B A22B Instruct 2507Qwen0%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
802#802exaone-4-0-1-2bLG AI Research0%aa_slug=exaone-4-0-1-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
803#803DeepSeek V3 0324DeepSeek0%aa_slug=deepseek-v3-0324 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
804#804jamba-1-7-miniAI21 Labs0%aa_slug=jamba-1-7-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
805#805nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA0%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
806#806minicpm5-1bOpenBMB0%aa_slug=minicpm5-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
807#807olmo-2-7bAllen Institute for AI0%aa_slug=olmo-2-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
808#808Mercury 2Inception0%aa_slug=mercury-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
809#809Solar Pro 3Upstage0%aa_slug=solar-pro-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
810#810gpt-5-miniOpenAI0%aa_slug=gpt-5-mini · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
811#811minicpm-v4-6-1-3bOpenBMB0%aa_slug=minicpm-v4-6-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
812#812Qwen3.5-122B-A10BQwen0%aa_slug=qwen3-5-122b-a10b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
813#813minicpm-v4-6-1-3bOpenBMB0%aa_slug=minicpm-v4-6-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
814#814celeris-1Celeris0%aa_slug=celeris-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
815#815Ling 3.0 Flash VLinclusionAI0%aa_slug=ling-3-0-flash-vl · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
816#816Gemma 4 31BGoogle0%aa_slug=gemma-4-31b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
817#817deepseek-v3DeepSeek0%aa_slug=deepseek-v3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
818#818Mistral Small 3.2Mistral AI0%aa_slug=mistral-small-3-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
819#819Qwen3 14BQwen0%aa_slug=qwen3-14b-instruct-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
820#820LFM2.5-1.2B-InstructLiquid AI0%aa_slug=lfm2-5-1-2b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
821#821Devstral Small 2Mistral AI0%aa_slug=devstral-small-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.