Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 432 filtered
Leader
Claude Fable 5.1 91.39%

Score history · ring-1t 1 row

Not enough history to chart — a single observation (6.82% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 6.82%aa_slug=ring-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 432 current results · config contains “hard”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
401#401qwen3-1.7b-instruct-reasoningAlibaba Group0%aa_slug=qwen3-1.7b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
402#402granite-4-0-350mIBM0%aa_slug=granite-4-0-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
403#403olmo-2-32bAllen Institute for AI0%aa_slug=olmo-2-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
404#404nvidia-nemotron-nano-12b-v2-vlNVIDIA0%aa_slug=nvidia-nemotron-nano-12b-v2-vl · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
405#405molmo-7b-dAllen Institute for AI0%aa_slug=molmo-7b-d · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
406#406Qwen3-0.6BQwen0%aa_slug=qwen3-0.6b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
407#407apertus-70b-instructSwiss AI Initiative0%aa_slug=apertus-70b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
408#408LFM2.5-1.2B-InstructLiquid AI0%aa_slug=lfm2-5-1-2b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
409#409jamba-1-7-miniAI21 Labs0%aa_slug=jamba-1-7-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
410#410minicpm-v4-6-1-3bOpenBMB0%aa_slug=minicpm-v4-6-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
411#411qwen3-5-0-8b-non-reasoningAlibaba Group0%aa_slug=qwen3-5-0-8b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
412#412Molmo2-8BAllen Institute for AI0%aa_slug=molmo2-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
413#413LFM2.5-VL-1.6BLiquid AI0%aa_slug=lfm2-5-vl-1-6b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
414#414olmo-3-1-32b-thinkAllen Institute for AI0%aa_slug=olmo-3-1-32b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
415#415llama-3-3-nemotron-super-49bNVIDIA0%aa_slug=llama-3-3-nemotron-super-49b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
416#416granite-3-3-8b-instructIBM0%aa_slug=granite-3-3-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
417#417qwen3-1.7b-instructAlibaba Group0%aa_slug=qwen3-1.7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
418#418gemma-3-1bGoogle0%aa_slug=gemma-3-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
419#419minicpm5-1b-non-reasoningOpenBMB0%aa_slug=minicpm5-1b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
420#420hermes-4-llama-3-1-70bNous Research0%aa_slug=hermes-4-llama-3-1-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
421#421exaone-4-0-1-2b-reasoningLG AI Research0%aa_slug=exaone-4-0-1-2b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
422#422granite-4-0-h-nano-1bIBM0%aa_slug=granite-4-0-h-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
423#423llama-3-3-nemotron-super-49b-reasoningNVIDIA0%aa_slug=llama-3-3-nemotron-super-49b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
424#424Reka Flash 3rekaai0%aa_slug=reka-flash-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
425#425phi-3-miniMicrosoft0%aa_slug=phi-3-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
426#426LFM2-1.2BLiquid AI0%aa_slug=lfm2-1-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
427#427qwen3-0.6b-instructAlibaba Group0%aa_slug=qwen3-0.6b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
428#428gemma-3-270mGoogle0%aa_slug=gemma-3-270m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
429#429Qwen3-VL-4B-InstructQwen0%aa_slug=qwen3-vl-4b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
430#430olmo-2-7bAllen Institute for AI0%aa_slug=olmo-2-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
431#431lfm2-24b-a2bLiquid AI0%aa_slug=lfm2-24b-a2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
432#432tiny-aya-globalCohere0%aa_slug=tiny-aya-global · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.