Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 238 filtered
Leader
Claude Fable 5.1 91.39%

Score history · Gemini 3.5 Flash 3 rows

Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 40.91%aa_slug=gemini-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 78.65%aa_slug=gemini-3-5-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 6.57%aa_slug=gemini-3-5-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 238 current results · config contains “v2.1”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201Llama 4 MaverickMeta AI7.87%aa_slug=llama-4-maverick · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA6.74%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203qwen3-next-80b-a3b-reasoningAlibaba Group6.74%aa_slug=qwen3-next-80b-a3b-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204nemotron-3-nano-omni-30b-a3bNVIDIA6.74%aa_slug=nemotron-3-nano-omni-30b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205g9v3-3bAI9Stars5.99%aa_slug=g9v3-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206gpt-4o-miniOpenAI5.62%aa_slug=gpt-4o-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207Mistral Small 3.2Mistral AI5.62%aa_slug=mistral-small-3-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208Qwen3 32BQwen5.24%aa_slug=qwen3-32b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209Qwen3 14BQwen4.87%aa_slug=qwen3-14b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210Llama 3.3 70BMeta AI4.87%aa_slug=llama-3-3-instruct-70b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211LFM2.5-2.6B (free)Liquid AI4.49%aa_slug=lfm2-5-2-6b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212o3 Mini HighOpenAI4.49%aa_slug=o3-mini-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213Gemma 3 27BGoogle4.49%aa_slug=gemma-3-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214Magistral Small 1.2Mistral AI4.49%aa_slug=magistral-small-2509 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215Ministral 3 8BMistral AI4.12%aa_slug=ministral-3-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216gpt-5-miniOpenAI3.75%aa_slug=gpt-5-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217Llama 4 ScoutMeta AI3.75%aa_slug=llama-4-scout · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218gpt-4.1-nanoOpenAI3.75%aa_slug=gpt-4-1-nano · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219nvidia-nemotron-3-nano-4bNVIDIA3.75%aa_slug=nvidia-nemotron-3-nano-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220granite-4.1-8bIBM3.37%aa_slug=granite-4-1-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221Qwen3.5-2BQwen3%aa_slug=qwen3-5-2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222granite-4.1-30bIBM2.62%aa_slug=granite-4-1-30b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223Qwen3 8BQwen2.25%aa_slug=qwen3-8b-instruct-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224gemma-4-E4BGoogle1.87%aa_slug=gemma-4-e4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225Llama 3.1 8BMeta AI1.5%aa_slug=llama-3-1-instruct-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226qwen3-30b-a3b-2507-reasoningAlibaba Group1.5%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227granite-4.1-3bIBM1.12%aa_slug=granite-4-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228nanbeige4-1-3bNanbeige1.12%aa_slug=nanbeige4-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229gemma-3n-e4bGoogle0.75%aa_slug=gemma-3n-e4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230gemma-4-E2BGoogle0.37%aa_slug=gemma-4-e2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231Gemma 3 4BGoogle0.37%aa_slug=gemma-3-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232phi-4-miniMicrosoft0.37%aa_slug=phi-4-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233qwen3-5-0-8b-non-reasoningAlibaba Group0.37%aa_slug=qwen3-5-0-8b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234qwen3-5-2b-non-reasoningAlibaba Group0%aa_slug=qwen3-5-2b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235Qwen3.5-0.8BQwen0%aa_slug=qwen3-5-0-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236minicpm-v4-6-1-3bOpenBMB0%aa_slug=minicpm-v4-6-1-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237Gemma 3 12BGoogle0%aa_slug=gemma-3-12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238Ministral 3 3BMistral AI0%aa_slug=ministral-3-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.