Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 3 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 432 filtered
Leader
Claude Fable 5.1 91.39%

Leaderboard 432 current results · config contains “hard”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
1#1gpt-5-6-solOpenAI65.91%aa_slug=gpt-5-6-sol · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
2#2gpt-5-6-sol-mediumOpenAI62.88%aa_slug=gpt-5-6-sol-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
3#3gpt-5-6-terra-xhighOpenAI62.88%aa_slug=gpt-5-6-terra-xhigh · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
4#4Claude Fable 5Anthropic62.88%aa_slug=claude-fable-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
5#5gpt-5-6-sol-highOpenAI62.12%aa_slug=gpt-5-6-sol-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
6#6gpt-5-6-sol-xhighOpenAI61.36%aa_slug=gpt-5-6-sol-xhigh · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
7#7gpt-5.5OpenAI60.61%aa_slug=gpt-5-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
8#8gpt-5-6-sol-lowOpenAI60.61%aa_slug=gpt-5-6-sol-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
9#9gpt-5-5-highOpenAI59.85%aa_slug=gpt-5-5-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
10#10Claude Opus 4.8Anthropic58.33%aa_slug=claude-opus-4-8 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
11#11gpt-5-6-terra-highOpenAI57.58%aa_slug=gpt-5-6-terra-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
12#12gpt-5.4OpenAI57.58%aa_slug=gpt-5-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
13#13gpt-5-5-mediumOpenAI57.58%aa_slug=gpt-5-5-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
14#14gpt-5.6-terraOpenAI57.58%aa_slug=gpt-5-6-terra · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
15#15claude-opus-4-7-non-reasoningAnthropic54.55%aa_slug=claude-opus-4-7-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
16#16Gemini 3.1 Pro PreviewGoogle53.79%aa_slug=gemini-3-1-pro-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
17#17claude-sonnet-4-6-adaptiveAnthropic53.03%aa_slug=claude-sonnet-4-6-adaptive · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
18#18gpt-5.3-codexOpenAI53.03%aa_slug=gpt-5-3-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
19#19gpt-5-5-lowOpenAI52.27%aa_slug=gpt-5-5-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
20#20gpt-5.4-miniOpenAI52.27%aa_slug=gpt-5-4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
21#21Claude Opus 4.7Anthropic51.52%aa_slug=claude-opus-4-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
22#22Z.ai GLM 5.2Z.ai (Zhipu AI)50.76%aa_slug=glm-5-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
23#23Qwen3.7 MaxQwen50.76%aa_slug=qwen3-7-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
24#24KAT-Coder-Pro V2Kwaipilot49.24%aa_slug=kat-coder-pro-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
25#25gpt-5-5-non-reasoningOpenAI49.24%aa_slug=gpt-5-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
26#26Claude Opus 4.6Anthropic48.48%aa_slug=claude-opus-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
27#27gpt-5.2OpenAI46.97%aa_slug=gpt-5-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
28#28Qwen 3.7 PlusQwen46.97%aa_slug=qwen3-7-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
29#29claude-opus-4-5-thinkingAnthropic46.97%aa_slug=claude-opus-4-5-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
30#30claude-opus-4-6-adaptiveAnthropic46.21%aa_slug=claude-opus-4-6-adaptive · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
31#31deepseek-v4-pro-0424DeepSeek46.21%aa_slug=deepseek-v4-pro-0424 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
32#32gemini-3-5-flash-minimalGoogle46.21%aa_slug=gemini-3-5-flash-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
33#33Claude Sonnet 4.6Anthropic46.21%aa_slug=claude-sonnet-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
34#34gpt-5.1OpenAI45.45%aa_slug=gpt-5-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
35#35muse-sparkMeta AI45.45%aa_slug=muse-spark · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
36#36Kimi K2.7 CodeMoonshot AI44.7%aa_slug=kimi-k2-7-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
37#37Kimi K2.6Moonshot AI43.94%aa_slug=kimi-k2-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
38#38Qwen3.6 PlusQwen43.94%aa_slug=qwen3-6-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
39#39gpt-5-6-terra-lowOpenAI43.94%aa_slug=gpt-5-6-terra-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
40#40Qwen3.6 Max PreviewQwen43.94%aa_slug=qwen3-6-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
41#41gpt-5-4-lowOpenAI43.18%aa_slug=gpt-5-4-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
42#42GLM 5.1Z.ai (Zhipu AI)43.18%aa_slug=glm-5-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
43#43MiMo-V2.5-ProXiaomi43.18%aa_slug=mimo-v2-5-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
44#44GLM 5Z.ai (Zhipu AI)43.18%aa_slug=glm-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
45#45gpt-5-2-mediumOpenAI43.18%aa_slug=gpt-5-2-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
46#46gpt-5.4-nanoOpenAI42.42%aa_slug=gpt-5-4-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
47#47MiniMax M3MiniMax42.42%aa_slug=minimax-m3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
48#48claude-sonnet-4-6-non-reasoning-low-effortAnthropic42.42%aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
49#49gpt-5-5-instant-05-26OpenAI42.42%aa_slug=gpt-5-5-instant-05-26 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
50#50deepseek-v4-pro-0424-highDeepSeek41.67%aa_slug=deepseek-v4-pro-0424-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
51#51MiMo-V2.5Xiaomi41.67%aa_slug=mimo-v2-5-0424 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
52#52gemini-3-proGoogle41.67%aa_slug=gemini-3-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
53#53Gemini 3.5 FlashGoogle40.91%aa_slug=gemini-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
54#54mimo-v2-proXiaomi40.91%aa_slug=mimo-v2-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
55#55Claude Opus 4.5Anthropic40.91%aa_slug=claude-opus-4-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
56#56Qwen3.5 397B A17BQwen40.91%aa_slug=qwen3-5-397b-a17b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
57#57grok-4-20-0309SpaceXAI40.91%aa_slug=grok-4-20-0309 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
58#58glm-5-non-reasoningZ.ai (Zhipu AI)39.39%aa_slug=glm-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
59#59gemini-3-5-flash-mediumGoogle39.39%aa_slug=gemini-3-5-flash-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
60#60MiniMax M2.7MiniMax39.39%aa_slug=minimax-m2-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
61#61deepseek-v4-flash-0420-highDeepSeek38.64%aa_slug=deepseek-v4-flash-0420-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
62#62Gemini 3 Flash PreviewGoogle38.64%aa_slug=gemini-3-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
63#63grok-4SpaceXAI37.88%aa_slug=grok-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
64#64gpt-5-4-non-reasoningOpenAI37.88%aa_slug=gpt-5-4-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
65#65Grok 4.3xAI37.88%aa_slug=grok-4-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
66#66GPT-5-CodexOpenAI37.88%aa_slug=gpt-5-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
67#67Grok 4.20xAI37.88%aa_slug=grok-4-20 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
68#68kimi-k2-6-non-reasoningMoonshot AI37.88%aa_slug=kimi-k2-6-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
69#69gpt-5 (medium)OpenAI37.88%aa_slug=gpt-5-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
70#70GPT-5.2-CodexOpenAI37.12%aa_slug=gpt-5-2-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
71#71o3OpenAI37.12%aa_slug=o3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
72#72Nemotron 3 UltraNVIDIA36.36%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
73#73Gemma 4 31BGoogle36.36%aa_slug=gemma-4-31b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
74#74deepseek-v4-pro-0424-non-reasoningDeepSeek36.36%aa_slug=deepseek-v4-pro-0424-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
75#75glm-5-1-non-reasoningZ.ai (Zhipu AI)35.61%aa_slug=glm-5-1-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
76#76mimo-v2-5-pro-non-reasoningXiaomi35.61%aa_slug=mimo-v2-5-pro-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
77#77DeepSeek V3.2DeepSeek35.61%aa_slug=deepseek-v3-2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
78#78claude-4-5-sonnet-thinkingAnthropic35.61%aa_slug=claude-4-5-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
79#79deepseek-v4-flash-0420DeepSeek35.61%aa_slug=deepseek-v4-flash-0420 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
80#80Step 3.7 FlashStepFun35.61%aa_slug=step-3-7-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
81#81qwen3-5-397b-a17b-non-reasoningAlibaba Group35.61%aa_slug=qwen3-5-397b-a17b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
82#82mimo-v2-omni-0327Xiaomi35.61%aa_slug=mimo-v2-omni-0327 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
83#83Qwen3.6 35B A3BQwen34.85%aa_slug=qwen3-6-35b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
84#84GPT-5.1-CodexOpenAI34.85%aa_slug=gpt-5-1-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
85#85MiniMax M2.5MiniMax34.85%aa_slug=minimax-m2-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
86#86Qwen3.6 27BQwen34.85%aa_slug=qwen3-6-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
87#87Kimi K2.5Moonshot AI34.85%aa_slug=kimi-k2-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
88#88mimo-v2-omniXiaomi34.85%aa_slug=mimo-v2-omni · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
89#89deepseek-v3-2-specialeDeepSeek34.85%aa_slug=deepseek-v3-2-speciale · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
90#90claude-4-1-opus-thinkingAnthropic34.34%aa_slug=claude-4-1-opus-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
91#91Hy3 previewTencent34.09%aa_slug=hy3-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
92#92gemini-3-pro-lowGoogle34.09%aa_slug=gemini-3-pro-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
93#93deepseek-v4-flash-0420-non-reasoningDeepSeek34.09%aa_slug=deepseek-v4-flash-0420-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
94#94gpt-5-4-mini-mediumOpenAI34.09%aa_slug=gpt-5-4-mini-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
95#95gpt-5-4-nano-mediumOpenAI33.33%aa_slug=gpt-5-4-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
96#96GLM 5 TurboZ.ai (Zhipu AI)33.33%aa_slug=glm-5-turbo · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
97#97Mistral Medium 3.5Mistral AI33.33%aa_slug=mistral-medium-3-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
98#98gpt-5-miniOpenAI33.33%aa_slug=gpt-5-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
99#99GPT-5.1-Codex MiniOpenAI33.33%aa_slug=gpt-5-1-codex-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
100#100Qwen3.5-27BQwen32.58%aa_slug=qwen3-5-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.