Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 8 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 432 filtered
Leader
Claude Fable 5.1 91.39%

Score history · Llama 4 Maverick 3 rows

Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 6.82%aa_slug=llama-4-maverick · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 7.87%aa_slug=llama-4-maverick · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 0%aa_slug=llama-4-maverick · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 432 current results · config contains “hard”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101step-3-5-flashStepFun32.58%aa_slug=step-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102DeepSeek V3DeepSeek32.58%aa_slug=deepseek-v3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103Qwen3.5-27BQwen32.58%aa_slug=qwen3-5-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104GLM 5V TurboZ.ai (Zhipu AI)32.58%aa_slug=glm-5v-turbo · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105hy3-non-reasoningTencent31.82%aa_slug=hy3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106GLM 4.7Z.ai (Zhipu AI)31.82%aa_slug=glm-4-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107DeepSeek V3.1 TerminusDeepSeek31.82%aa_slug=deepseek-v3-1-terminus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108qwen3-5-27b-non-reasoningAlibaba Group31.82%aa_slug=qwen3-5-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109gpt-5-2-non-reasoningOpenAI31.82%aa_slug=gpt-5-2-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110gemini-3-flashGoogle31.82%aa_slug=gemini-3-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111DeepSeek V3.2 ExpDeepSeek31.06%aa_slug=deepseek-v3-2-reasoning-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112mimo-v2-0206Xiaomi31.06%aa_slug=mimo-v2-0206 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113Claude Opus 4Anthropic31.06%aa_slug=claude-4-opus-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114ling-2-6-1tinclusionAI31.06%aa_slug=ling-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115Kimi K2 ThinkingMoonshot AI31.06%aa_slug=kimi-k2-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116Qwen3.5-122B-A10BQwen31.06%aa_slug=qwen3-5-122b-a10b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117claude-4-sonnet-thinkingAnthropic31.06%aa_slug=claude-4-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118North Mini Code (free)Cohere31.06%aa_slug=north-mini-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119grok-4-3-mediumSpaceXAI30.3%aa_slug=grok-4-3-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120glm-4-7-non-reasoningZ.ai (Zhipu AI)30.3%aa_slug=glm-4-7-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121gemma-4-31b-non-reasoningGoogle30.3%aa_slug=gemma-4-31b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122deepseek-v3-1-terminus-reasoningDeepSeek30.3%aa_slug=deepseek-v3-1-terminus-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123qwen3-5-122b-a10b-non-reasoningAlibaba Group29.55%aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124ring-2-6-1tinclusionAI28.79%aa_slug=ring-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125jt-35b-flashChina Mobile28.79%aa_slug=jt-35b-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126MiniMax M2.1MiniMax28.79%aa_slug=minimax-m2-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127Claude Sonnet 4.5Anthropic28.79%aa_slug=claude-4-5-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128GLM 4.6Z.ai (Zhipu AI)28.79%aa_slug=glm-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129Nemotron 3 SuperNVIDIA28.79%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130gpt-5-mini-mediumOpenAI28.79%aa_slug=gpt-5-mini-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131mimo-v2-flash-reasoningXiaomi28.03%aa_slug=mimo-v2-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132Claude Haiku 4.5Anthropic27.27%aa_slug=claude-4-5-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133Step 3.5 FlashStepFun27.27%aa_slug=step-3-5-flash-0202 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134Claude Sonnet 4Anthropic27.27%aa_slug=claude-4-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135claude-4-5-haiku-reasoningAnthropic27.27%aa_slug=claude-4-5-haiku-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136grok-4-3-lowSpaceXAI26.52%aa_slug=grok-4-3-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137doubao-seed-codeByteDance26.52%aa_slug=doubao-seed-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138gpt-5 (low)OpenAI26.52%aa_slug=gpt-5-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139Qwen3.5-35B-A3BQwen26.52%aa_slug=qwen3-5-35b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140Mercury 2Inception26.52%aa_slug=mercury-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141Gemini 2.5 ProGoogle26.52%aa_slug=gemini-2-5-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142MiniMax M2MiniMax25.76%aa_slug=minimax-m2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143mimo-v2-flashXiaomi25.76%aa_slug=mimo-v2-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144qwen3-6-35b-a3b-non-reasoningAlibaba Group25.76%aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145deepseek-v3-1-reasoningDeepSeek25%aa_slug=deepseek-v3-1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146gemma-4-26b-a4b-non-reasoningGoogle25%aa_slug=gemma-4-26b-a4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147command-a-plusCohere25%aa_slug=command-a-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
148#148deepseek-v3-2-0925DeepSeek25%aa_slug=deepseek-v3-2-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
149#149ernie-5-0-thinking-previewBaidu25%aa_slug=ernie-5-0-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
150#150glm-4-6-reasoningZ.ai (Zhipu AI)25%aa_slug=glm-4-6-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
151#151grok-4-1-fast-reasoningSpaceXAI24.24%aa_slug=grok-4-1-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
152#152Qwen3.5-9BQwen24.24%aa_slug=qwen3-5-9b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
153#153Qwen3 Max ThinkingQwen24.24%aa_slug=qwen3-max-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
154#154gpt-5-4-nano-non-reasoningOpenAI24.24%aa_slug=gpt-5-4-nano-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
155#155nova-2-0-pro-reasoning-mediumAmazon Web Services24.24%aa_slug=nova-2-0-pro-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
156#156gemini-3-1-flash-lite-previewGoogle24.24%aa_slug=gemini-3-1-flash-lite-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
157#157DeepSeek V3.1DeepSeek24.24%aa_slug=deepseek-v3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
158#158hypernova-60bMultiverse Computing23.48%aa_slug=hypernova-60b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
159#159gpt-oss-120bOpenAI23.48%aa_slug=gpt-oss-120b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
160#160Kimi K2 0905Moonshot AI23.48%aa_slug=kimi-k2-0905 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
161#161Trinity Large ThinkingArcee AI22.73%aa_slug=trinity-large-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
162#162k-exaoneLG AI Research22.73%aa_slug=k-exaone · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
163#163gpt-5-1-non-reasoningOpenAI22.73%aa_slug=gpt-5-1-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
164#164grok-4-20-0309-non-reasoningSpaceXAI21.97%aa_slug=grok-4-20-0309-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
165#165GLM 4.7 FlashZ.ai (Zhipu AI)21.97%aa_slug=glm-4-7-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
166#166GLM 4.5Z.ai (Zhipu AI)21.97%aa_slug=glm-4.5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
167#167qwen3-6-27b-non-reasoningAlibaba Group21.21%aa_slug=qwen3-6-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
168#168Claude 3.7 SonnetAnthropic21.21%aa_slug=claude-3-7-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
169#169ling-2-6-flashinclusionAI21.21%aa_slug=ling-2-6-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
170#170nemotron-cascade-2-30b-a3bNVIDIA21.21%aa_slug=nemotron-cascade-2-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
171#171qwen3-5-omni-plusAlibaba Group21.21%aa_slug=qwen3-5-omni-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
172#172claude-3-7-sonnet-thinkingAnthropic21.21%aa_slug=claude-3-7-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
173#173GLM 4.5 AirZ.ai (Zhipu AI)20.45%aa_slug=glm-4-5-air · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
174#174exaone-4-5-33bLG AI Research20.45%aa_slug=exaone-4-5-33b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
175#175Qwen3 MaxQwen20.45%aa_slug=qwen3-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
176#176qwen3-max-previewAlibaba Group19.7%aa_slug=qwen3-max-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
177#177kimi-k2-5-non-reasoningMoonshot AI18.94%aa_slug=kimi-k2-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
178#178grok-4-3-non-reasoningSpaceXAI18.94%aa_slug=grok-4-3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
179#179grok-4-fast-reasoningSpaceXAI18.94%aa_slug=grok-4-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
180#180Devstral 2Mistral AI18.94%aa_slug=devstral-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
181#181qwen3-coder-480b-a35b-instructAlibaba Group18.94%aa_slug=qwen3-coder-480b-a35b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
182#182gpt-5-4-mini-non-reasoningOpenAI18.18%aa_slug=gpt-5-4-mini-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
183#183qwen3-5-9b-non-reasoningAlibaba Group18.18%aa_slug=qwen3-5-9b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
184#184Qwen3.5-4BQwen18.18%aa_slug=qwen3-5-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
185#185gpt-5-minimalOpenAI18.18%aa_slug=gpt-5-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
186#186Qwen3 Coder NextQwen18.18%aa_slug=qwen3-coder-next · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
187#187jt-miniChina Mobile18.18%aa_slug=jt-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
188#188gemma-4-12BGoogle18.18%aa_slug=gemma-4-12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
189#189nova-2-0-lite-reasoning-mediumAmazon Web Services17.42%aa_slug=nova-2-0-lite-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
190#190grok-3-mini-reasoningSpaceXAI17.42%aa_slug=grok-3-mini-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
191#191Mistral Small 4Mistral AI17.42%aa_slug=mistral-small-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
192#192gpt-5-nano-mediumOpenAI17.42%aa_slug=gpt-5-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
193#193qwen3-max-thinking-previewAlibaba Group17.42%aa_slug=qwen3-max-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
194#194nova-2-0-pro-reasoning-lowAmazon Web Services17.42%aa_slug=nova-2-0-pro-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
195#195Grok Build 0.1xAI17.42%aa_slug=grok-code-fast-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
196#196nova-2-0-lite-reasoningAmazon Web Services16.67%aa_slug=nova-2-0-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
197#197gemini-2-5-flash-preview-09-2025-reasoningGoogle16.67%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
198#198grok-4.20-0309-non-reasoningxAI16.67%aa_slug=grok-4-20-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
199#199Devstral Small 2Mistral AI16.67%aa_slug=devstral-small-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
200#200nova-2-0-proAmazon Web Services16.67%aa_slug=nova-2-0-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.