Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · Claude Opus 5 2 rows

Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 89.14%aa_slug=claude-opus-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 48.99%aa_slug=claude-opus-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201gpt-6-astra-lowOpenAI41.92%aa_slug=gpt-6-astra-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202MiMo-V2.5Xiaomi41.67%aa_slug=mimo-v2-5-0424 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203deepseek-v4-pro-0424-highDeepSeek41.67%aa_slug=deepseek-v4-pro-0424-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204gemini-3-proGoogle41.67%aa_slug=gemini-3-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205qwen3-6-35b-a3b-non-reasoningAlibaba Group41.57%aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206Claude Opus 4.5Anthropic40.91%aa_slug=claude-opus-4-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207mimo-v2-proXiaomi40.91%aa_slug=mimo-v2-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208Qwen3.5 397B A17BQwen40.91%aa_slug=qwen3-5-397b-a17b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209grok-4-20-0309SpaceXAI40.91%aa_slug=grok-4-20-0309 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210Gemini 3.5 FlashGoogle40.91%aa_slug=gemini-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211qwen3-5-35b-a3b-non-reasoningAlibaba Group40.82%aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212k-exaone-2-0-0803LG AI Research40.45%aa_slug=k-exaone-2-0-0803 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213claude-fable-5-1-lowAnthropic40.4%aa_slug=claude-fable-5-1-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214gpt-5-6-solOpenAI39.9%aa_slug=gpt-5-6-sol · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215Grok 4.3xAI39.7%aa_slug=grok-4-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216MiniMax M2.7MiniMax39.39%aa_slug=minimax-m2-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217gemini-3-5-flash-mediumGoogle39.39%aa_slug=gemini-3-5-flash-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218glm-5-non-reasoningZ.ai (Zhipu AI)39.39%aa_slug=glm-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219Step 3.7 FlashStepFun39.33%aa_slug=step-3-7-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220a-x-k2SK Telecom38.95%aa_slug=a-x-k2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221gpt-5-6-luna-non-reasoningOpenAI38.95%aa_slug=gpt-5-6-luna-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222Gemma 4 26B A4BGoogle38.95%aa_slug=gemma-4-26b-a4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223Gemini 3 Flash PreviewGoogle38.64%aa_slug=gemini-3-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224deepseek-v4-flash-0420-highDeepSeek38.64%aa_slug=deepseek-v4-flash-0420-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225Nemotron 3 SuperNVIDIA38.58%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226Qwen3 Coder NextQwen38.2%aa_slug=qwen3-coder-next · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227gpt-5-4-non-reasoningOpenAI37.88%aa_slug=gpt-5-4-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228GPT-5-CodexOpenAI37.88%aa_slug=gpt-5-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229Grok 4.3xAI37.88%aa_slug=grok-4-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230Grok 4.20xAI37.88%aa_slug=grok-4-20 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231grok-4SpaceXAI37.88%aa_slug=grok-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232gpt-5 (medium)OpenAI37.88%aa_slug=gpt-5-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233kimi-k2-6-non-reasoningMoonshot AI37.88%aa_slug=kimi-k2-6-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234GPT-5.2-CodexOpenAI37.12%aa_slug=gpt-5-2-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235o3OpenAI37.12%aa_slug=o3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236Gemma 4 31BGoogle36.36%aa_slug=gemma-4-31b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237deepseek-v4-pro-0424-non-reasoningDeepSeek36.36%aa_slug=deepseek-v4-pro-0424-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238Nemotron 3 UltraNVIDIA36.36%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
239#239claude-4-sonnet-thinkingAnthropic36.33%aa_slug=claude-4-sonnet-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
240#240claude-4-5-sonnet-thinkingAnthropic35.61%aa_slug=claude-4-5-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
241#241qwen3-5-397b-a17b-non-reasoningAlibaba Group35.61%aa_slug=qwen3-5-397b-a17b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
242#242DeepSeek V3.2DeepSeek35.61%aa_slug=deepseek-v3-2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
243#243deepseek-v4-flash-0420DeepSeek35.61%aa_slug=deepseek-v4-flash-0420 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
244#244mimo-v2-omni-0327Xiaomi35.61%aa_slug=mimo-v2-omni-0327 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
245#245glm-5-1-non-reasoningZ.ai (Zhipu AI)35.61%aa_slug=glm-5-1-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
246#246Step 3.7 FlashStepFun35.61%aa_slug=step-3-7-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
247#247mimo-v2-5-pro-non-reasoningXiaomi35.61%aa_slug=mimo-v2-5-pro-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
248#248North Mini Code (free)Cohere35.58%aa_slug=north-mini-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
249#249gpt-5.6-terraOpenAI35.35%aa_slug=gpt-5-6-terra · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
250#250gpt-5OpenAI35.21%aa_slug=gpt-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
251#251Qwen3.6 35B A3BQwen34.85%aa_slug=qwen3-6-35b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
252#252MiniMax M2.5MiniMax34.85%aa_slug=minimax-m2-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
253#253Qwen3.6 27BQwen34.85%aa_slug=qwen3-6-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
254#254deepseek-v3-2-specialeDeepSeek34.85%aa_slug=deepseek-v3-2-speciale · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
255#255mimo-v2-omniXiaomi34.85%aa_slug=mimo-v2-omni · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
256#256GPT-5.1-CodexOpenAI34.85%aa_slug=gpt-5-1-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
257#257Kimi K2.5Moonshot AI34.85%aa_slug=kimi-k2-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
258#258gpt-5-5-instant-06-26OpenAI34.83%aa_slug=gpt-5-5-instant-06-26 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
259#259claude-4-1-opus-thinkingAnthropic34.34%aa_slug=claude-4-1-opus-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
260#260claude-opus-5-mediumAnthropic34.34%aa_slug=claude-opus-5-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
261#261Hy3 previewTencent34.09%aa_slug=hy3-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
262#262deepseek-v4-flash-0420-non-reasoningDeepSeek34.09%aa_slug=deepseek-v4-flash-0420-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
263#263gemini-3-pro-lowGoogle34.09%aa_slug=gemini-3-pro-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
264#264gpt-5-4-mini-mediumOpenAI34.09%aa_slug=gpt-5-4-mini-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
265#265grok-4-3-non-reasoningSpaceXAI34.08%aa_slug=grok-4-3-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
266#266gpt-5-miniOpenAI33.33%aa_slug=gpt-5-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
267#267GLM 5 TurboZ.ai (Zhipu AI)33.33%aa_slug=glm-5-turbo · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
268#268Mistral Medium 3.5Mistral AI33.33%aa_slug=mistral-medium-3-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
269#269GPT-5.1-Codex MiniOpenAI33.33%aa_slug=gpt-5-1-codex-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
270#270gpt-5-4-nano-mediumOpenAI33.33%aa_slug=gpt-5-4-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
271#271Muse Spark 1.3Meta AI33.33%aa_slug=muse-spark-1-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
272#272GLM 5.3 FlashZ.ai (Zhipu AI)32.83%aa_slug=glm-5-3-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
273#273Qwen3.5-27BQwen32.58%aa_slug=qwen3-5-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
274#274gpt-5OpenAI32.58%aa_slug=gpt-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
275#275DeepSeek V3DeepSeek32.58%aa_slug=deepseek-v3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
276#276g9v3-39a5bAI9Stars32.58%aa_slug=g9v3-39a5b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
277#277step-3-5-flashStepFun32.58%aa_slug=step-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
278#278GLM 5V TurboZ.ai (Zhipu AI)32.58%aa_slug=glm-5v-turbo · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
279#279GLM 4.7Z.ai (Zhipu AI)31.82%aa_slug=glm-4-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
280#280qwen3-5-27b-non-reasoningAlibaba Group31.82%aa_slug=qwen3-5-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
281#281hy3-non-reasoningTencent31.82%aa_slug=hy3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
282#282gpt-5-2-non-reasoningOpenAI31.82%aa_slug=gpt-5-2-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
283#283DeepSeek V3.1 TerminusDeepSeek31.82%aa_slug=deepseek-v3-1-terminus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
284#284gemini-3-flashGoogle31.82%aa_slug=gemini-3-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
285#285gemini-3-1-flash-lite-previewGoogle31.09%aa_slug=gemini-3-1-flash-lite-preview · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
286#286DeepSeek V3.2 ExpDeepSeek31.06%aa_slug=deepseek-v3-2-reasoning-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
287#287Qwen3.5-122B-A10BQwen31.06%aa_slug=qwen3-5-122b-a10b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
288#288ling-2-6-1tinclusionAI31.06%aa_slug=ling-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
289#289Claude Opus 4Anthropic31.06%aa_slug=claude-4-opus-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
290#290North Mini Code (free)Cohere31.06%aa_slug=north-mini-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
291#291Kimi K2 ThinkingMoonshot AI31.06%aa_slug=kimi-k2-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
292#292mimo-v2-0206Xiaomi31.06%aa_slug=mimo-v2-0206 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
293#293claude-4-sonnet-thinkingAnthropic31.06%aa_slug=claude-4-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
294#294k-exaoneLG AI Research30.34%aa_slug=k-exaone · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
295#295Devstral 2Mistral AI30.34%aa_slug=devstral-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
296#296glm-4-7-non-reasoningZ.ai (Zhipu AI)30.3%aa_slug=glm-4-7-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
297#297grok-4-3-mediumSpaceXAI30.3%aa_slug=grok-4-3-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
298#298deepseek-v3-1-terminus-reasoningDeepSeek30.3%aa_slug=deepseek-v3-1-terminus-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
299#299gemma-4-31b-non-reasoningGoogle30.3%aa_slug=gemma-4-31b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
300#300nova-2-0-pro-reasoning-mediumAmazon Web Services29.59%aa_slug=nova-2-0-pro-reasoning-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.