Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · gpt-5 (medium) 1 row

Not enough history to chart — a single observation (37.88% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 37.88%aa_slug=gpt-5-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
301#301Devstral Small 2Mistral AI29.59%aa_slug=devstral-small-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
302#302qwen3-5-122b-a10b-non-reasoningAlibaba Group29.55%aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
303#303Qwen3.5-9BQwen29.21%aa_slug=qwen3-5-9b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
304#304gemma-4-31b-non-reasoningGoogle29.21%aa_slug=gemma-4-31b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
305#305MiniMax M2.1MiniMax28.79%aa_slug=minimax-m2-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
306#306ring-2-6-1tinclusionAI28.79%aa_slug=ring-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
307#307jt-35b-flashChina Mobile28.79%aa_slug=jt-35b-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
308#308gpt-5-mini-mediumOpenAI28.79%aa_slug=gpt-5-mini-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
309#309Nemotron 3 SuperNVIDIA28.79%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
310#310Claude Sonnet 4.5Anthropic28.79%aa_slug=claude-4-5-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
311#311GLM 4.6Z.ai (Zhipu AI)28.79%aa_slug=glm-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
312#312Gemini 2.5 ProGoogle28.46%aa_slug=gemini-2-5-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
313#313mimo-v2-flash-reasoningXiaomi28.03%aa_slug=mimo-v2-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
314#314ling-3-0-tinyinclusionAI27.72%aa_slug=ling-3-0-tiny · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
315#315gemma-4-12BGoogle27.34%aa_slug=gemma-4-12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
316#316Mercury 2Inception27.34%aa_slug=mercury-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
317#317Claude Haiku 4.5Anthropic27.27%aa_slug=claude-4-5-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
318#318Step 3.5 FlashStepFun27.27%aa_slug=step-3-5-flash-0202 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
319#319Claude Sonnet 4Anthropic27.27%aa_slug=claude-4-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
320#320claude-4-5-haiku-reasoningAnthropic27.27%aa_slug=claude-4-5-haiku-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
321#321DeepSeek-V4.1-FlashDeepSeek26.77%aa_slug=deepseek-v4-1-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
322#322granite-4.2-30bIBM26.59%aa_slug=granite-4-2-30b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
323#323Qwen3.5-35B-A3BQwen26.52%aa_slug=qwen3-5-35b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
324#324doubao-seed-codeByteDance26.52%aa_slug=doubao-seed-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
325#325gpt-5 (low)OpenAI26.52%aa_slug=gpt-5-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
326#326Mercury 2Inception26.52%aa_slug=mercury-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
327#327grok-4-3-lowSpaceXAI26.52%aa_slug=grok-4-3-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
328#328Gemini 2.5 ProGoogle26.52%aa_slug=gemini-2-5-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
329#329claude-opus-5-lowAnthropic26.26%aa_slug=claude-opus-5-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
330#330gpt-oss-120bOpenAI26.22%aa_slug=gpt-oss-120b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
331#331Mistral Small 3.1Mistral AI26.22%aa_slug=mistral-small-3-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
332#332Qwen3.5-4BQwen25.84%aa_slug=qwen3-5-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
333#333MiniMax M2MiniMax25.76%aa_slug=minimax-m2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
334#334mimo-v2-flashXiaomi25.76%aa_slug=mimo-v2-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
335#335qwen3-6-35b-a3b-non-reasoningAlibaba Group25.76%aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
336#336Qwen3.8 FlashQwen25.25%aa_slug=qwen3-8-flash-next · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
337#337gemma-4-26b-a4b-non-reasoningGoogle25%aa_slug=gemma-4-26b-a4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
338#338deepseek-v3-1-reasoningDeepSeek25%aa_slug=deepseek-v3-1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
339#339command-a-plusCohere25%aa_slug=command-a-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
340#340glm-4-6-reasoningZ.ai (Zhipu AI)25%aa_slug=glm-4-6-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
341#341deepseek-v3-2-0925DeepSeek25%aa_slug=deepseek-v3-2-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
342#342ernie-5-0-thinking-previewBaidu25%aa_slug=ernie-5-0-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
343#343gpt-5-6-sol-xhighOpenAI24.75%aa_slug=gpt-5-6-sol-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
344#344ling-2-6-flashinclusionAI24.34%aa_slug=ling-2-6-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
345#345Nemotron 3.5 LightningNVIDIA24.34%aa_slug=nemotron-3-5-lightning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
346#346Qwen3.5-9BQwen24.24%aa_slug=qwen3-5-9b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
347#347Qwen3 Max ThinkingQwen24.24%aa_slug=qwen3-max-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
348#348gemini-3-1-flash-lite-previewGoogle24.24%aa_slug=gemini-3-1-flash-lite-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
349#349grok-4-1-fast-reasoningSpaceXAI24.24%aa_slug=grok-4-1-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
350#350gpt-5-4-nano-non-reasoningOpenAI24.24%aa_slug=gpt-5-4-nano-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
351#351nova-2-0-pro-reasoning-mediumAmazon Web Services24.24%aa_slug=nova-2-0-pro-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
352#352DeepSeek V3.1DeepSeek24.24%aa_slug=deepseek-v3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
353#353Kimi K2 0905Moonshot AI23.48%aa_slug=kimi-k2-0905 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
354#354gpt-oss-120bOpenAI23.48%aa_slug=gpt-oss-120b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
355#355hypernova-60bMultiverse Computing23.48%aa_slug=hypernova-60b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
356#356command-a-plusCohere22.85%aa_slug=command-a-plus · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
357#357Trinity Large ThinkingArcee AI22.73%aa_slug=trinity-large-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
358#358k-exaoneLG AI Research22.73%aa_slug=k-exaone · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
359#359gpt-5-1-non-reasoningOpenAI22.73%aa_slug=gpt-5-1-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
360#360grok-4-20-0309-non-reasoningSpaceXAI21.97%aa_slug=grok-4-20-0309-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
361#361GLM 4.5Z.ai (Zhipu AI)21.97%aa_slug=glm-4.5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
362#362GLM 4.7 FlashZ.ai (Zhipu AI)21.97%aa_slug=glm-4-7-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
363#363Claude Opus 4.8Anthropic21.72%aa_slug=claude-opus-4-8 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
364#364qwen3-5-4b-non-reasoningAlibaba Group21.35%aa_slug=qwen3-5-4b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
365#365qwen3-5-9b-non-reasoningAlibaba Group21.35%aa_slug=qwen3-5-9b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
366#366exaone-4-5-33bLG AI Research21.35%aa_slug=exaone-4-5-33b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
367#367claude-3-7-sonnet-thinkingAnthropic21.21%aa_slug=claude-3-7-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
368#368Claude 3.7 SonnetAnthropic21.21%aa_slug=claude-3-7-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
369#369qwen3-6-27b-non-reasoningAlibaba Group21.21%aa_slug=qwen3-6-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
370#370ling-2-6-flashinclusionAI21.21%aa_slug=ling-2-6-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
371#371Grok 4.6xAI21.21%aa_slug=grok-4-6 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
372#372nemotron-cascade-2-30b-a3bNVIDIA21.21%aa_slug=nemotron-cascade-2-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
373#373qwen3-5-omni-plusAlibaba Group21.21%aa_slug=qwen3-5-omni-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
374#374Mistral Small 4Mistral AI20.97%aa_slug=mistral-small-4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
375#375gpt-5-6-sol-highOpenAI20.71%aa_slug=gpt-5-6-sol-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
376#376Trinity Large ThinkingArcee AI20.6%aa_slug=trinity-large-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
377#377nemotron-cascade-2-30b-a3bNVIDIA20.6%aa_slug=nemotron-cascade-2-30b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
378#378exaone-4-5-33bLG AI Research20.45%aa_slug=exaone-4-5-33b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
379#379GLM 4.5 AirZ.ai (Zhipu AI)20.45%aa_slug=glm-4-5-air · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
380#380Qwen3 MaxQwen20.45%aa_slug=qwen3-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
381#381qwen3-max-previewAlibaba Group19.7%aa_slug=qwen3-max-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
382#382Gemini 3.8 FlashGoogle19.7%aa_slug=gemini-3-8-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
383#383gemini-3-8-flash-mediumGoogle19.7%aa_slug=gemini-3-8-flash-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
384#384nova-2-0-pro-reasoning-lowAmazon Web Services19.48%aa_slug=nova-2-0-pro-reasoning-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
385#385deepseek-r1-0120DeepSeek19.1%aa_slug=deepseek-r1-0120 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
386#386grok-4-fast-reasoningSpaceXAI18.94%aa_slug=grok-4-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
387#387kimi-k2-5-non-reasoningMoonshot AI18.94%aa_slug=kimi-k2-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
388#388Devstral 2Mistral AI18.94%aa_slug=devstral-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
389#389grok-4-3-non-reasoningSpaceXAI18.94%aa_slug=grok-4-3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
390#390qwen3-coder-480b-a35b-instructAlibaba Group18.94%aa_slug=qwen3-coder-480b-a35b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
391#391Qwen 3.8 MaxQwen18.69%aa_slug=qwen3-8-max · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
392#392Granite 4.2 8BIBM18.35%aa_slug=granite-4-2-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
393#393hypernova-60bMultiverse Computing18.35%aa_slug=hypernova-60b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
394#394gpt-5-4-mini-non-reasoningOpenAI18.18%aa_slug=gpt-5-4-mini-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
395#395Qwen3 Coder NextQwen18.18%aa_slug=qwen3-coder-next · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
396#396qwen3-5-9b-non-reasoningAlibaba Group18.18%aa_slug=qwen3-5-9b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
397#397gpt-5-minimalOpenAI18.18%aa_slug=gpt-5-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
398#398gemma-4-12BGoogle18.18%aa_slug=gemma-4-12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
399#399jt-miniChina Mobile18.18%aa_slug=jt-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
400#400Qwen3.5-4BQwen18.18%aa_slug=qwen3-5-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.