Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · Kimi K2.7 Code 3 rows

Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 44.7%aa_slug=kimi-k2-7-code · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 67.42%aa_slug=kimi-k2-7-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 1.01%aa_slug=kimi-k2-7-code · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
701#701Trinity Large ThinkingArcee AI0.51%aa_slug=trinity-large-thinking · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
702#702Hy3Tencent0.51%aa_slug=hy3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
703#703North Mini Code (free)Cohere0.51%aa_slug=north-mini-code · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
704#704Solar Pro 4Upstage0.51%aa_slug=solar-pro4 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
705#705gpt-5.4-nanoOpenAI0.51%aa_slug=gpt-5-4-nano · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
706#706Muse Glimmer 30BMeta AI0.51%aa_slug=muse-glimmer · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
707#707gpt-5-6-luna-mediumOpenAI0.51%aa_slug=gpt-5-6-luna-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
708#708gemini-3-1-flash-lite-previewGoogle0.51%aa_slug=gemini-3-1-flash-lite-preview · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
709#709Nemotron 3 UltraNVIDIA0.51%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
710#710ring-2-6-1tinclusionAI0.51%aa_slug=ring-2-6-1t · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
711#711Gemma 3 4BGoogle0.37%aa_slug=gemma-3-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
712#712phi-4-miniMicrosoft0.37%aa_slug=phi-4-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
713#713gemma-4-E2BGoogle0.37%aa_slug=gemma-4-e2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
714#714qwen3-5-0-8b-non-reasoningAlibaba Group0.37%aa_slug=qwen3-5-0-8b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
715#715Mistral Large 3Mistral AI0%aa_slug=mistral-large-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
716#716MiMo-V2.5Xiaomi0%aa_slug=mimo-v2-5-0424 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
717#717nanbeige4-1-3bNanbeige0%aa_slug=nanbeige4-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
718#718nvidia-nemotron-nano-12b-v2-vlNVIDIA0%aa_slug=nvidia-nemotron-nano-12b-v2-vl · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
719#719gemma-3-1bGoogle0%aa_slug=gemma-3-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
720#720Llama 4 ScoutMeta AI0%aa_slug=llama-4-scout · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
721#721apertus-70b-instructSwiss AI Initiative0%aa_slug=apertus-70b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
722#722minicpm5-1b-non-reasoningOpenBMB0%aa_slug=minicpm5-1b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
723#723Qwen3-0.6BQwen0%aa_slug=qwen3-0.6b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
724#724tiny-aya-globalCohere0%aa_slug=tiny-aya-global · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
725#725hermes-4-llama-3-1-70bNous Research0%aa_slug=hermes-4-llama-3-1-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
726#726MiniMax M2.7MiniMax0%aa_slug=minimax-m2-7 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
727#727Granite 4.2 8BIBM0%aa_slug=granite-4-2-8b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
728#728molmo-7b-dAllen Institute for AI0%aa_slug=molmo-7b-d · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
729#729MiMo-V2.5-ProXiaomi0%aa_slug=mimo-v2-5-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
730#730granite-3-3-8b-instructIBM0%aa_slug=granite-3-3-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
731#731Qwen3.5-0.8BQwen0%aa_slug=qwen3-5-0-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
732#732llama-3-3-nemotron-super-49b-reasoningNVIDIA0%aa_slug=llama-3-3-nemotron-super-49b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
733#733Qwen3.5-0.8BQwen0%aa_slug=qwen3-5-0-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
734#734granite-4-0-h-350mIBM0%aa_slug=granite-4-0-h-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
735#735claude-4-5-haiku-reasoningAnthropic0%aa_slug=claude-4-5-haiku-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
736#736exaone-4-0-1-2b-reasoningLG AI Research0%aa_slug=exaone-4-0-1-2b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
737#737granite-4-0-nano-1bIBM0%aa_slug=granite-4-0-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
738#738olmo-2-32bAllen Institute for AI0%aa_slug=olmo-2-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
739#739granite-4-0-350mIBM0%aa_slug=granite-4-0-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
740#740Gemma 3 27BGoogle0%aa_slug=gemma-3-27b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
741#741Gemma 3 12BGoogle0%aa_slug=gemma-3-12b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
742#742qwen3-1.7b-instruct-reasoningAlibaba Group0%aa_slug=qwen3-1.7b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
743#743Gemma 3 12BGoogle0%aa_slug=gemma-3-12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
744#744granite-4-0-h-nano-1bIBM0%aa_slug=granite-4-0-h-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
745#745Reka Flash 3rekaai0%aa_slug=reka-flash-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
746#746phi-4-miniMicrosoft0%aa_slug=phi-4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
747#747Mistral Medium 3.5Mistral AI0%aa_slug=mistral-medium-3-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
748#748lfm2-5-1-2b-thinkingLiquid AI0%aa_slug=lfm2-5-1-2b-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
749#749qwen3-1.7b-instructAlibaba Group0%aa_slug=qwen3-1.7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
750#750LongCat 2.0Meituan0%aa_slug=longcat-2-0 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
751#751LFM2-1.2BLiquid AI0%aa_slug=lfm2-1-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
752#752Qwen3.5 397B A17BQwen0%aa_slug=qwen3-5-397b-a17b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
753#753phi-3-miniMicrosoft0%aa_slug=phi-3-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
754#754qwen3-0.6b-instructAlibaba Group0%aa_slug=qwen3-0.6b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
755#755deepseek-r1-0120DeepSeek0%aa_slug=deepseek-r1-0120 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
756#756Qwen3 8BQwen0%aa_slug=qwen3-8b-instruct-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
757#757qwen3-5-0-8b-non-reasoningAlibaba Group0%aa_slug=qwen3-5-0-8b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
758#758Mistral Small 4Mistral AI0%aa_slug=mistral-small-4 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
759#759qwen3-30b-a3b-2507-reasoningAlibaba Group0%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
760#760Molmo2-8BAllen Institute for AI0%aa_slug=molmo2-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
761#761Ministral 3 8BMistral AI0%aa_slug=ministral-3-8b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
762#762Llama-3.2-1BMeta AI0%aa_slug=llama-3-2-instruct-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
763#763olmo-3-1-32b-instructAllen Institute for AI0%aa_slug=olmo-3-1-32b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
764#764granite-4.2-3bIBM0%aa_slug=granite-4-2-3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
765#765Grok 4.3xAI0%aa_slug=grok-4-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
766#766Nemotron 3 SuperNVIDIA0%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
767#767Qwen3 Coder NextQwen0%aa_slug=qwen3-coder-next · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
768#768deepseek-v3-1-terminus-reasoningDeepSeek0%aa_slug=deepseek-v3-1-terminus-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
769#769minicpm5-2bOpenBMB0%aa_slug=minicpm5-2b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
770#770Llama 4 MaverickMeta AI0%aa_slug=llama-4-maverick · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
771#771Devstral 2Mistral AI0%aa_slug=devstral-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
772#772lfm2-24b-a2bLiquid AI0%aa_slug=lfm2-24b-a2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
773#773Mistral Small 3.1Mistral AI0%aa_slug=mistral-small-3-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
774#774qwen3-5-2b-non-reasoningAlibaba Group0%aa_slug=qwen3-5-2b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
775#775Ministral 3 3BMistral AI0%aa_slug=ministral-3-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
776#776Qwen3 32BQwen0%aa_slug=qwen3-32b-instruct-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
777#777Ministral 3 3BMistral AI0%aa_slug=ministral-3-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
778#778Ministral 3 3BMistral AI0%aa_slug=ministral-3-3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
779#779LFM2.5-VL-1.6BLiquid AI0%aa_slug=lfm2-5-vl-1-6b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
780#780lfm2-8b-a1bLiquid AI0%aa_slug=lfm2-8b-a1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
781#781claude-4-5-sonnet-thinkingAnthropic0%aa_slug=claude-4-5-sonnet-thinking · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
782#782gpt-oss-120bOpenAI0%aa_slug=gpt-oss-120b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
783#783ling-3-0-tinyinclusionAI0%aa_slug=ling-3-0-tiny · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
784#784o3 Mini HighOpenAI0%aa_slug=o3-mini-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
785#785grok-4-3-non-reasoningSpaceXAI0%aa_slug=grok-4-3-non-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
786#786Olmo-3-7B-InstructAllen Institute for AI0%aa_slug=olmo-3-7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
787#787Mistral Medium 3.1Mistral AI0%aa_slug=mistral-medium-3-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
788#788Qwen3.6 27BQwen0%aa_slug=qwen3-6-27b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
789#789apertus-8b-instructSwiss AI Initiative0%aa_slug=apertus-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
790#790Qwen3.6 35B A3BQwen0%aa_slug=qwen3-6-35b-a3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
791#791Ministral 3 14BMistral AI0%aa_slug=ministral-3-14b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
792#792gpt-5-6-luna-lowOpenAI0%aa_slug=gpt-5-6-luna-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
793#793granite-4.1-8bIBM0%aa_slug=granite-4-1-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
794#794olmo-3-1-32b-thinkAllen Institute for AI0%aa_slug=olmo-3-1-32b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
795#795Qwen3-VL-4B-InstructQwen0%aa_slug=qwen3-vl-4b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
796#796llama-3-3-nemotron-super-49bNVIDIA0%aa_slug=llama-3-3-nemotron-super-49b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
797#797gpt-oss-20bOpenAI0%aa_slug=gpt-oss-20b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
798#798gemma-3-270mGoogle0%aa_slug=gemma-3-270m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
799#799Gemini 2.5 ProGoogle0%aa_slug=gemini-2-5-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
800#800llama-3-instruct-8bMeta AI0%aa_slug=llama-3-instruct-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.