Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 238 filtered
Leader
Claude Fable 5.1 91.39%

Score history · glm-5-non-reasoning 1 row

Not enough history to chart — a single observation (39.39% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 39.39%aa_slug=glm-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 238 current results · config contains “v2.1”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101Qwen3.6 27BQwen60.67%aa_slug=qwen3-6-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102gpt-5.4-nanoOpenAI60.67%aa_slug=gpt-5-4-nano · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103jt-4-1-flash-236b-a21bChina Mobile59.55%aa_slug=jt-4-1-flash-236b-a21b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104gpt-5.4-miniOpenAI59.18%aa_slug=gpt-5-4-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105Solar Pro 4Upstage57.3%aa_slug=solar-pro4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106deepseek-v4-flash-0420-highDeepSeek56.93%aa_slug=deepseek-v4-flash-0420-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107gpt-5-6-terra-non-reasoningOpenAI56.18%aa_slug=gpt-5-6-terra-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108claude-4-5-sonnet-thinkingAnthropic55.81%aa_slug=claude-4-5-sonnet-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109Ling 3.0 FlashinclusionAI55.43%aa_slug=ling-3-0-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110MiniMax M2.7MiniMax55.43%aa_slug=minimax-m2-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111Inkling SmallThinking Machines55.06%aa_slug=inkling-small · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112InklingThinking Machines55.06%aa_slug=inkling · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113Nemotron 3 UltraNVIDIA53.93%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114Gemini 3.5 Flash-LiteGoogle53.56%aa_slug=gemini-3-5-flash-lite · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115gpt-5-6-luna-mediumOpenAI53.18%aa_slug=gpt-5-6-luna-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116gpt-5.1OpenAI52.43%aa_slug=gpt-5-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117grok-build-0-1-06-16SpaceXAI52.06%aa_slug=grok-build-0-1-06-16 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118glm-5-2-non-reasoningZ.ai (Zhipu AI)51.69%aa_slug=glm-5-2-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119Muse Glimmer 30BMeta AI51.69%aa_slug=muse-glimmer · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120qwen3-6-27b-non-reasoningAlibaba Group51.31%aa_slug=qwen3-6-27b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121Qwen3.5 397B A17BQwen51.31%aa_slug=qwen3-5-397b-a17b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122Mistral Medium 3.5Mistral AI50.56%aa_slug=mistral-medium-3-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123LongCat 2.0Meituan50.19%aa_slug=longcat-2-0 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124glm-4-6-reasoningZ.ai (Zhipu AI)49.44%aa_slug=glm-4-6-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125qwen3-8-27b-non-reasoningAlibaba Group49.06%aa_slug=qwen3-8-27b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126Qwen3.5-122B-A10BQwen47.57%aa_slug=qwen3-5-122b-a10b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127qwen3-5-122b-a10b-non-reasoningAlibaba Group47.19%aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128DeepSeek V3.2DeepSeek46.82%aa_slug=deepseek-v3-2-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129Kimi K2.5Moonshot AI45.69%aa_slug=kimi-k2-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130GLM 4.7Z.ai (Zhipu AI)45.32%aa_slug=glm-4-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131Qwen3.6 35B A3BQwen44.94%aa_slug=qwen3-6-35b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132deepseek-v3-1-terminus-reasoningDeepSeek44.94%aa_slug=deepseek-v3-1-terminus-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133solar-open2-250bUpstage44.19%aa_slug=solar-open2-250b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134claude-4-5-haiku-reasoningAnthropic44.19%aa_slug=claude-4-5-haiku-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135gpt-5-6-luna-lowOpenAI43.45%aa_slug=gpt-5-6-luna-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136Gemma 4 31BGoogle43.45%aa_slug=gemma-4-31b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137ring-2-6-1tinclusionAI43.07%aa_slug=ring-2-6-1t · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138qwen3-6-35b-a3b-non-reasoningAlibaba Group41.57%aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139qwen3-5-35b-a3b-non-reasoningAlibaba Group40.82%aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140k-exaone-2-0-0803LG AI Research40.45%aa_slug=k-exaone-2-0-0803 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141Grok 4.3xAI39.7%aa_slug=grok-4-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142Step 3.7 FlashStepFun39.33%aa_slug=step-3-7-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143gpt-5-6-luna-non-reasoningOpenAI38.95%aa_slug=gpt-5-6-luna-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144Gemma 4 26B A4BGoogle38.95%aa_slug=gemma-4-26b-a4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145a-x-k2SK Telecom38.95%aa_slug=a-x-k2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146Nemotron 3 SuperNVIDIA38.58%aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147Qwen3 Coder NextQwen38.2%aa_slug=qwen3-coder-next · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
148#148claude-4-sonnet-thinkingAnthropic36.33%aa_slug=claude-4-sonnet-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
149#149North Mini Code (free)Cohere35.58%aa_slug=north-mini-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
150#150gpt-5OpenAI35.21%aa_slug=gpt-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
151#151gpt-5-5-instant-06-26OpenAI34.83%aa_slug=gpt-5-5-instant-06-26 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
152#152grok-4-3-non-reasoningSpaceXAI34.08%aa_slug=grok-4-3-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
153#153g9v3-39a5bAI9Stars32.58%aa_slug=g9v3-39a5b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
154#154gemini-3-1-flash-lite-previewGoogle31.09%aa_slug=gemini-3-1-flash-lite-preview · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
155#155k-exaoneLG AI Research30.34%aa_slug=k-exaone · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
156#156Devstral 2Mistral AI30.34%aa_slug=devstral-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
157#157Devstral Small 2Mistral AI29.59%aa_slug=devstral-small-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
158#158nova-2-0-pro-reasoning-mediumAmazon Web Services29.59%aa_slug=nova-2-0-pro-reasoning-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
159#159Qwen3.5-9BQwen29.21%aa_slug=qwen3-5-9b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
160#160gemma-4-31b-non-reasoningGoogle29.21%aa_slug=gemma-4-31b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
161#161Gemini 2.5 ProGoogle28.46%aa_slug=gemini-2-5-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
162#162ling-3-0-tinyinclusionAI27.72%aa_slug=ling-3-0-tiny · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
163#163gemma-4-12BGoogle27.34%aa_slug=gemma-4-12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
164#164Mercury 2Inception27.34%aa_slug=mercury-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
165#165granite-4.2-30bIBM26.59%aa_slug=granite-4-2-30b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
166#166Mistral Small 3.1Mistral AI26.22%aa_slug=mistral-small-3-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
167#167gpt-oss-120bOpenAI26.22%aa_slug=gpt-oss-120b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
168#168Qwen3.5-4BQwen25.84%aa_slug=qwen3-5-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
169#169Nemotron 3.5 LightningNVIDIA24.34%aa_slug=nemotron-3-5-lightning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
170#170ling-2-6-flashinclusionAI24.34%aa_slug=ling-2-6-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
171#171command-a-plusCohere22.85%aa_slug=command-a-plus · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
172#172qwen3-5-9b-non-reasoningAlibaba Group21.35%aa_slug=qwen3-5-9b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
173#173qwen3-5-4b-non-reasoningAlibaba Group21.35%aa_slug=qwen3-5-4b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
174#174exaone-4-5-33bLG AI Research21.35%aa_slug=exaone-4-5-33b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
175#175Mistral Small 4Mistral AI20.97%aa_slug=mistral-small-4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
176#176Trinity Large ThinkingArcee AI20.6%aa_slug=trinity-large-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
177#177nemotron-cascade-2-30b-a3bNVIDIA20.6%aa_slug=nemotron-cascade-2-30b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
178#178nova-2-0-pro-reasoning-lowAmazon Web Services19.48%aa_slug=nova-2-0-pro-reasoning-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
179#179deepseek-r1-0120DeepSeek19.1%aa_slug=deepseek-r1-0120 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
180#180Granite 4.2 8BIBM18.35%aa_slug=granite-4-2-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
181#181hypernova-60bMultiverse Computing18.35%aa_slug=hypernova-60b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
182#182nova-2-0-proAmazon Web Services17.23%aa_slug=nova-2-0-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
183#183deepseek-v3DeepSeek16.85%aa_slug=deepseek-v3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
184#184nova-2-0-lite-reasoningAmazon Web Services16.1%aa_slug=nova-2-0-lite-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
185#185k2-think-v2MBZUAI Institute of Foundation Models14.98%aa_slug=k2-think-v2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
186#186Mistral Medium 3.1Mistral AI13.86%aa_slug=mistral-medium-3-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
187#187DeepSeek V3 0324DeepSeek13.86%aa_slug=deepseek-v3-0324 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
188#188granite-4.2-3bIBM13.86%aa_slug=granite-4-2-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
189#189gpt-oss-20bOpenAI13.86%aa_slug=gpt-oss-20b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
190#190gpt-oss-120b-lowOpenAI13.86%aa_slug=gpt-oss-120b-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
191#191diffusiongemma-26b-a4bGoogle12.36%aa_slug=diffusiongemma-26b-a4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
192#192Magistral Medium 1.2Mistral AI12.36%aa_slug=magistral-medium-2509 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
193#193Solar Pro 3Upstage11.99%aa_slug=solar-pro-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
194#194Qwen3 235B A22B Instruct 2507Qwen11.99%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
195#195Mistral Large 3Mistral AI11.99%aa_slug=mistral-large-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
196#196celeris-1Celeris11.24%aa_slug=celeris-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
197#197Claude Haiku 3.5Anthropic10.11%aa_slug=claude-3-5-haiku · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
198#198gpt-4.1-miniOpenAI10.11%aa_slug=gpt-4-1-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
199#199Ministral 3 14BMistral AI9.74%aa_slug=ministral-3-14b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
200#200minicpm5-2bOpenBMB8.61%aa_slug=minicpm5-2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.