Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 7 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 432 filtered
Leader
Claude Fable 5.1 91.39%

Score history · mimo-v2-flash 2 rows

Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.

  • 25.76%aa_slug=mimo-v2-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
  • 61.8%aa_slug=mimo-v2-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 432 current results · config contains “hard”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
201#201gemini-2-5-flash-preview-09-2025-reasoningGoogle16.67%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
202#202Mistral Large 3Mistral AI15.91%aa_slug=mistral-large-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
203#203deepseek-r1DeepSeek15.91%aa_slug=deepseek-r1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
204#204Kimi K2 0711Moonshot AI15.91%aa_slug=kimi-k2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
205#205o4-miniOpenAI15.15%aa_slug=o4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
206#206qwen3-235b-a22b-instruct-2507Alibaba Group15.15%aa_slug=qwen3-235b-a22b-instruct-2507 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
207#207Qwen3 Coder 30B A3B InstructQwen15.15%aa_slug=qwen3-coder-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
208#208DeepSeek V3 0324DeepSeek15.15%aa_slug=deepseek-v3-0324 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
209#209grok-4-1-fastSpaceXAI14.39%aa_slug=grok-4-1-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
210#210gpt-5-mini-minimalOpenAI14.39%aa_slug=gpt-5-mini-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
211#211gemini-2-5-flash-preview-09-2025Google14.39%aa_slug=gemini-2-5-flash-preview-09-2025 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
212#212GLM 4.6VZ.ai (Zhipu AI)14.39%aa_slug=glm-4-6v-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
213#213apriel-v1-6-15b-thinkerServiceNow14.39%aa_slug=apriel-v1-6-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
214#214gemini-2-5-flash-reasoningGoogle13.64%aa_slug=gemini-2-5-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
215#215gpt-4.1OpenAI13.64%aa_slug=gpt-4-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
216#216Qwen3 235B A22B Instruct 2507Qwen13.64%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
217#217nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA13.64%aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
218#218Gemma 4 26B A4BGoogle13.64%aa_slug=gemma-4-26b-a4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
219#219gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle12.88%aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
220#220Magistral Medium 1.2Mistral AI12.88%aa_slug=magistral-medium-2509 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
221#221gpt-5-chatgptOpenAI12.88%aa_slug=gpt-5-chatgpt · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
222#222o1OpenAI12.88%aa_slug=o1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
223#223hyperclova-x-seed-think-32bNaver12.12%aa_slug=hyperclova-x-seed-think-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
224#224gpt-5-nanoOpenAI12.12%aa_slug=gpt-5-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
225#225Nemotron 3 Nano 30B A3BNVIDIA12.12%aa_slug=nvidia-nemotron-3-nano-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
226#226grok-4-fastSpaceXAI12.12%aa_slug=grok-4-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
227#227Gemini 2.5 FlashGoogle12.12%aa_slug=gemini-2-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
228#228qwen3-5-4b-non-reasoningAlibaba Group11.36%aa_slug=qwen3-5-4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
229#229Kimi-Linear-48B-A3B-InstructMoonshot AI11.36%aa_slug=kimi-linear-48b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
230#230qwen3-vl-235b-a22b-reasoningAlibaba Group11.36%aa_slug=qwen3-vl-235b-a22b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
231#231grok-3SpaceXAI11.36%aa_slug=grok-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
232#232Hermes 4 405BNous Research11.36%aa_slug=hermes-4-llama-3-1-405b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
233#233gemma-4-12b-non-reasoningGoogle11.36%aa_slug=gemma-4-12b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
234#234ling-1tinclusionAI10.61%aa_slug=ling-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
235#235gpt-oss-20bOpenAI10.61%aa_slug=gpt-oss-20b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
236#236Mistral Medium 3.1Mistral AI10.61%aa_slug=mistral-medium-3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
237#237qwen3-5-35b-a3b-non-reasoningAlibaba Group10.61%aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
238#238mistral-small-4-non-reasoningMistral AI10.61%aa_slug=mistral-small-4-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
239#239longcat-flash-liteLongCat10.61%aa_slug=longcat-flash-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
240#240apriel-v1-5-15b-thinkerServiceNow10.61%aa_slug=apriel-v1-5-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
241#241ling-flash-2-0inclusionAI10.61%aa_slug=ling-flash-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
242#242qwen3-next-80b-a3b-reasoningAlibaba Group9.85%aa_slug=qwen3-next-80b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
243#243k2-v2MBZUAI Institute of Foundation Models9.85%aa_slug=k2-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
244#244hermes-4-llama-3-1-405bNous Research9.85%aa_slug=hermes-4-llama-3-1-405b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
245#245devstral-mediumMistral AI9.09%aa_slug=devstral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
246#246intellect-3Prime Intellect9.09%aa_slug=intellect-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
247#247kat-coder-pro-v1KwaiKAT9.09%aa_slug=kat-coder-pro-v1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
248#248magistral-mediumMistral AI9.09%aa_slug=magistral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
249#249Qwen3 VL 32B InstructQwen8.33%aa_slug=qwen3-vl-32b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
250#250nemotron-3-nano-omni-30b-a3bNVIDIA8.33%aa_slug=nemotron-3-nano-omni-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
251#251gemma-4-E4BGoogle8.33%aa_slug=gemma-4-e4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
252#252k2-v2-mediumMBZUAI Institute of Foundation Models8.33%aa_slug=k2-v2-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
253#253qwen3-5-omni-flashAlibaba Group8.33%aa_slug=qwen3-5-omni-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
254#254GPT-4o (2024-08-06)OpenAI8.33%aa_slug=gpt-4o-2024-08-06 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
255#255gpt-4oOpenAI8.33%aa_slug=gpt-4o · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
256#256gemini-2-5-flash-lite-preview-09-2025Google7.58%aa_slug=gemini-2-5-flash-lite-preview-09-2025 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
257#257Solar Pro 3Upstage7.58%aa_slug=solar-pro-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
258#258Qwen3 Next 80B A3B InstructQwen7.58%aa_slug=qwen3-next-80b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
259#259gpt-4.1-miniOpenAI7.58%aa_slug=gpt-4-1-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
260#260Mistral Small 3.1Mistral AI7.58%aa_slug=mistral-small-3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
261#261ring-flash-2-0inclusionAI7.58%aa_slug=ring-flash-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
262#262qwen3-vl-32b-reasoningAlibaba Group7.58%aa_slug=qwen3-vl-32b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
263#263gemma-4-e4b-non-reasoningGoogle7.58%aa_slug=gemma-4-e4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
264#264k-exaone-non-reasoningLG AI Research6.82%aa_slug=k-exaone-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
265#265nova-premierAmazon Web Services6.82%aa_slug=nova-premier · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
266#266gpt-5-nano-minimalOpenAI6.82%aa_slug=gpt-5-nano-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
267#267qwen3-30b-a3b-instructAlibaba Group6.82%aa_slug=qwen3-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
268#268nvidia-nemotron-3-nano-4bNVIDIA6.82%aa_slug=nvidia-nemotron-3-nano-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
269#269ring-1tinclusionAI6.82%aa_slug=ring-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
270#270nova-2-0-liteAmazon Web Services6.82%aa_slug=nova-2-0-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
271#271Seed-OSS-36B-InstructByteDance6.82%aa_slug=seed-oss-36b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
272#272k2-think-v2MBZUAI Institute of Foundation Models6.82%aa_slug=k2-think-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
273#273Llama-3.1-405BMeta AI6.82%aa_slug=llama-3-1-instruct-405b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
274#274deepseek-v3DeepSeek6.82%aa_slug=deepseek-v3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
275#275Mistral Small 3.2Mistral AI6.82%aa_slug=mistral-small-3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
276#276glm-4-5vZ.ai (Zhipu AI)6.82%aa_slug=glm-4-5v · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
277#277o3-miniOpenAI6.82%aa_slug=o3-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
278#278Qwen3 VL 235B A22B InstructQwen6.82%aa_slug=qwen3-vl-235b-a22b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
279#279Llama 4 MaverickMeta AI6.82%aa_slug=llama-4-maverick · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
280#280nova-2-0-omniAmazon Web Services6.82%aa_slug=nova-2-0-omni · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
281#281Devstral Small 1.0Mistral AI6.06%aa_slug=devstral-small-2505 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
282#282deepseek-r1-0120DeepSeek6.06%aa_slug=deepseek-r1-0120 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
283#283nova-proAmazon Web Services6.06%aa_slug=nova-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
284#284o3 Mini HighOpenAI6.06%aa_slug=o3-mini-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
285#285qwen3-30b-a3b-2507Alibaba Group6.06%aa_slug=qwen3-30b-a3b-2507 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
286#286Qwen3 VL 30B A3B InstructQwen6.06%aa_slug=qwen3-vl-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
287#287qwen3-235b-a22b-instruct-reasoningAlibaba Group6.06%aa_slug=qwen3-235b-a22b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
288#288mistral-large-2Mistral AI6.06%aa_slug=mistral-large-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
289#289devstral-smallMistral AI6.06%aa_slug=devstral-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
290#290qwen3-235b-a22b-instructAlibaba Group6.06%aa_slug=qwen3-235b-a22b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
291#291ernie-4-5-300b-a47bBaidu6.06%aa_slug=ernie-4-5-300b-a47b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
292#292llama-nemotron-super-49b-v1-5-reasoningNVIDIA5.3%aa_slug=llama-nemotron-super-49b-v1-5-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
293#293qwen3-vl-30b-a3b-reasoningAlibaba Group5.3%aa_slug=qwen3-vl-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
294#294step-3-vl-10bStepFun5.3%aa_slug=step-3-vl-10b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
295#295gpt-oss-120b-lowOpenAI5.3%aa_slug=gpt-oss-120b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
296#296GLM 4.5VZ.ai (Zhipu AI)5.3%aa_slug=glm-4-5v-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
297#297qwen3-14b-instructAlibaba Group5.3%aa_slug=qwen3-14b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
298#298qwen3-30b-a3b-2507-reasoningAlibaba Group5.3%aa_slug=qwen3-30b-a3b-2507-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
299#299llama-3-1-nemotron-instruct-70bNVIDIA4.55%aa_slug=llama-3-1-nemotron-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
300#300qwen3-4b-2507-instructAlibaba Group4.55%aa_slug=qwen3-4b-2507-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.