Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821 · 432 filtered
Leader
Claude Fable 5.1 91.39%

Score history · nova-2-0-omni 1 row

Not enough history to chart — a single observation (6.82% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 6.82%aa_slug=nova-2-0-omni · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 432 current results · config contains “hard”

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
301#301Ministral 3 14BMistral AI4.55%aa_slug=ministral-3-14b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
302#302Magistral Small 1.2Mistral AI4.55%aa_slug=magistral-small-2509 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
303#303qwen2-5-72b-instructAlibaba Group4.55%aa_slug=qwen2-5-72b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
304#304solar-pro-2Upstage4.55%aa_slug=solar-pro-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
305#305k2-v2-lowMBZUAI Institute of Foundation Models4.55%aa_slug=k2-v2-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
306#306nova-2-0-omni-reasoning-mediumAmazon Web Services4.55%aa_slug=nova-2-0-omni-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
307#307Gemini 2.5 Flash-LiteGoogle4.55%aa_slug=gemini-2-5-flash-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
308#308nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA4.55%aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
309#309LFM2.5-8B-A1BLiquid AI4.55%aa_slug=lfm2-5-8b-a1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
310#310magistral-smallMistral AI4.55%aa_slug=magistral-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
311#311Ministral 3 8BMistral AI4.55%aa_slug=ministral-3-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
312#312gpt-oss-20b-lowOpenAI4.55%aa_slug=gpt-oss-20b-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
313#313Hermes-4-70BNous Research4.55%aa_slug=hermes-4-llama-3-1-70b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
314#314motif-2-12-7bMotif Technologies3.79%aa_slug=motif-2-12-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
315#315llama-nemotron-super-49b-v1-5NVIDIA3.79%aa_slug=llama-nemotron-super-49b-v1-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
316#316Qwen3.5-2BQwen3.79%aa_slug=qwen3-5-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
317#317qwen3-omni-30b-a3b-reasoningAlibaba Group3.79%aa_slug=qwen3-omni-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
318#318nova-2-0-omni-reasoning-lowAmazon Web Services3.79%aa_slug=nova-2-0-omni-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
319#319qwen3-vl-8b-reasoningAlibaba Group3.79%aa_slug=qwen3-vl-8b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
320#320Mistral Medium 3Mistral AI3.79%aa_slug=mistral-medium-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
321#321Gemini 2.0 FlashGoogle3.79%aa_slug=gemini-2-0-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
322#322exaone-4-0-32b-reasoningLG AI Research3.79%aa_slug=exaone-4-0-32b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
323#323nova-2-0-lite-reasoning-lowAmazon Web Services3.79%aa_slug=nova-2-0-lite-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
324#324Qwen3 14BQwen3.79%aa_slug=qwen3-14b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
325#325gpt-4.1-nanoOpenAI3.79%aa_slug=gpt-4-1-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
326#326Phi 4Microsoft3.79%aa_slug=phi-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
327#327qwen3-5-2b-non-reasoningAlibaba Group3.79%aa_slug=qwen3-5-2b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
328#328Gemma 3 27BGoogle3.79%aa_slug=gemma-3-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
329#329glm-4-7-flash-non-reasoningZ.ai (Zhipu AI)3.79%aa_slug=glm-4-7-flash-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
330#330glm-4-6vZ.ai (Zhipu AI)3.03%aa_slug=glm-4-6v · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
331#331gemma-4-E2BGoogle3.03%aa_slug=gemma-4-e2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
332#332midm-250-pro-rsnsftKorea Telecom3.03%aa_slug=midm-250-pro-rsnsft · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
333#333MiniMax-M1-80kMiniMax3.03%aa_slug=minimax-m1-80k · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
334#334Qwen3 32BQwen3.03%aa_slug=qwen3-32b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
335#335solar-pro-2-reasoningUpstage3.03%aa_slug=solar-pro-2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
336#336Llama 3.3 70BMeta AI3.03%aa_slug=llama-3-3-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
337#337Llama-3.1-70BMeta AI3.03%aa_slug=llama-3-1-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
338#338jamba-1-7-largeAI21 Labs2.27%aa_slug=jamba-1-7-large · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
339#339granite-4.1-30bIBM2.27%aa_slug=granite-4-1-30b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
340#340Qwen3 8BQwen2.27%aa_slug=qwen3-8b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
341#341qwen3-8b-instructAlibaba Group2.27%aa_slug=qwen3-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
342#342gemini-2-5-flash-liteGoogle2.27%aa_slug=gemini-2-5-flash-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
343#343qwen3-30b-a3b-instruct-reasoningAlibaba Group2.27%aa_slug=qwen3-30b-a3b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
344#344Qwen3 VL 8B InstructQwen2.27%aa_slug=qwen3-vl-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
345#345solar-open-100b-reasoningUpstage2.27%aa_slug=solar-open-100b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
346#346MiniMax-M1-40kMiniMax2.27%aa_slug=minimax-m1-40k · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
347#347Claude Haiku 3.5Anthropic2.27%aa_slug=claude-3-5-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
348#348sarvam-m-reasoningSarvam2.27%aa_slug=sarvam-m-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
349#349gemma-4-e2b-non-reasoningGoogle2.27%aa_slug=gemma-4-e2b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
350#350granite-4-0-h-smallIBM2.27%aa_slug=granite-4-0-h-small · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
351#351falcon-h1r-7bTII UAE2.27%aa_slug=falcon-h1r-7b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
352#352sarvam-30bSarvam2.27%aa_slug=sarvam-30b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
353#353gemma-3n-e4bGoogle2.27%aa_slug=gemma-3n-e4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
354#354llama-3-1-nemotron-ultra-253b-v1-reasoningNVIDIA2.27%aa_slug=llama-3-1-nemotron-ultra-253b-v1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
355#355mi-dm-k-2-5-pro-dec28Korea Telecom2.27%aa_slug=mi-dm-k-2-5-pro-dec28 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
356#356tri-21b-think-previewTrillion Labs2.27%aa_slug=tri-21b-think-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
357#357granite-4.1-3bIBM2.27%aa_slug=granite-4-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
358#358R1 Distill Llama 70BDeepSeek1.52%aa_slug=deepseek-r1-distill-llama-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
359#359DeepSeek-R1-0528-Qwen3-8BDeepSeek1.52%aa_slug=deepseek-r1-qwen3-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
360#360qwen3-vl-4b-reasoningAlibaba Group1.52%aa_slug=qwen3-vl-4b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
361#361NVIDIA-Nemotron-Nano-9B-v2NVIDIA1.52%aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
362#362qwen3-4b-2507-instruct-reasoningAlibaba Group1.52%aa_slug=qwen3-4b-2507-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
363#363exaone-4-0-32bLG AI Research1.52%aa_slug=exaone-4-0-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
364#364olmo-3-32b-thinkAllen Institute for AI1.52%aa_slug=olmo-3-32b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
365#365sarvam-105bSarvam1.52%aa_slug=sarvam-105b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
366#366qwen3-omni-30b-a3b-instructAlibaba Group1.52%aa_slug=qwen3-omni-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
367#367nova-microAmazon Web Services1.52%aa_slug=nova-micro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
368#368Llama 4 ScoutMeta AI1.52%aa_slug=llama-4-scout · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
369#369Granite 4.0 MicroIBM1.52%aa_slug=granite-4-0-micro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
370#370jamba-reasoning-3bAI21 Labs0.76%aa_slug=jamba-reasoning-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
371#371Gemma 3 12BGoogle0.76%aa_slug=gemma-3-12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
372#372Claude 3 HaikuAnthropic0.76%aa_slug=claude-3-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
373#373nvidia-nemotron-nano-9b-v2NVIDIA0.76%aa_slug=nvidia-nemotron-nano-9b-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
374#374nova-liteAmazon Web Services0.76%aa_slug=nova-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
375#375tri-21b-think-v0-5Trillion Labs0.76%aa_slug=tri-21b-think-v0-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
376#376ling-mini-2-0inclusionAI0.76%aa_slug=ling-mini-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
377#377Olmo-3-7B-ThinkAllen Institute for AI0.76%aa_slug=olmo-3-7b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
378#378lfm2-2-6bLiquid AI0.76%aa_slug=lfm2-2-6b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
379#379llama-3-instruct-70bMeta AI0.76%aa_slug=llama-3-instruct-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
380#380gemma-3n-e2bGoogle0.76%aa_slug=gemma-3n-e2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
381#381Llama 3.1 8BMeta AI0.76%aa_slug=llama-3-1-instruct-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
382#382Command ACohere0.76%aa_slug=command-a · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
383#383Gemma 3 4BGoogle0.76%aa_slug=gemma-3-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
384#384llama-3-2-instruct-11b-visionMeta AI0.76%aa_slug=llama-3-2-instruct-11b-vision · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
385#385exaone-4-0-1-2bLG AI Research0%aa_slug=exaone-4-0-1-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
386#386Llama-3.2-1BMeta AI0%aa_slug=llama-3-2-instruct-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
387#387llama-3-instruct-8bMeta AI0%aa_slug=llama-3-instruct-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
388#388nanbeige4-1-3bNanbeige0%aa_slug=nanbeige4-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
389#389granite-4.1-8bIBM0%aa_slug=granite-4-1-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
390#390minicpm5-1bOpenBMB0%aa_slug=minicpm5-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
391#391apertus-8b-instructSwiss AI Initiative0%aa_slug=apertus-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
392#392Olmo-3-7B-InstructAllen Institute for AI0%aa_slug=olmo-3-7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
393#393olmo-3-1-32b-instructAllen Institute for AI0%aa_slug=olmo-3-1-32b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
394#394lfm2-8b-a1bLiquid AI0%aa_slug=lfm2-8b-a1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
395#395Ministral 3 3BMistral AI0%aa_slug=ministral-3-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
396#396phi-4-miniMicrosoft0%aa_slug=phi-4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
397#397granite-4-0-nano-1bIBM0%aa_slug=granite-4-0-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
398#398granite-4-0-h-350mIBM0%aa_slug=granite-4-0-h-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
399#399Qwen3.5-0.8BQwen0%aa_slug=qwen3-5-0-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
400#400lfm2-5-1-2b-thinkingLiquid AI0%aa_slug=lfm2-5-1-2b-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.