Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 3 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · apodex-1-1 1 row

Not enough history to chart — a single observation (69.66% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 69.66%aa_slug=apodex-1-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
1#1Claude Fable 5.1Anthropic91.39%aa_slug=claude-fable-5-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
2#2claude-fable-5-1-xhighAnthropic91.01%aa_slug=claude-fable-5-1-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
3#3gpt-6-astra-highOpenAI89.89%aa_slug=gpt-6-astra-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
4#4claude-fable-5-1-highAnthropic89.89%aa_slug=claude-fable-5-1-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
5#5gpt-5-6-sol-xhighOpenAI89.51%aa_slug=gpt-5-6-sol-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
6#6gpt-6-astra-mediumOpenAI89.51%aa_slug=gpt-6-astra-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
7#7gpt-6-astra-xhighOpenAI89.14%aa_slug=gpt-6-astra-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
8#8gpt-6-astra-non-reasoningOpenAI89.14%aa_slug=gpt-6-astra-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
9#9Claude Opus 5Anthropic89.14%aa_slug=claude-opus-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
10#10Grok 4.6xAI88.39%aa_slug=grok-4-6 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
11#11gpt-6-astraOpenAI88.39%aa_slug=gpt-6-astra · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
12#12grok-4-6-xhighSpaceXAI88.01%aa_slug=grok-4-6-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
13#13gpt-6-astra-lowOpenAI88.01%aa_slug=gpt-6-astra-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
14#14gpt-5.6-terraOpenAI88.01%aa_slug=gpt-5-6-terra · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
15#15claude-fable-5-1-mediumAnthropic88.01%aa_slug=claude-fable-5-1-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
16#16gpt-5-6-solOpenAI88.01%aa_slug=gpt-5-6-sol · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
17#17claude-opus-5-xhighAnthropic88.01%aa_slug=claude-opus-5-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
18#18claude-opus-5-highAnthropic87.64%aa_slug=claude-opus-5-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
19#19Gemini 3.8 FlashGoogle87.64%aa_slug=gemini-3-8-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
20#20gpt-5-6-sol-highOpenAI87.27%aa_slug=gpt-5-6-sol-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
21#21gpt-5-6-sol-mediumOpenAI86.14%aa_slug=gpt-5-6-sol-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
22#22claude-opus-5-mediumAnthropic86.14%aa_slug=claude-opus-5-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
23#23Qwen3.8 FlashQwen86.14%aa_slug=qwen3-8-flash-next · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
24#24Gemini 3.7 FlashGoogle85.77%aa_slug=gemini-3-7-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
25#25muse-spark-1-3-xhighMeta AI85.39%aa_slug=muse-spark-1-3-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
26#26Kimi K3Moonshot AI85.02%aa_slug=kimi-k3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
27#27claude-fable-5-1-lowAnthropic85.02%aa_slug=claude-fable-5-1-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
28#28Claude Fable 5Anthropic84.64%aa_slug=claude-fable-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
29#29Claude Opus 4.8Anthropic84.64%aa_slug=claude-opus-4-8 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
30#30grok-4-6-mediumSpaceXAI84.27%aa_slug=grok-4-6-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
31#31GLM 5.3 FlashZ.ai (Zhipu AI)84.27%aa_slug=glm-5-3-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
32#32gpt-5.5OpenAI84.27%aa_slug=gpt-5-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
33#33Muse Spark 1.3Meta AI84.27%aa_slug=muse-spark-1-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
34#34GLM 5.3Z.ai (Zhipu AI)83.9%aa_slug=glm-5-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
35#35gemini-3-8-flash-mediumGoogle83.9%aa_slug=gemini-3-8-flash-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
36#36gemini-3-8-flash-lowGoogle83.15%aa_slug=gemini-3-8-flash-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
37#37Claude Opus 4.7Anthropic83.15%aa_slug=claude-opus-4-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
38#38kimi-k3-lowMoonshot AI82.4%aa_slug=kimi-k3-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
39#39agnes-3-0-flashSapiens AI82.02%aa_slug=agnes-3-0-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
40#40Qwen3.8 2.4T A95BQwen82.02%aa_slug=qwen3-8-2-4t-a95b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
41#41Grok 4.5xAI81.65%aa_slug=grok-4-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
42#42Qwen 3.8 MaxQwen81.27%aa_slug=qwen3-8-max · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
43#43gpt-5.6-lunaOpenAI80.9%aa_slug=gpt-5-6-luna · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
44#44Claude Sonnet 5Anthropic80.52%aa_slug=claude-sonnet-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
45#45gpt-5-5-mediumOpenAI80.52%aa_slug=gpt-5-5-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
46#46gpt-5-6-terra-xhighOpenAI80.15%aa_slug=gpt-5-6-terra-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
47#47Muse Spark 1.2Meta AI80.15%aa_slug=muse-spark-1-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
48#48gemini-3-7-flash-lowGoogle79.78%aa_slug=gemini-3-7-flash-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
49#49Qwen3.8 27BQwen79.78%aa_slug=qwen3-8-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
50#50gpt-5-5-highOpenAI79.4%aa_slug=gpt-5-5-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
51#51deepseek-v4-flashDeepSeek78.65%aa_slug=deepseek-v4-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
52#52deepseek-v4-proDeepSeek78.65%aa_slug=deepseek-v4-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
53#53Gemini 3.5 FlashGoogle78.65%aa_slug=gemini-3-5-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
54#54gemini-3-7-flash-mediumGoogle78.28%aa_slug=gemini-3-7-flash-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
55#55gpt-5.4OpenAI78.28%aa_slug=gpt-5-4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
56#56Z.ai GLM 5.2Z.ai (Zhipu AI)77.9%aa_slug=glm-5-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
57#57gpt-5-6-luna-xhighOpenAI77.9%aa_slug=gpt-5-6-luna-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
58#58Muse Spark 1.1Meta AI77.9%aa_slug=muse-spark-1-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
59#59Gemini 3.6 FlashGoogle77.53%aa_slug=gemini-3-6-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
60#60gpt-5-6-sol-lowOpenAI76.78%aa_slug=gpt-5-6-sol-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
61#61claude-opus-5-lowAnthropic76.4%aa_slug=claude-opus-5-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
62#62gpt-5-6-terra-highOpenAI75.66%aa_slug=gpt-5-6-terra-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
63#63claude-sonnet-5-non-reasoningAnthropic75.28%aa_slug=claude-sonnet-5-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
64#64grok-4-6-lowSpaceXAI75.28%aa_slug=grok-4-6-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
65#65motif-3Motif Technologies74.91%aa_slug=motif-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
66#66Qwen3.7 MaxQwen74.53%aa_slug=qwen3-7-max · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
67#67gpt-5-6-sol-non-reasoningOpenAI74.16%aa_slug=gpt-5-6-sol-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
68#68deepseek-v4-flash-visionDeepSeek74.16%aa_slug=deepseek-v4-flash-vision · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
69#69Gemini 3.1 Pro PreviewGoogle73.78%aa_slug=gemini-3-1-pro-preview · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
70#70gpt-5-6-terra-mediumOpenAI72.28%aa_slug=gpt-5-6-terra-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
71#71k2-horizon-375b-a23bMBZUAI Institute of Foundation Models71.91%aa_slug=k2-horizon-375b-a23b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
72#72claude-sonnet-4-6-adaptiveAnthropic71.16%aa_slug=claude-sonnet-4-6-adaptive · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
73#73motif-0714Motif Technologies70.79%aa_slug=motif-0714 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
74#74KAT-Coder-Pro V2Kwaipilot70.04%aa_slug=kat-coder-pro-v2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
75#75apodex-1-1Apodex69.66%aa_slug=apodex-1-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
76#76agnes-2-5-pro-betaSapiens AI69.66%aa_slug=agnes-2-5-pro-beta · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
77#77gpt-5-6-luna-highOpenAI69.66%aa_slug=gpt-5-6-luna-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
78#78quasar-438bMultiverse Computing69.29%aa_slug=quasar-438b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
79#79nex-n2-proNex AGI67.79%aa_slug=nex-n2-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
80#80qwen3-8-27b-lowAlibaba Group67.42%aa_slug=qwen3-8-27b-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
81#81Kimi K2.7 CodeMoonshot AI67.42%aa_slug=kimi-k2-7-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
82#82agnes-2-5-pro-alphaSapiens AI67.04%aa_slug=agnes-2-5-pro-alpha · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
83#83Kimi K2.6Moonshot AI65.92%aa_slug=kimi-k2-6 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
84#84gpt-5-6-solOpenAI65.91%aa_slug=gpt-5-6-sol · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
85#85gpt-5-5-lowOpenAI65.54%aa_slug=gpt-5-5-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
86#86MiniMax M3MiniMax65.17%aa_slug=minimax-m3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
87#87MiMo-V2.5-ProXiaomi65.17%aa_slug=mimo-v2-5-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
88#88qwen3-8-27b-mediumAlibaba Group65.17%aa_slug=qwen3-8-27b-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
89#89deepseek-v4-pro-0424-highDeepSeek64.79%aa_slug=deepseek-v4-pro-0424-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
90#90Hy3Tencent64.42%aa_slug=hy3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
91#91Ling 3.0 Flash VLinclusionAI64.42%aa_slug=ling-3-0-flash-vl · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
92#92deepseek-v4-pro-0424DeepSeek64.04%aa_slug=deepseek-v4-pro-0424 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
93#93MiMo-V2.5Xiaomi63.67%aa_slug=mimo-v2-5-0424 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
94#94gpt-5-6-terra-xhighOpenAI62.88%aa_slug=gpt-5-6-terra-xhigh · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
95#95Claude Fable 5Anthropic62.88%aa_slug=claude-fable-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
96#96gpt-5-6-sol-mediumOpenAI62.88%aa_slug=gpt-5-6-sol-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
97#97gpt-5-6-terra-lowOpenAI62.55%aa_slug=gpt-5-6-terra-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
98#98muse-sparkMeta AI62.17%aa_slug=muse-spark · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
99#99gpt-5-6-sol-highOpenAI62.12%aa_slug=gpt-5-6-sol-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
100#100deepseek-v4-flash-0420DeepSeek61.8%aa_slug=deepseek-v4-flash-0420 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.