Skip to content
AI Atlas
BenchmarkActivecategory · agentic

Terminal-Bench

tbench.ai

terminal tasks solved by agents

quality57

Updated 8 h ago · first seen 11 Sept 2026

bench_01M293SPFPKK4MF90JEDK0PH8C

Metric
accuracy · %
Direction
Higher is better
Results
821
Leader
Claude Fable 5.1 91.39%

Score history · gemini-2-5-flash-preview-09-2025-reasoning 1 row

Not enough history to chart — a single observation (16.67% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 16.67%aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 821 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
101#101deepseek-v4-flash-0420DeepSeek61.8%aa_slug=deepseek-v4-flash-0420 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
102#102GLM 5.1Z.ai (Zhipu AI)61.8%aa_slug=glm-5-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
103#103Qwen3.6 PlusQwen61.42%aa_slug=qwen3-6-plus · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
104#104gpt-5-6-sol-xhighOpenAI61.36%aa_slug=gpt-5-6-sol-xhigh · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
105#105gpt-5-5-non-reasoningOpenAI61.05%aa_slug=gpt-5-5-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
106#106Qwen 3.7 PlusQwen61.05%aa_slug=qwen3-7-plus · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
107#107gpt-5.4-nanoOpenAI60.67%aa_slug=gpt-5-4-nano · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
108#108Qwen3.6 27BQwen60.67%aa_slug=qwen3-6-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
109#109gpt-5.5OpenAI60.61%aa_slug=gpt-5-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
110#110gpt-5-6-sol-lowOpenAI60.61%aa_slug=gpt-5-6-sol-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
111#111gpt-5-5-highOpenAI59.85%aa_slug=gpt-5-5-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
112#112gpt-6-astra-xhighOpenAI59.6%aa_slug=gpt-6-astra-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
113#113jt-4-1-flash-236b-a21bChina Mobile59.55%aa_slug=jt-4-1-flash-236b-a21b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
114#114gpt-5.4-miniOpenAI59.18%aa_slug=gpt-5-4-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
115#115gpt-6-astraOpenAI59.09%aa_slug=gpt-6-astra · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
116#116Claude Opus 4.8Anthropic58.33%aa_slug=claude-opus-4-8 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
117#117gpt-5.6-terraOpenAI57.58%aa_slug=gpt-5-6-terra · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
118#118gpt-5.4OpenAI57.58%aa_slug=gpt-5-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
119#119gpt-5-6-terra-highOpenAI57.58%aa_slug=gpt-5-6-terra-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
120#120gpt-5-5-mediumOpenAI57.58%aa_slug=gpt-5-5-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
121#121Solar Pro 4Upstage57.3%aa_slug=solar-pro4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
122#122deepseek-v4-flash-0420-highDeepSeek56.93%aa_slug=deepseek-v4-flash-0420-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
123#123gpt-5-6-terra-non-reasoningOpenAI56.18%aa_slug=gpt-5-6-terra-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
124#124claude-4-5-sonnet-thinkingAnthropic55.81%aa_slug=claude-4-5-sonnet-thinking · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
125#125MiniMax M2.7MiniMax55.43%aa_slug=minimax-m2-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
126#126Ling 3.0 FlashinclusionAI55.43%aa_slug=ling-3-0-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
127#127Inkling SmallThinking Machines55.06%aa_slug=inkling-small · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
128#128InklingThinking Machines55.06%aa_slug=inkling · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
129#129claude-fable-5-1-xhighAnthropic55.05%aa_slug=claude-fable-5-1-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
130#130claude-opus-4-7-non-reasoningAnthropic54.55%aa_slug=claude-opus-4-7-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
131#131gpt-6-astra-highOpenAI54.04%aa_slug=gpt-6-astra-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
132#132Nemotron 3 UltraNVIDIA53.93%aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
133#133Gemini 3.1 Pro PreviewGoogle53.79%aa_slug=gemini-3-1-pro-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
134#134Gemini 3.5 Flash-LiteGoogle53.56%aa_slug=gemini-3-5-flash-lite · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
135#135gpt-5-6-luna-mediumOpenAI53.18%aa_slug=gpt-5-6-luna-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
136#136gpt-5.3-codexOpenAI53.03%aa_slug=gpt-5-3-codex · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
137#137claude-sonnet-4-6-adaptiveAnthropic53.03%aa_slug=claude-sonnet-4-6-adaptive · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
138#138gpt-5.1OpenAI52.43%aa_slug=gpt-5-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
139#139gpt-5.4-miniOpenAI52.27%aa_slug=gpt-5-4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
140#140gpt-5-5-lowOpenAI52.27%aa_slug=gpt-5-5-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
141#141grok-build-0-1-06-16SpaceXAI52.06%aa_slug=grok-build-0-1-06-16 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
142#142claude-fable-5-1-highAnthropic52.02%aa_slug=claude-fable-5-1-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
143#143Claude Fable 5.1Anthropic52.02%aa_slug=claude-fable-5-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
144#144Muse Glimmer 30BMeta AI51.69%aa_slug=muse-glimmer · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
145#145glm-5-2-non-reasoningZ.ai (Zhipu AI)51.69%aa_slug=glm-5-2-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
146#146Claude Opus 4.7Anthropic51.52%aa_slug=claude-opus-4-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
147#147qwen3-6-27b-non-reasoningAlibaba Group51.31%aa_slug=qwen3-6-27b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
148#148Qwen3.5 397B A17BQwen51.31%aa_slug=qwen3-5-397b-a17b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
149#149Z.ai GLM 5.2Z.ai (Zhipu AI)50.76%aa_slug=glm-5-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
150#150Qwen3.7 MaxQwen50.76%aa_slug=qwen3-7-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
151#151Mistral Medium 3.5Mistral AI50.56%aa_slug=mistral-medium-3-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
152#152gpt-6-astra-non-reasoningOpenAI50.51%aa_slug=gpt-6-astra-non-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
153#153LongCat 2.0Meituan50.19%aa_slug=longcat-2-0 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
154#154gpt-6-astra-mediumOpenAI49.49%aa_slug=gpt-6-astra-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
155#155glm-4-6-reasoningZ.ai (Zhipu AI)49.44%aa_slug=glm-4-6-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
156#156KAT-Coder-Pro V2Kwaipilot49.24%aa_slug=kat-coder-pro-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
157#157gpt-5-5-non-reasoningOpenAI49.24%aa_slug=gpt-5-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
158#158qwen3-8-27b-non-reasoningAlibaba Group49.06%aa_slug=qwen3-8-27b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
159#159Claude Opus 5Anthropic48.99%aa_slug=claude-opus-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
160#160Claude Opus 4.6Anthropic48.48%aa_slug=claude-opus-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
161#161Qwen3.5-122B-A10BQwen47.57%aa_slug=qwen3-5-122b-a10b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
162#162qwen3-5-122b-a10b-non-reasoningAlibaba Group47.19%aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
163#163claude-opus-4-5-thinkingAnthropic46.97%aa_slug=claude-opus-4-5-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
164#164gpt-5.2OpenAI46.97%aa_slug=gpt-5-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
165#165Qwen 3.7 PlusQwen46.97%aa_slug=qwen3-7-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
166#166DeepSeek V3.2DeepSeek46.82%aa_slug=deepseek-v3-2-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
167#167claude-opus-5-xhighAnthropic46.46%aa_slug=claude-opus-5-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
168#168claude-opus-4-6-adaptiveAnthropic46.21%aa_slug=claude-opus-4-6-adaptive · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
169#169deepseek-v4-pro-0424DeepSeek46.21%aa_slug=deepseek-v4-pro-0424 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
170#170gemini-3-5-flash-minimalGoogle46.21%aa_slug=gemini-3-5-flash-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
171#171Claude Sonnet 4.6Anthropic46.21%aa_slug=claude-sonnet-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
172#172claude-opus-5-highAnthropic45.96%aa_slug=claude-opus-5-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
173#173Kimi K2.5Moonshot AI45.69%aa_slug=kimi-k2-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
174#174muse-sparkMeta AI45.45%aa_slug=muse-spark · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
175#175gpt-5.1OpenAI45.45%aa_slug=gpt-5-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
176#176GLM 4.7Z.ai (Zhipu AI)45.32%aa_slug=glm-4-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
177#177claude-fable-5-1-mediumAnthropic44.95%aa_slug=claude-fable-5-1-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
178#178Qwen3.6 35B A3BQwen44.94%aa_slug=qwen3-6-35b-a3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
179#179deepseek-v3-1-terminus-reasoningDeepSeek44.94%aa_slug=deepseek-v3-1-terminus-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
180#180Kimi K2.7 CodeMoonshot AI44.7%aa_slug=kimi-k2-7-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
181#181solar-open2-250bUpstage44.19%aa_slug=solar-open2-250b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
182#182claude-4-5-haiku-reasoningAnthropic44.19%aa_slug=claude-4-5-haiku-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
183#183Kimi K2.6Moonshot AI43.94%aa_slug=kimi-k2-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
184#184Qwen3.6 Max PreviewQwen43.94%aa_slug=qwen3-6-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
185#185Qwen3.6 PlusQwen43.94%aa_slug=qwen3-6-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
186#186gpt-5-6-terra-lowOpenAI43.94%aa_slug=gpt-5-6-terra-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
187#187gpt-5-6-luna-lowOpenAI43.45%aa_slug=gpt-5-6-luna-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
188#188Gemma 4 31BGoogle43.45%aa_slug=gemma-4-31b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
189#189GLM 5.1Z.ai (Zhipu AI)43.18%aa_slug=glm-5-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
190#190GLM 5Z.ai (Zhipu AI)43.18%aa_slug=glm-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
191#191gpt-5-2-mediumOpenAI43.18%aa_slug=gpt-5-2-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
192#192gpt-5-4-lowOpenAI43.18%aa_slug=gpt-5-4-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
193#193MiMo-V2.5-ProXiaomi43.18%aa_slug=mimo-v2-5-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
194#194ring-2-6-1tinclusionAI43.07%aa_slug=ring-2-6-1t · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
195#195gpt-5.4-nanoOpenAI42.42%aa_slug=gpt-5-4-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
196#196claude-sonnet-4-6-non-reasoning-low-effortAnthropic42.42%aa_slug=claude-sonnet-4-6-non-reasoning-low-effort · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
197#197Claude Fable 5Anthropic42.42%aa_slug=claude-fable-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
198#198gpt-5-5-instant-05-26OpenAI42.42%aa_slug=gpt-5-5-instant-05-26 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
199#199MiniMax M3MiniMax42.42%aa_slug=minimax-m3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
200#200gpt-6-astra-lowOpenAI41.92%aa_slug=gpt-6-astra-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.

The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.