Updated 7 h ago · first seen 11 Sept 2026
bench_01M293SPFPKK4MF90JEDK0PH8C
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 821 · 432 filtered
- Leader
- Claude Fable 5.1 91.39%
Score history · Mistral Small 3.2 3 rows
Not enough history to chart — 3 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.
- 6.82%aa_slug=mistral-small-3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 5.62%aa_slug=mistral-small-3-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 0%aa_slug=mistral-small-3-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 432 current results · config contains “hard”
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #101step-3-5-flashStepFun | 32.58% | aa_slug=step-3-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #102DeepSeek V3DeepSeek | 32.58% | aa_slug=deepseek-v3-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #103Qwen3.5-27BQwen | 32.58% | aa_slug=qwen3-5-27b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #104GLM 5V TurboZ.ai (Zhipu AI) | 32.58% | aa_slug=glm-5v-turbo · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #105hy3-non-reasoningTencent | 31.82% | aa_slug=hy3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #106GLM 4.7Z.ai (Zhipu AI) | 31.82% | aa_slug=glm-4-7 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #107DeepSeek V3.1 TerminusDeepSeek | 31.82% | aa_slug=deepseek-v3-1-terminus · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #108qwen3-5-27b-non-reasoningAlibaba Group | 31.82% | aa_slug=qwen3-5-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #109gpt-5-2-non-reasoningOpenAI | 31.82% | aa_slug=gpt-5-2-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #110gemini-3-flashGoogle | 31.82% | aa_slug=gemini-3-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #111DeepSeek V3.2 ExpDeepSeek | 31.06% | aa_slug=deepseek-v3-2-reasoning-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #112mimo-v2-0206Xiaomi | 31.06% | aa_slug=mimo-v2-0206 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #113Claude Opus 4Anthropic | 31.06% | aa_slug=claude-4-opus-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #114ling-2-6-1tinclusionAI | 31.06% | aa_slug=ling-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #115Kimi K2 ThinkingMoonshot AI | 31.06% | aa_slug=kimi-k2-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #116Qwen3.5-122B-A10BQwen | 31.06% | aa_slug=qwen3-5-122b-a10b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #117claude-4-sonnet-thinkingAnthropic | 31.06% | aa_slug=claude-4-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #118North Mini Code (free)Cohere | 31.06% | aa_slug=north-mini-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #119grok-4-3-mediumSpaceXAI | 30.3% | aa_slug=grok-4-3-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #120glm-4-7-non-reasoningZ.ai (Zhipu AI) | 30.3% | aa_slug=glm-4-7-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #121gemma-4-31b-non-reasoningGoogle | 30.3% | aa_slug=gemma-4-31b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #122deepseek-v3-1-terminus-reasoningDeepSeek | 30.3% | aa_slug=deepseek-v3-1-terminus-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #123qwen3-5-122b-a10b-non-reasoningAlibaba Group | 29.55% | aa_slug=qwen3-5-122b-a10b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #124ring-2-6-1tinclusionAI | 28.79% | aa_slug=ring-2-6-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #125jt-35b-flashChina Mobile | 28.79% | aa_slug=jt-35b-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #126MiniMax M2.1MiniMax | 28.79% | aa_slug=minimax-m2-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #127Claude Sonnet 4.5Anthropic | 28.79% | aa_slug=claude-4-5-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #128GLM 4.6Z.ai (Zhipu AI) | 28.79% | aa_slug=glm-4-6 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #129Nemotron 3 SuperNVIDIA | 28.79% | aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #130gpt-5-mini-mediumOpenAI | 28.79% | aa_slug=gpt-5-mini-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #131mimo-v2-flash-reasoningXiaomi | 28.03% | aa_slug=mimo-v2-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #132Claude Haiku 4.5Anthropic | 27.27% | aa_slug=claude-4-5-haiku · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #133Step 3.5 FlashStepFun | 27.27% | aa_slug=step-3-5-flash-0202 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #134Claude Sonnet 4Anthropic | 27.27% | aa_slug=claude-4-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #135claude-4-5-haiku-reasoningAnthropic | 27.27% | aa_slug=claude-4-5-haiku-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #136grok-4-3-lowSpaceXAI | 26.52% | aa_slug=grok-4-3-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #137doubao-seed-codeByteDance | 26.52% | aa_slug=doubao-seed-code · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #138gpt-5 (low)OpenAI | 26.52% | aa_slug=gpt-5-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #139Qwen3.5-35B-A3BQwen | 26.52% | aa_slug=qwen3-5-35b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #140Mercury 2Inception | 26.52% | aa_slug=mercury-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #141Gemini 2.5 ProGoogle | 26.52% | aa_slug=gemini-2-5-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #142MiniMax M2MiniMax | 25.76% | aa_slug=minimax-m2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #143mimo-v2-flashXiaomi | 25.76% | aa_slug=mimo-v2-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #144qwen3-6-35b-a3b-non-reasoningAlibaba Group | 25.76% | aa_slug=qwen3-6-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #145deepseek-v3-1-reasoningDeepSeek | 25% | aa_slug=deepseek-v3-1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #146gemma-4-26b-a4b-non-reasoningGoogle | 25% | aa_slug=gemma-4-26b-a4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #147command-a-plusCohere | 25% | aa_slug=command-a-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #148deepseek-v3-2-0925DeepSeek | 25% | aa_slug=deepseek-v3-2-0925 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #149ernie-5-0-thinking-previewBaidu | 25% | aa_slug=ernie-5-0-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #150glm-4-6-reasoningZ.ai (Zhipu AI) | 25% | aa_slug=glm-4-6-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #151grok-4-1-fast-reasoningSpaceXAI | 24.24% | aa_slug=grok-4-1-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #152Qwen3.5-9BQwen | 24.24% | aa_slug=qwen3-5-9b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #153Qwen3 Max ThinkingQwen | 24.24% | aa_slug=qwen3-max-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #154gpt-5-4-nano-non-reasoningOpenAI | 24.24% | aa_slug=gpt-5-4-nano-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #155nova-2-0-pro-reasoning-mediumAmazon Web Services | 24.24% | aa_slug=nova-2-0-pro-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #156gemini-3-1-flash-lite-previewGoogle | 24.24% | aa_slug=gemini-3-1-flash-lite-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #157DeepSeek V3.1DeepSeek | 24.24% | aa_slug=deepseek-v3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #158hypernova-60bMultiverse Computing | 23.48% | aa_slug=hypernova-60b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #159gpt-oss-120bOpenAI | 23.48% | aa_slug=gpt-oss-120b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #160Kimi K2 0905Moonshot AI | 23.48% | aa_slug=kimi-k2-0905 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #161Trinity Large ThinkingArcee AI | 22.73% | aa_slug=trinity-large-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #162k-exaoneLG AI Research | 22.73% | aa_slug=k-exaone · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #163gpt-5-1-non-reasoningOpenAI | 22.73% | aa_slug=gpt-5-1-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #164grok-4-20-0309-non-reasoningSpaceXAI | 21.97% | aa_slug=grok-4-20-0309-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #165GLM 4.7 FlashZ.ai (Zhipu AI) | 21.97% | aa_slug=glm-4-7-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #166GLM 4.5Z.ai (Zhipu AI) | 21.97% | aa_slug=glm-4.5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #167qwen3-6-27b-non-reasoningAlibaba Group | 21.21% | aa_slug=qwen3-6-27b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #168Claude 3.7 SonnetAnthropic | 21.21% | aa_slug=claude-3-7-sonnet · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #169ling-2-6-flashinclusionAI | 21.21% | aa_slug=ling-2-6-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #170nemotron-cascade-2-30b-a3bNVIDIA | 21.21% | aa_slug=nemotron-cascade-2-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #171qwen3-5-omni-plusAlibaba Group | 21.21% | aa_slug=qwen3-5-omni-plus · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #172claude-3-7-sonnet-thinkingAnthropic | 21.21% | aa_slug=claude-3-7-sonnet-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #173GLM 4.5 AirZ.ai (Zhipu AI) | 20.45% | aa_slug=glm-4-5-air · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #174exaone-4-5-33bLG AI Research | 20.45% | aa_slug=exaone-4-5-33b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #175Qwen3 MaxQwen | 20.45% | aa_slug=qwen3-max · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #176qwen3-max-previewAlibaba Group | 19.7% | aa_slug=qwen3-max-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #177kimi-k2-5-non-reasoningMoonshot AI | 18.94% | aa_slug=kimi-k2-5-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #178grok-4-3-non-reasoningSpaceXAI | 18.94% | aa_slug=grok-4-3-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #179grok-4-fast-reasoningSpaceXAI | 18.94% | aa_slug=grok-4-fast-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #180Devstral 2Mistral AI | 18.94% | aa_slug=devstral-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #181qwen3-coder-480b-a35b-instructAlibaba Group | 18.94% | aa_slug=qwen3-coder-480b-a35b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #182gpt-5-4-mini-non-reasoningOpenAI | 18.18% | aa_slug=gpt-5-4-mini-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #183qwen3-5-9b-non-reasoningAlibaba Group | 18.18% | aa_slug=qwen3-5-9b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #184Qwen3.5-4BQwen | 18.18% | aa_slug=qwen3-5-4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #185gpt-5-minimalOpenAI | 18.18% | aa_slug=gpt-5-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #186Qwen3 Coder NextQwen | 18.18% | aa_slug=qwen3-coder-next · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #187jt-miniChina Mobile | 18.18% | aa_slug=jt-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #188gemma-4-12BGoogle | 18.18% | aa_slug=gemma-4-12b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #189nova-2-0-lite-reasoning-mediumAmazon Web Services | 17.42% | aa_slug=nova-2-0-lite-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #190grok-3-mini-reasoningSpaceXAI | 17.42% | aa_slug=grok-3-mini-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #191Mistral Small 4Mistral AI | 17.42% | aa_slug=mistral-small-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #192gpt-5-nano-mediumOpenAI | 17.42% | aa_slug=gpt-5-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #193qwen3-max-thinking-previewAlibaba Group | 17.42% | aa_slug=qwen3-max-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #194nova-2-0-pro-reasoning-lowAmazon Web Services | 17.42% | aa_slug=nova-2-0-pro-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #195Grok Build 0.1xAI | 17.42% | aa_slug=grok-code-fast-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #196nova-2-0-lite-reasoningAmazon Web Services | 16.67% | aa_slug=nova-2-0-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #197gemini-2-5-flash-preview-09-2025-reasoningGoogle | 16.67% | aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #198grok-4.20-0309-non-reasoningxAI | 16.67% | aa_slug=grok-4-20-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #199Devstral Small 2Mistral AI | 16.67% | aa_slug=devstral-small-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #200nova-2-0-proAmazon Web Services | 16.67% | aa_slug=nova-2-0-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.
Definition
- Category
- agentic
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 7 h agomedium
- Task
- terminal tasks solved by agents
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 7 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 7 h agomedium
- Direction
- Higher is better
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 7 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2 +523(531 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| agentic | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| terminal tasks solved by agents | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://www.tbench.ai | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 5 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.