Updated 8 h ago · first seen 11 Sept 2026
bench_01M293SPFPKK4MF90JEDK0PH8C
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 821
- Leader
- Claude Fable 5.1 91.39%
Score history · glm-4-6-reasoning 2 rows
Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.
- 25%aa_slug=glm-4-6-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 49.44%aa_slug=glm-4-6-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 821 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #401nova-2-0-lite-reasoning-mediumAmazon Web Services | 17.42% | aa_slug=nova-2-0-lite-reasoning-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #402Grok Build 0.1xAI | 17.42% | aa_slug=grok-code-fast-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #403Mistral Small 4Mistral AI | 17.42% | aa_slug=mistral-small-4 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #404gpt-5-nano-mediumOpenAI | 17.42% | aa_slug=gpt-5-nano-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #405nova-2-0-pro-reasoning-lowAmazon Web Services | 17.42% | aa_slug=nova-2-0-pro-reasoning-low · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #406grok-3-mini-reasoningSpaceXAI | 17.42% | aa_slug=grok-3-mini-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #407qwen3-max-thinking-previewAlibaba Group | 17.42% | aa_slug=qwen3-max-thinking-preview · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #408nova-2-0-proAmazon Web Services | 17.23% | aa_slug=nova-2-0-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #409grok-4-6-xhighSpaceXAI | 17.17% | aa_slug=grok-4-6-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #410deepseek-v3DeepSeek | 16.85% | aa_slug=deepseek-v3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #411nova-2-0-lite-reasoningAmazon Web Services | 16.67% | aa_slug=nova-2-0-lite-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #412cogito-v2-1-reasoningDeep Cogito | 16.67% | aa_slug=cogito-v2-1-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #413grok-4.20-0309-non-reasoningxAI | 16.67% | aa_slug=grok-4-20-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #414gemini-2-5-flash-preview-09-2025-reasoningGoogle | 16.67% | aa_slug=gemini-2-5-flash-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #415muse-spark-1-3-xhighMeta AI | 16.67% | aa_slug=muse-spark-1-3-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #416nova-2-0-proAmazon Web Services | 16.67% | aa_slug=nova-2-0-pro · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #417Devstral Small 2Mistral AI | 16.67% | aa_slug=devstral-small-2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #418nova-2-0-lite-reasoningAmazon Web Services | 16.1% | aa_slug=nova-2-0-lite-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #419Kimi K2 0711Moonshot AI | 15.91% | aa_slug=kimi-k2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #420deepseek-r1DeepSeek | 15.91% | aa_slug=deepseek-r1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #421Mistral Large 3Mistral AI | 15.91% | aa_slug=mistral-large-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #422DeepSeek V3 0324DeepSeek | 15.15% | aa_slug=deepseek-v3-0324 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #423Qwen3 Coder 30B A3B InstructQwen | 15.15% | aa_slug=qwen3-coder-30b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #424qwen3-235b-a22b-instruct-2507Alibaba Group | 15.15% | aa_slug=qwen3-235b-a22b-instruct-2507 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #425o4-miniOpenAI | 15.15% | aa_slug=o4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #426k2-think-v2MBZUAI Institute of Foundation Models | 14.98% | aa_slug=k2-think-v2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #427gpt-5.5OpenAI | 14.65% | aa_slug=gpt-5-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #428gpt-5-6-sol-mediumOpenAI | 14.65% | aa_slug=gpt-5-6-sol-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #429deepseek-v4-pro-0424DeepSeek | 14.65% | aa_slug=deepseek-v4-pro-0424 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #430grok-4-1-fastSpaceXAI | 14.39% | aa_slug=grok-4-1-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #431gpt-5-mini-minimalOpenAI | 14.39% | aa_slug=gpt-5-mini-minimal · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #432gemini-2-5-flash-preview-09-2025Google | 14.39% | aa_slug=gemini-2-5-flash-preview-09-2025 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #433apriel-v1-6-15b-thinkerServiceNow | 14.39% | aa_slug=apriel-v1-6-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #434GLM 4.6VZ.ai (Zhipu AI) | 14.39% | aa_slug=glm-4-6v-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #435deepseek-v4-proDeepSeek | 14.14% | aa_slug=deepseek-v4-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #436Claude Sonnet 5Anthropic | 14.14% | aa_slug=claude-sonnet-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #437gpt-oss-120b-lowOpenAI | 13.86% | aa_slug=gpt-oss-120b-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #438granite-4.2-3bIBM | 13.86% | aa_slug=granite-4-2-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #439Mistral Medium 3.1Mistral AI | 13.86% | aa_slug=mistral-medium-3-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #440DeepSeek V3 0324DeepSeek | 13.86% | aa_slug=deepseek-v3-0324 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #441gpt-oss-20bOpenAI | 13.86% | aa_slug=gpt-oss-20b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #442Gemma 4 26B A4BGoogle | 13.64% | aa_slug=gemma-4-26b-a4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #443gpt-4.1OpenAI | 13.64% | aa_slug=gpt-4-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #444gemini-2-5-flash-reasoningGoogle | 13.64% | aa_slug=gemini-2-5-flash-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #445nvidia-nemotron-3-nano-30b-a3b-reasoningNVIDIA | 13.64% | aa_slug=nvidia-nemotron-3-nano-30b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #446Gemini 3.7 FlashGoogle | 13.64% | aa_slug=gemini-3-7-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #447Qwen3 235B A22B Instruct 2507Qwen | 13.64% | aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #448grok-4-6-mediumSpaceXAI | 13.13% | aa_slug=grok-4-6-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #449gemini-2-5-flash-lite-preview-09-2025-reasoningGoogle | 12.88% | aa_slug=gemini-2-5-flash-lite-preview-09-2025-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #450gpt-5-chatgptOpenAI | 12.88% | aa_slug=gpt-5-chatgpt · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #451Magistral Medium 1.2Mistral AI | 12.88% | aa_slug=magistral-medium-2509 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #452o1OpenAI | 12.88% | aa_slug=o1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #453gpt-5-5-instant-06-26OpenAI | 12.63% | aa_slug=gpt-5-5-instant-06-26 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #454Kimi K3Moonshot AI | 12.63% | aa_slug=kimi-k3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #455Magistral Medium 1.2Mistral AI | 12.36% | aa_slug=magistral-medium-2509 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #456diffusiongemma-26b-a4bGoogle | 12.36% | aa_slug=diffusiongemma-26b-a4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #457Gemini 2.5 FlashGoogle | 12.12% | aa_slug=gemini-2-5-flash · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #458gpt-5-nanoOpenAI | 12.12% | aa_slug=gpt-5-nano · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #459Nemotron 3 Nano 30B A3BNVIDIA | 12.12% | aa_slug=nvidia-nemotron-3-nano-30b-a3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #460deepseek-v4-flash-visionDeepSeek | 12.12% | aa_slug=deepseek-v4-flash-vision · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #461deepseek-v4-flashDeepSeek | 12.12% | aa_slug=deepseek-v4-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #462grok-4-fastSpaceXAI | 12.12% | aa_slug=grok-4-fast · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #463hyperclova-x-seed-think-32bNaver | 12.12% | aa_slug=hyperclova-x-seed-think-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #464Qwen3 235B A22B Instruct 2507Qwen | 11.99% | aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #465Mistral Large 3Mistral AI | 11.99% | aa_slug=mistral-large-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #466Solar Pro 3Upstage | 11.99% | aa_slug=solar-pro-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #467gpt-5.6-lunaOpenAI | 11.62% | aa_slug=gpt-5-6-luna · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #468gemma-4-12b-non-reasoningGoogle | 11.36% | aa_slug=gemma-4-12b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #469Hermes 4 405BNous Research | 11.36% | aa_slug=hermes-4-llama-3-1-405b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #470grok-3SpaceXAI | 11.36% | aa_slug=grok-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #471qwen3-vl-235b-a22b-reasoningAlibaba Group | 11.36% | aa_slug=qwen3-vl-235b-a22b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #472qwen3-5-4b-non-reasoningAlibaba Group | 11.36% | aa_slug=qwen3-5-4b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #473Kimi-Linear-48B-A3B-InstructMoonshot AI | 11.36% | aa_slug=kimi-linear-48b-a3b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #474celeris-1Celeris | 11.24% | aa_slug=celeris-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #475Qwen3.8 2.4T A95BQwen | 11.11% | aa_slug=qwen3-8-2-4t-a95b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #476ling-flash-2-0inclusionAI | 10.61% | aa_slug=ling-flash-2-0 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #477Mistral Medium 3.1Mistral AI | 10.61% | aa_slug=mistral-medium-3-1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #478Grok 4.5xAI | 10.61% | aa_slug=grok-4-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #479qwen3-5-35b-a3b-non-reasoningAlibaba Group | 10.61% | aa_slug=qwen3-5-35b-a3b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #480gpt-oss-20bOpenAI | 10.61% | aa_slug=gpt-oss-20b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #481ling-1tinclusionAI | 10.61% | aa_slug=ling-1t · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #482mistral-small-4-non-reasoningMistral AI | 10.61% | aa_slug=mistral-small-4-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #483longcat-flash-liteLongCat | 10.61% | aa_slug=longcat-flash-lite · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #484apriel-v1-5-15b-thinkerServiceNow | 10.61% | aa_slug=apriel-v1-5-15b-thinker · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #485Claude Haiku 3.5Anthropic | 10.11% | aa_slug=claude-3-5-haiku · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #486gpt-4.1-miniOpenAI | 10.11% | aa_slug=gpt-4-1-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #487gemini-3-8-flash-lowGoogle | 10.1% | aa_slug=gemini-3-8-flash-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #488gpt-5-6-terra-xhighOpenAI | 10.1% | aa_slug=gpt-5-6-terra-xhigh · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #489hermes-4-llama-3-1-405bNous Research | 9.85% | aa_slug=hermes-4-llama-3-1-405b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #490k2-v2MBZUAI Institute of Foundation Models | 9.85% | aa_slug=k2-v2 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #491qwen3-next-80b-a3b-reasoningAlibaba Group | 9.85% | aa_slug=qwen3-next-80b-a3b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #492Ministral 3 14BMistral AI | 9.74% | aa_slug=ministral-3-14b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #493kat-coder-pro-v1KwaiKAT | 9.09% | aa_slug=kat-coder-pro-v1 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #494intellect-3Prime Intellect | 9.09% | aa_slug=intellect-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #495gpt-5-5-highOpenAI | 9.09% | aa_slug=gpt-5-5-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #496devstral-mediumMistral AI | 9.09% | aa_slug=devstral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #497magistral-mediumMistral AI | 9.09% | aa_slug=magistral-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #498minicpm5-2bOpenBMB | 8.61% | aa_slug=minicpm5-2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #499gemma-4-E4BGoogle | 8.33% | aa_slug=gemma-4-e4b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #500GPT-4o (2024-08-06)OpenAI | 8.33% | aa_slug=gpt-4o-2024-08-06 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.
Definition
- Category
- agentic
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Task
- terminal tasks solved by agents
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
- Direction
- Higher is better
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 8 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2 +523(531 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| agentic | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| terminal tasks solved by agents | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://www.tbench.ai | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 6 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.