Updated 2 h ago · first seen 11 Sept 2026
bench_01M293SPFPKK4MF90JEDK0PH8C
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 821
- Leader
- Claude Fable 5.1 91.39%
Leaderboard 821 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #1Claude Fable 5.1Anthropic | 91.39% | aa_slug=claude-fable-5-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #2claude-fable-5-1-xhighAnthropic | 91.01% | aa_slug=claude-fable-5-1-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #3gpt-6-astra-highOpenAI | 89.89% | aa_slug=gpt-6-astra-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #4claude-fable-5-1-highAnthropic | 89.89% | aa_slug=claude-fable-5-1-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #5gpt-5-6-sol-xhighOpenAI | 89.51% | aa_slug=gpt-5-6-sol-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #6gpt-6-astra-mediumOpenAI | 89.51% | aa_slug=gpt-6-astra-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #7gpt-6-astra-xhighOpenAI | 89.14% | aa_slug=gpt-6-astra-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #8gpt-6-astra-non-reasoningOpenAI | 89.14% | aa_slug=gpt-6-astra-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #9Claude Opus 5Anthropic | 89.14% | aa_slug=claude-opus-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #10Grok 4.6xAI | 88.39% | aa_slug=grok-4-6 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #11gpt-6-astraOpenAI | 88.39% | aa_slug=gpt-6-astra · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #12grok-4-6-xhighSpaceXAI | 88.01% | aa_slug=grok-4-6-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #13gpt-6-astra-lowOpenAI | 88.01% | aa_slug=gpt-6-astra-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #14gpt-5.6-terraOpenAI | 88.01% | aa_slug=gpt-5-6-terra · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #15claude-fable-5-1-mediumAnthropic | 88.01% | aa_slug=claude-fable-5-1-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #16gpt-5-6-solOpenAI | 88.01% | aa_slug=gpt-5-6-sol · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #17claude-opus-5-xhighAnthropic | 88.01% | aa_slug=claude-opus-5-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #18claude-opus-5-highAnthropic | 87.64% | aa_slug=claude-opus-5-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #19Gemini 3.8 FlashGoogle | 87.64% | aa_slug=gemini-3-8-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #20gpt-5-6-sol-highOpenAI | 87.27% | aa_slug=gpt-5-6-sol-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #21gpt-5-6-sol-mediumOpenAI | 86.14% | aa_slug=gpt-5-6-sol-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #22claude-opus-5-mediumAnthropic | 86.14% | aa_slug=claude-opus-5-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #23Qwen3.8 FlashQwen | 86.14% | aa_slug=qwen3-8-flash-next · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #24Gemini 3.7 FlashGoogle | 85.77% | aa_slug=gemini-3-7-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #25muse-spark-1-3-xhighMeta AI | 85.39% | aa_slug=muse-spark-1-3-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #26Kimi K3Moonshot AI | 85.02% | aa_slug=kimi-k3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #27claude-fable-5-1-lowAnthropic | 85.02% | aa_slug=claude-fable-5-1-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #28Claude Fable 5Anthropic | 84.64% | aa_slug=claude-fable-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #29Claude Opus 4.8Anthropic | 84.64% | aa_slug=claude-opus-4-8 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #30grok-4-6-mediumSpaceXAI | 84.27% | aa_slug=grok-4-6-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #31GLM 5.3 FlashZ.ai (Zhipu AI) | 84.27% | aa_slug=glm-5-3-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #32gpt-5.5OpenAI | 84.27% | aa_slug=gpt-5-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #33Muse Spark 1.3Meta AI | 84.27% | aa_slug=muse-spark-1-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #34GLM 5.3Z.ai (Zhipu AI) | 83.9% | aa_slug=glm-5-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #35gemini-3-8-flash-mediumGoogle | 83.9% | aa_slug=gemini-3-8-flash-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #36gemini-3-8-flash-lowGoogle | 83.15% | aa_slug=gemini-3-8-flash-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #37Claude Opus 4.7Anthropic | 83.15% | aa_slug=claude-opus-4-7 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #38kimi-k3-lowMoonshot AI | 82.4% | aa_slug=kimi-k3-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #39agnes-3-0-flashSapiens AI | 82.02% | aa_slug=agnes-3-0-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #40Qwen3.8 2.4T A95BQwen | 82.02% | aa_slug=qwen3-8-2-4t-a95b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #41Grok 4.5xAI | 81.65% | aa_slug=grok-4-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #42Qwen 3.8 MaxQwen | 81.27% | aa_slug=qwen3-8-max · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #43gpt-5.6-lunaOpenAI | 80.9% | aa_slug=gpt-5-6-luna · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #44Claude Sonnet 5Anthropic | 80.52% | aa_slug=claude-sonnet-5 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #45gpt-5-5-mediumOpenAI | 80.52% | aa_slug=gpt-5-5-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #46gpt-5-6-terra-xhighOpenAI | 80.15% | aa_slug=gpt-5-6-terra-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #47Muse Spark 1.2Meta AI | 80.15% | aa_slug=muse-spark-1-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #48gemini-3-7-flash-lowGoogle | 79.78% | aa_slug=gemini-3-7-flash-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #49Qwen3.8 27BQwen | 79.78% | aa_slug=qwen3-8-27b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #50gpt-5-5-highOpenAI | 79.4% | aa_slug=gpt-5-5-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #51deepseek-v4-flashDeepSeek | 78.65% | aa_slug=deepseek-v4-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #52deepseek-v4-proDeepSeek | 78.65% | aa_slug=deepseek-v4-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #53Gemini 3.5 FlashGoogle | 78.65% | aa_slug=gemini-3-5-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #54gemini-3-7-flash-mediumGoogle | 78.28% | aa_slug=gemini-3-7-flash-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #55gpt-5.4OpenAI | 78.28% | aa_slug=gpt-5-4 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #56Z.ai GLM 5.2Z.ai (Zhipu AI) | 77.9% | aa_slug=glm-5-2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #57gpt-5-6-luna-xhighOpenAI | 77.9% | aa_slug=gpt-5-6-luna-xhigh · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #58Muse Spark 1.1Meta AI | 77.9% | aa_slug=muse-spark-1-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #59Gemini 3.6 FlashGoogle | 77.53% | aa_slug=gemini-3-6-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #60gpt-5-6-sol-lowOpenAI | 76.78% | aa_slug=gpt-5-6-sol-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #61claude-opus-5-lowAnthropic | 76.4% | aa_slug=claude-opus-5-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #62gpt-5-6-terra-highOpenAI | 75.66% | aa_slug=gpt-5-6-terra-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #63claude-sonnet-5-non-reasoningAnthropic | 75.28% | aa_slug=claude-sonnet-5-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #64grok-4-6-lowSpaceXAI | 75.28% | aa_slug=grok-4-6-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #65motif-3Motif Technologies | 74.91% | aa_slug=motif-3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #66Qwen3.7 MaxQwen | 74.53% | aa_slug=qwen3-7-max · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #67gpt-5-6-sol-non-reasoningOpenAI | 74.16% | aa_slug=gpt-5-6-sol-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #68deepseek-v4-flash-visionDeepSeek | 74.16% | aa_slug=deepseek-v4-flash-vision · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #69Gemini 3.1 Pro PreviewGoogle | 73.78% | aa_slug=gemini-3-1-pro-preview · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #70gpt-5-6-terra-mediumOpenAI | 72.28% | aa_slug=gpt-5-6-terra-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #71k2-horizon-375b-a23bMBZUAI Institute of Foundation Models | 71.91% | aa_slug=k2-horizon-375b-a23b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #72claude-sonnet-4-6-adaptiveAnthropic | 71.16% | aa_slug=claude-sonnet-4-6-adaptive · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #73motif-0714Motif Technologies | 70.79% | aa_slug=motif-0714 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #74KAT-Coder-Pro V2Kwaipilot | 70.04% | aa_slug=kat-coder-pro-v2 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #75apodex-1-1Apodex | 69.66% | aa_slug=apodex-1-1 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #76agnes-2-5-pro-betaSapiens AI | 69.66% | aa_slug=agnes-2-5-pro-beta · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #77gpt-5-6-luna-highOpenAI | 69.66% | aa_slug=gpt-5-6-luna-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #78quasar-438bMultiverse Computing | 69.29% | aa_slug=quasar-438b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #79nex-n2-proNex AGI | 67.79% | aa_slug=nex-n2-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #80qwen3-8-27b-lowAlibaba Group | 67.42% | aa_slug=qwen3-8-27b-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #81Kimi K2.7 CodeMoonshot AI | 67.42% | aa_slug=kimi-k2-7-code · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #82agnes-2-5-pro-alphaSapiens AI | 67.04% | aa_slug=agnes-2-5-pro-alpha · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #83Kimi K2.6Moonshot AI | 65.92% | aa_slug=kimi-k2-6 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #84gpt-5-6-solOpenAI | 65.91% | aa_slug=gpt-5-6-sol · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #85gpt-5-5-lowOpenAI | 65.54% | aa_slug=gpt-5-5-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #86MiniMax M3MiniMax | 65.17% | aa_slug=minimax-m3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #87MiMo-V2.5-ProXiaomi | 65.17% | aa_slug=mimo-v2-5-pro · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #88qwen3-8-27b-mediumAlibaba Group | 65.17% | aa_slug=qwen3-8-27b-medium · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #89deepseek-v4-pro-0424-highDeepSeek | 64.79% | aa_slug=deepseek-v4-pro-0424-high · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #90Hy3Tencent | 64.42% | aa_slug=hy3 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #91Ling 3.0 Flash VLinclusionAI | 64.42% | aa_slug=ling-3-0-flash-vl · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #92deepseek-v4-pro-0424DeepSeek | 64.04% | aa_slug=deepseek-v4-pro-0424 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #93MiMo-V2.5Xiaomi | 63.67% | aa_slug=mimo-v2-5-0424 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #94gpt-5-6-terra-xhighOpenAI | 62.88% | aa_slug=gpt-5-6-terra-xhigh · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #95Claude Fable 5Anthropic | 62.88% | aa_slug=claude-fable-5 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #96gpt-5-6-sol-mediumOpenAI | 62.88% | aa_slug=gpt-5-6-sol-medium · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #97gpt-5-6-terra-lowOpenAI | 62.55% | aa_slug=gpt-5-6-terra-low · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #98muse-sparkMeta AI | 62.17% | aa_slug=muse-spark · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #99gpt-5-6-sol-highOpenAI | 62.12% | aa_slug=gpt-5-6-sol-high · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #100deepseek-v4-flash-0420DeepSeek | 61.8% | aa_slug=deepseek-v4-flash-0420 · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.
Definition
- Category
- agentic
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 2 h agomedium
- Task
- terminal tasks solved by agents
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 2 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 2 h agomedium
- Direction
- Higher is better
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 2 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2 +523(531 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| agentic | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| terminal tasks solved by agents | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://www.tbench.ai | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 21 min ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.