Updated 9 h ago · first seen 11 Sept 2026
bench_01M293SPFPKK4MF90JEDK0PH8C
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 821
- Leader
- Claude Fable 5.1 91.39%
Score history · GLM 5.3 Flash 2 rows
Not enough history to chart — 2 observations, all dated 11 Sept 2026. Rows under different configurations count separately; the list below shows each one.
- 84.27%aa_slug=glm-5-3-flash · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
- 32.83%aa_slug=glm-5-3-flash · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 821 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #701Trinity Large ThinkingArcee AI | 0.51% | aa_slug=trinity-large-thinking · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #702Hy3Tencent | 0.51% | aa_slug=hy3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #703North Mini Code (free)Cohere | 0.51% | aa_slug=north-mini-code · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #704Solar Pro 4Upstage | 0.51% | aa_slug=solar-pro4 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #705gpt-5.4-nanoOpenAI | 0.51% | aa_slug=gpt-5-4-nano · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #706Muse Glimmer 30BMeta AI | 0.51% | aa_slug=muse-glimmer · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #707gpt-5-6-luna-mediumOpenAI | 0.51% | aa_slug=gpt-5-6-luna-medium · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #708gemini-3-1-flash-lite-previewGoogle | 0.51% | aa_slug=gemini-3-1-flash-lite-preview · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #709Nemotron 3 UltraNVIDIA | 0.51% | aa_slug=nvidia-nemotron-3-ultra-550b-a55b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #710ring-2-6-1tinclusionAI | 0.51% | aa_slug=ring-2-6-1t · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #711Gemma 3 4BGoogle | 0.37% | aa_slug=gemma-3-4b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #712phi-4-miniMicrosoft | 0.37% | aa_slug=phi-4-mini · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #713gemma-4-E2BGoogle | 0.37% | aa_slug=gemma-4-e2b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #714qwen3-5-0-8b-non-reasoningAlibaba Group | 0.37% | aa_slug=qwen3-5-0-8b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #715Mistral Large 3Mistral AI | 0% | aa_slug=mistral-large-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #716MiMo-V2.5Xiaomi | 0% | aa_slug=mimo-v2-5-0424 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #717nanbeige4-1-3bNanbeige | 0% | aa_slug=nanbeige4-1-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #718nvidia-nemotron-nano-12b-v2-vlNVIDIA | 0% | aa_slug=nvidia-nemotron-nano-12b-v2-vl · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #719gemma-3-1bGoogle | 0% | aa_slug=gemma-3-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #720Llama 4 ScoutMeta AI | 0% | aa_slug=llama-4-scout · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #721apertus-70b-instructSwiss AI Initiative | 0% | aa_slug=apertus-70b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #722minicpm5-1b-non-reasoningOpenBMB | 0% | aa_slug=minicpm5-1b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #723Qwen3-0.6BQwen | 0% | aa_slug=qwen3-0.6b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #724tiny-aya-globalCohere | 0% | aa_slug=tiny-aya-global · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #725hermes-4-llama-3-1-70bNous Research | 0% | aa_slug=hermes-4-llama-3-1-70b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #726MiniMax M2.7MiniMax | 0% | aa_slug=minimax-m2-7 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #727Granite 4.2 8BIBM | 0% | aa_slug=granite-4-2-8b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #728molmo-7b-dAllen Institute for AI | 0% | aa_slug=molmo-7b-d · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #729MiMo-V2.5-ProXiaomi | 0% | aa_slug=mimo-v2-5-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #730granite-3-3-8b-instructIBM | 0% | aa_slug=granite-3-3-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #731Qwen3.5-0.8BQwen | 0% | aa_slug=qwen3-5-0-8b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #732llama-3-3-nemotron-super-49b-reasoningNVIDIA | 0% | aa_slug=llama-3-3-nemotron-super-49b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #733Qwen3.5-0.8BQwen | 0% | aa_slug=qwen3-5-0-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #734granite-4-0-h-350mIBM | 0% | aa_slug=granite-4-0-h-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #735claude-4-5-haiku-reasoningAnthropic | 0% | aa_slug=claude-4-5-haiku-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #736exaone-4-0-1-2b-reasoningLG AI Research | 0% | aa_slug=exaone-4-0-1-2b-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #737granite-4-0-nano-1bIBM | 0% | aa_slug=granite-4-0-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #738olmo-2-32bAllen Institute for AI | 0% | aa_slug=olmo-2-32b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #739granite-4-0-350mIBM | 0% | aa_slug=granite-4-0-350m · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #740Gemma 3 27BGoogle | 0% | aa_slug=gemma-3-27b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #741Gemma 3 12BGoogle | 0% | aa_slug=gemma-3-12b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #742qwen3-1.7b-instruct-reasoningAlibaba Group | 0% | aa_slug=qwen3-1.7b-instruct-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #743Gemma 3 12BGoogle | 0% | aa_slug=gemma-3-12b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #744granite-4-0-h-nano-1bIBM | 0% | aa_slug=granite-4-0-h-nano-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #745Reka Flash 3rekaai | 0% | aa_slug=reka-flash-3 · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #746phi-4-miniMicrosoft | 0% | aa_slug=phi-4-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #747Mistral Medium 3.5Mistral AI | 0% | aa_slug=mistral-medium-3-5 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #748lfm2-5-1-2b-thinkingLiquid AI | 0% | aa_slug=lfm2-5-1-2b-thinking · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #749qwen3-1.7b-instructAlibaba Group | 0% | aa_slug=qwen3-1.7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #750LongCat 2.0Meituan | 0% | aa_slug=longcat-2-0 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #751LFM2-1.2BLiquid AI | 0% | aa_slug=lfm2-1-2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #752Qwen3.5 397B A17BQwen | 0% | aa_slug=qwen3-5-397b-a17b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #753phi-3-miniMicrosoft | 0% | aa_slug=phi-3-mini · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #754qwen3-0.6b-instructAlibaba Group | 0% | aa_slug=qwen3-0.6b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #755deepseek-r1-0120DeepSeek | 0% | aa_slug=deepseek-r1-0120 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #756Qwen3 8BQwen | 0% | aa_slug=qwen3-8b-instruct-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #757qwen3-5-0-8b-non-reasoningAlibaba Group | 0% | aa_slug=qwen3-5-0-8b-non-reasoning · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #758Mistral Small 4Mistral AI | 0% | aa_slug=mistral-small-4 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #759qwen3-30b-a3b-2507-reasoningAlibaba Group | 0% | aa_slug=qwen3-30b-a3b-2507-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #760Molmo2-8BAllen Institute for AI | 0% | aa_slug=molmo2-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #761Ministral 3 8BMistral AI | 0% | aa_slug=ministral-3-8b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #762Llama-3.2-1BMeta AI | 0% | aa_slug=llama-3-2-instruct-1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #763olmo-3-1-32b-instructAllen Institute for AI | 0% | aa_slug=olmo-3-1-32b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #764granite-4.2-3bIBM | 0% | aa_slug=granite-4-2-3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #765Grok 4.3xAI | 0% | aa_slug=grok-4-3 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #766Nemotron 3 SuperNVIDIA | 0% | aa_slug=nvidia-nemotron-3-super-120b-a12b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #767Qwen3 Coder NextQwen | 0% | aa_slug=qwen3-coder-next · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #768deepseek-v3-1-terminus-reasoningDeepSeek | 0% | aa_slug=deepseek-v3-1-terminus-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #769minicpm5-2bOpenBMB | 0% | aa_slug=minicpm5-2b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #770Llama 4 MaverickMeta AI | 0% | aa_slug=llama-4-maverick · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #771Devstral 2Mistral AI | 0% | aa_slug=devstral-2 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #772lfm2-24b-a2bLiquid AI | 0% | aa_slug=lfm2-24b-a2b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #773Mistral Small 3.1Mistral AI | 0% | aa_slug=mistral-small-3-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #774qwen3-5-2b-non-reasoningAlibaba Group | 0% | aa_slug=qwen3-5-2b-non-reasoning · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #775Ministral 3 3BMistral AI | 0% | aa_slug=ministral-3-3b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #776Qwen3 32BQwen | 0% | aa_slug=qwen3-32b-instruct-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #777Ministral 3 3BMistral AI | 0% | aa_slug=ministral-3-3b · variant=v2.1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #778Ministral 3 3BMistral AI | 0% | aa_slug=ministral-3-3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #779LFM2.5-VL-1.6BLiquid AI | 0% | aa_slug=lfm2-5-vl-1-6b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #780lfm2-8b-a1bLiquid AI | 0% | aa_slug=lfm2-8b-a1b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #781claude-4-5-sonnet-thinkingAnthropic | 0% | aa_slug=claude-4-5-sonnet-thinking · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #782gpt-oss-120bOpenAI | 0% | aa_slug=gpt-oss-120b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #783ling-3-0-tinyinclusionAI | 0% | aa_slug=ling-3-0-tiny · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #784o3 Mini HighOpenAI | 0% | aa_slug=o3-mini-high · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #785grok-4-3-non-reasoningSpaceXAI | 0% | aa_slug=grok-4-3-non-reasoning · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #786Olmo-3-7B-InstructAllen Institute for AI | 0% | aa_slug=olmo-3-7b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #787Mistral Medium 3.1Mistral AI | 0% | aa_slug=mistral-medium-3-1 · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #788Qwen3.6 27BQwen | 0% | aa_slug=qwen3-6-27b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #789apertus-8b-instructSwiss AI Initiative | 0% | aa_slug=apertus-8b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #790Qwen3.6 35B A3BQwen | 0% | aa_slug=qwen3-6-35b-a3b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #791Ministral 3 14BMistral AI | 0% | aa_slug=ministral-3-14b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #792gpt-5-6-luna-lowOpenAI | 0% | aa_slug=gpt-5-6-luna-low · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #793granite-4.1-8bIBM | 0% | aa_slug=granite-4-1-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #794olmo-3-1-32b-thinkAllen Institute for AI | 0% | aa_slug=olmo-3-1-32b-think · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #795Qwen3-VL-4B-InstructQwen | 0% | aa_slug=qwen3-vl-4b-instruct · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #796llama-3-3-nemotron-super-49bNVIDIA | 0% | aa_slug=llama-3-3-nemotron-super-49b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #797gpt-oss-20bOpenAI | 0% | aa_slug=gpt-oss-20b · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #798gemma-3-270mGoogle | 0% | aa_slug=gemma-3-270m · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #799Gemini 2.5 ProGoogle | 0% | aa_slug=gemini-2-5-pro · variant=v4.0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #800llama-3-instruct-8bMeta AI | 0% | aa_slug=llama-3-instruct-8b · variant=hard · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
The config filter matches a value inside each result's configuration (server-side, `config=` on the API). Chips are the values shared by several rows on the first page; per-model identifiers are not offered.
Definition
- Category
- agentic
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Task
- terminal tasks solved by agents
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Direction
- Higher is better
- Website
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, claude-opus-5-medium, gemma-4-12B, deepseek-v4-flash, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2 +523(531 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| agentic | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| terminal tasks solved by agents | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Websitewebsite1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://www.tbench.ai | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 7 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.