τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 5 h ago · first seen 11 Sept 2026
bench_01M293SPH15XRN6880KKHSKM5P
- Metric
- pass^1 · %
- Direction
- Higher is better
- Results
- 440
- Leader
- Z.ai GLM 5.2 99.12%
Score history · Grok 4.20 1 row
Not enough history to chart — a single observation (92.98% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 92.98%aa_slug=grok-4-20 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 440 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #1Z.ai GLM 5.2Z.ai (Zhipu AI) | 99.12% | aa_slug=glm-5-2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #2jt-35b-flashChina Mobile | 99.12% | aa_slug=jt-35b-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #3GLM 4.7 FlashZ.ai (Zhipu AI) | 98.83% | aa_slug=glm-4-7-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #4Claude Fable 5Anthropic | 98.54% | aa_slug=claude-fable-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #5Step 3.7 FlashStepFun | 98.54% | aa_slug=step-3-7-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #6GLM 5 TurboZ.ai (Zhipu AI) | 98.54% | aa_slug=glm-5-turbo · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #7GLM 5V TurboZ.ai (Zhipu AI) | 98.54% | aa_slug=glm-5v-turbo · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #8GLM 5Z.ai (Zhipu AI) | 98.25% | aa_slug=glm-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #9Qwen3.6 PlusQwen | 97.66% | aa_slug=qwen3-6-plus · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #10Grok 4.3xAI | 97.66% | aa_slug=grok-4-3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #11GLM 5.1Z.ai (Zhipu AI) | 97.66% | aa_slug=glm-5-1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #12glm-5-non-reasoningZ.ai (Zhipu AI) | 97.37% | aa_slug=glm-5-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #13glm-5-1-non-reasoningZ.ai (Zhipu AI) | 97.08% | aa_slug=glm-5-1-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #14grok-4-20-0309SpaceXAI | 96.49% | aa_slug=grok-4-20-0309 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #15deepseek-v4-pro-0424DeepSeek | 96.2% | aa_slug=deepseek-v4-pro-0424 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #16Kimi K2.5Moonshot AI | 95.91% | aa_slug=kimi-k2-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #17Qwen3.6 Max PreviewQwen | 95.91% | aa_slug=qwen3-6-max · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #18GLM 4.7Z.ai (Zhipu AI) | 95.91% | aa_slug=glm-4-7 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #19Kimi K2.6Moonshot AI | 95.91% | aa_slug=kimi-k2-6 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #20gemini-3-5-flash-mediumGoogle | 95.61% | aa_slug=gemini-3-5-flash-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #21Gemini 3.1 Pro PreviewGoogle | 95.61% | aa_slug=gemini-3-1-pro-preview · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #22deepseek-v4-flash-0420-highDeepSeek | 95.61% | aa_slug=deepseek-v4-flash-0420-high · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #23Qwen3.5 397B A17BQwen | 95.61% | aa_slug=qwen3-5-397b-a17b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #24MiniMax M2.5MiniMax | 95.32% | aa_slug=minimax-m2-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #25Qwen3.6 35B A3BQwen | 95.32% | aa_slug=qwen3-6-35b-a3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #26Gemini 3.5 FlashGoogle | 95.32% | aa_slug=gemini-3-5-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #27mimo-v2-flash-reasoningXiaomi | 95.03% | aa_slug=mimo-v2-flash-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #28mimo-v2-proXiaomi | 95.03% | aa_slug=mimo-v2-pro · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #29deepseek-v4-flash-0420DeepSeek | 95.03% | aa_slug=deepseek-v4-flash-0420 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #30Qwen3.7 MaxQwen | 94.74% | aa_slug=qwen3-7-max · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #31Claude Opus 4.8Anthropic | 94.44% | aa_slug=claude-opus-4-8 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #32deepseek-v4-flash-0420-non-reasoningDeepSeek | 94.44% | aa_slug=deepseek-v4-flash-0420-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #33Step 3.5 FlashStepFun | 94.44% | aa_slug=step-3-5-flash-0202 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #34Qwen3.6 27BQwen | 94.15% | aa_slug=qwen3-6-27b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #35Mistral Medium 3.5Mistral AI | 94.15% | aa_slug=mistral-medium-3-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #36MiMo-V2.5-ProXiaomi | 94.15% | aa_slug=mimo-v2-5-pro · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #37glm-4-7-non-reasoningZ.ai (Zhipu AI) | 94.15% | aa_slug=glm-4-7-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #38deepseek-v4-pro-0424-highDeepSeek | 94.15% | aa_slug=deepseek-v4-pro-0424-high · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #39gpt-5.5OpenAI | 93.86% | aa_slug=gpt-5-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #40kimi-k2-6-non-reasoningMoonshot AI | 93.86% | aa_slug=kimi-k2-6-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #41Qwen3.5-27BQwen | 93.86% | aa_slug=qwen3-5-27b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #42Qwen3.5-122B-A10BQwen | 93.57% | aa_slug=qwen3-5-122b-a10b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #43qwen3-6-27b-non-reasoningAlibaba Group | 93.57% | aa_slug=qwen3-6-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #44grok-4-1-fast-reasoningSpaceXAI | 93.27% | aa_slug=grok-4-1-fast-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #45mimo-v2-0206Xiaomi | 93.27% | aa_slug=mimo-v2-0206 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #46tri-21b-think-previewTrillion Labs | 93.27% | aa_slug=tri-21b-think-preview · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #47jt-miniChina Mobile | 92.98% | aa_slug=jt-mini · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #48Kimi K2 ThinkingMoonshot AI | 92.98% | aa_slug=kimi-k2-thinking · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #49Qwen 3.7 PlusQwen | 92.98% | aa_slug=qwen3-7-plus · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #50Grok 4.20xAI | 92.98% | aa_slug=grok-4-20 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #51gpt-5-5-highOpenAI | 92.98% | aa_slug=gpt-5-5-high · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #52Hy3 previewTencent | 92.69% | aa_slug=hy3-preview · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #53nova-2-0-pro-reasoning-mediumAmazon Web Services | 92.69% | aa_slug=nova-2-0-pro-reasoning-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #54ring-2-6-1tinclusionAI | 92.4% | aa_slug=ring-2-6-1t · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #55GPT-5.2-CodexOpenAI | 92.11% | aa_slug=gpt-5-2-codex · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #56Qwen3.5-4BQwen | 92.11% | aa_slug=qwen3-5-4b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #57claude-opus-4-6-adaptiveAnthropic | 92.11% | aa_slug=claude-opus-4-6-adaptive · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #58glm-4-7-flash-non-reasoningZ.ai (Zhipu AI) | 91.81% | aa_slug=glm-4-7-flash-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #59gpt-5-5-mediumOpenAI | 91.81% | aa_slug=gpt-5-5-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #60muse-sparkMeta AI | 91.52% | aa_slug=muse-spark · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #61mimo-v2-omniXiaomi | 91.23% | aa_slug=mimo-v2-omni · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #62grok-4-3-mediumSpaceXAI | 91.23% | aa_slug=grok-4-3-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #63deepseek-v4-pro-0424-non-reasoningDeepSeek | 91.23% | aa_slug=deepseek-v4-pro-0424-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #64DeepSeek V3.2DeepSeek | 90.64% | aa_slug=deepseek-v3-2-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #65nova-2-0-pro-reasoning-lowAmazon Web Services | 90.64% | aa_slug=nova-2-0-pro-reasoning-low · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #66MiMo-V2.5Xiaomi | 90.64% | aa_slug=mimo-v2-5-0424 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #67grok-3-mini-reasoningSpaceXAI | 90.35% | aa_slug=grok-3-mini-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #68Kimi K2.7 CodeMoonshot AI | 90.06% | aa_slug=kimi-k2-7-code · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #69Trinity Large ThinkingArcee AI | 90.06% | aa_slug=trinity-large-thinking · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #70ling-2-6-1tinclusionAI | 89.77% | aa_slug=ling-2-6-1t · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #71KAT-Coder-Pro V2Kwaipilot | 89.47% | aa_slug=kat-coder-pro-v2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #72claude-opus-4-5-thinkingAnthropic | 89.47% | aa_slug=claude-opus-4-5-thinking · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #73Qwen3.5-35B-A3BQwen | 89.18% | aa_slug=qwen3-5-35b-a3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #74MiniMax M3MiniMax | 88.89% | aa_slug=minimax-m3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #75grok-4-3-lowSpaceXAI | 88.89% | aa_slug=grok-4-3-low · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #76kat-coder-pro-v1KwaiKAT | 88.6% | aa_slug=kat-coder-pro-v1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #77Claude Opus 4.7Anthropic | 88.6% | aa_slug=claude-opus-4-7 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #78qwen3-5-omni-plusAlibaba Group | 88.3% | aa_slug=qwen3-5-omni-plus · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #79mimo-v2-omni-0327Xiaomi | 88.01% | aa_slug=mimo-v2-omni-0327 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #80minicpm-v4-6-1-3bOpenBMB | 87.72% | aa_slug=minicpm-v4-6-1-3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #81qwen3-5-4b-non-reasoningAlibaba Group | 87.72% | aa_slug=qwen3-5-4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #82hyperclova-x-seed-think-32bNaver | 87.43% | aa_slug=hyperclova-x-seed-think-32b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #83step-3-5-flashStepFun | 87.43% | aa_slug=step-3-5-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #84gpt-5.4OpenAI | 87.13% | aa_slug=gpt-5-4 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #85qwen3-5-27b-non-reasoningAlibaba Group | 87.13% | aa_slug=qwen3-5-27b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #86gemini-3-proGoogle | 87.13% | aa_slug=gemini-3-pro · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #87MiniMax M2MiniMax | 86.84% | aa_slug=minimax-m2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #88Qwen3.5-9BQwen | 86.84% | aa_slug=qwen3-5-9b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #89GPT-5-CodexOpenAI | 86.84% | aa_slug=gpt-5-codex · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #90gpt-5 (medium)OpenAI | 86.55% | aa_slug=gpt-5-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #91mi-dm-k-2-5-pro-dec28Korea Telecom | 86.55% | aa_slug=mi-dm-k-2-5-pro-dec28 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #92Solar Pro 3Upstage | 86.26% | aa_slug=solar-pro-3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #93Claude Opus 4.5Anthropic | 86.26% | aa_slug=claude-opus-4-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #94qwen3-5-35b-a3b-non-reasoningAlibaba Group | 86.26% | aa_slug=qwen3-5-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #95gpt-5.6-terraOpenAI | 86.26% | aa_slug=gpt-5-6-terra · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #96ling-2-6-flashinclusionAI | 85.96% | aa_slug=ling-2-6-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #97gpt-5.3-codexOpenAI | 85.96% | aa_slug=gpt-5-3-codex · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #98MiniMax M2.1MiniMax | 85.38% | aa_slug=minimax-m2-1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #99gpt-5-6-solOpenAI | 85.09% | aa_slug=gpt-5-6-sol · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #100qwen3-6-35b-a3b-non-reasoningAlibaba Group | 85.09% | aa_slug=qwen3-6-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
Definition
- Category
- agentic
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 5 h agomedium
- Task
- dual-control tool-agent-user interaction (telecom, retail, airline)
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 5 h agomedium
- Metric
- pass^1 · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 5 h agomedium
- Direction
- Higher is better
- Paper
- https://arxiv.org/abs/2506.07982
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 5 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, gemma-4-12B, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2, nova-2-0-lite-reasoning-medium, lfm2-24b-a2b +432(440 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| agentic | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| pass^1 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Paperpaper1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://arxiv.org/abs/2506.07982 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| dual-control tool-agent-user interaction (telecom, retail, airline) | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 4 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.