τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 10 h ago · first seen 11 Sept 2026
- Metric
- — · % ↑
- Current results
- 0
- Models
- 0
- Current leader
- —
No results recorded for this benchmark yet — its sources are being connected. The definition, aliases and variants are kept so links resolve; nothing is fabricated.
Score history · Qwen3 32B 1 row
Not enough history to chart — a single observation (29.82% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 29.82%aa_slug=qwen3-32b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 440 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 299 | hermes-4-llama-3-1-405bOpen weightsNous Research | 26.6% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 299 | intellect-3Open weightsPrime Intellect | 26.6% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 299 | magistral-smallOpen weightsMistral AI | 26.6% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 299 | qwen3-4b-2507-instructOpen weightsAlibaba Group | 26.6% | Independent | group defaults | Comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 305 | ring-1tOpen weightsinclusionAI | 26.3% | Independent | group defaults | Comparable-0.29 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | gemma-4-e4b-non-reasoningOpen weightsGoogle | 26.0% | Independent | group defaults | Comparable-0.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | qwen3-1.7b-instruct-reasoningOpen weightsAlibaba Group | 26.0% | Independent | group defaults | Comparable-0.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 306 | qwen3-30b-a3b-instruct-reasoningOpen weightsAlibaba Group | 26.0% | Independent | group defaults | Comparable-0.59 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 309 | gpt-5-nano-minimalClosedOpenAI | 25.7% | Independent | group defaults | Comparable-0.88 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 310 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA | 25.4% | Independent | group defaults | Comparable-1.17 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 310 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models | 25.4% | Independent | group defaults | Comparable-1.17 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 310 | qwen3-4b-2507-instruct-reasoningOpen weightsAlibaba Group | 25.4% | Independent | group defaults | Comparable-1.17 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | Mistral Small 3.1Open weightsMistral AI | 25.1% | Independent | group defaults | Comparable-1.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | gpt-4oClosedOpenAI | 25.1% | Independent | group defaults | Comparable-1.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 313 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA | 25.1% | Independent | group defaults | Comparable-1.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | Devstral 2Open weightsMistral AI | 24.9% | Independent | group defaults | Comparable-1.76 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | Ministral 3 3BOpen weightsMistral AI | 24.9% | Independent | group defaults | Comparable-1.76 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | k2-v2-mediumOpen weightsMBZUAI Institute of Foundation Models | 24.9% | Independent | group defaults | Comparable-1.76 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 316 | qwen3-8b-instructOpen weightsAlibaba Group | 24.9% | Independent | group defaults | Comparable-1.76 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 320 | Claude Haiku 3.5ClosedAnthropic · Claude | 24.6% | Independent | group defaults | Comparable-2.05 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 320 | Mistral Large 3Open weightsMistral AI | 24.6% | Independent | group defaults | Comparable-2.05 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 322 | Mistral Medium 3ClosedMistral AI | 24.3% | Independent | group defaults | Comparable-2.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 323 | qwen3-235b-a22b-instruct-reasoningOpen weightsAlibaba Group | 24.0% | Independent | group defaults | Comparable-2.63 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 324 | Devstral Small 2Open weightsMistral AI | 23.4% | Independent | group defaults | Comparable-3.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 324 | Qwen3-VL-4B-InstructOpen weightsQwen | 23.4% | Independent | group defaults | Comparable-3.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 324 | gpt-5-4-mini-non-reasoningClosedOpenAI | 23.4% | Independent | group defaults | Comparable-3.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 324 | nvidia-nemotron-nano-9b-v2Open weightsNVIDIA | 23.4% | Independent | group defaults | Comparable-3.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 328 | llama-3-1-nemotron-instruct-70bOpen weightsNVIDIA | 23.1% | Independent | group defaults | Comparable-3.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 328 | magistral-mediumClosedMistral AI | 23.1% | Independent | group defaults | Comparable-3.51 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 330 | deepseek-v3Open weightsDeepSeek | 22.8% | Independent | group defaults | Comparable-3.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 330 | granite-4-0-nano-1bOpen weightsIBM | 22.8% | Independent | group defaults | Comparable-3.80 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 332 | GLM 4.5VOpen weightsZ.ai (Zhipu AI) | 22.5% | Independent | group defaults | Comparable-4.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 332 | Hermes-4-70BOpen weightsNous Research | 22.5% | Independent | group defaults | Comparable-4.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 332 | qwen3-vl-8b-reasoningOpen weightsAlibaba Group | 22.5% | Independent | group defaults | Comparable-4.10 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 335 | Hermes 4 405BOpen weightsNous Research | 22.2% | Independent | group defaults | Comparable-4.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 335 | gemma-4-e2b-non-reasoningOpen weightsGoogle | 22.2% | Independent | group defaults | Comparable-4.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 335 | qwen3-30b-a3b-instructOpen weightsAlibaba Group | 22.2% | Independent | group defaults | Comparable-4.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 338 | NVIDIA-Nemotron-Nano-9B-v2Open weightsNVIDIA | 21.9% | Independent | group defaults | Comparable-4.68 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 338 | R1 Distill Llama 70BOpen weightsDeepSeek | 21.9% | Independent | group defaults | Comparable-4.68 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 340 | Qwen3 Next 80B A3B InstructOpen weightsQwen | 21.6% | Independent | group defaults | Comparable-4.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 340 | hermes-4-llama-3-1-70bOpen weightsNous Research | 21.6% | Independent | group defaults | Comparable-4.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 340 | nanbeige4-1-3bOpen weightsNanbeige | 21.6% | Independent | group defaults | Comparable-4.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 340 | qwen3-1.7b-instructOpen weightsAlibaba Group | 21.6% | Independent | group defaults | Comparable-4.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | nvidia-nemotron-nano-12b-v2-vl-reasoningOpen weightsNVIDIA | 21.4% | Independent | group defaults | Comparable-5.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI | 21.4% | Independent | group defaults | Comparable-5.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 344 | qwen3-omni-30b-a3b-reasoningOpen weightsAlibaba Group | 21.4% | Independent | group defaults | Comparable-5.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 347 | Claude 3 HaikuClosedAnthropic · Claude | 21.1% | Independent | group defaults | Comparable-5.56 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 347 | Llama-3.2-3BRestricted weightsMeta AI | 21.1% | Independent | group defaults | Comparable-5.56 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 347 | Qwen3-0.6BOpen weightsQwen | 21.1% | Independent | group defaults | Comparable-5.56 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | gemma-4-E2BOpen weightsGoogle | 20.8% | Independent | group defaults | Comparable-5.85 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | gemma-4-E4BOpen weightsGoogle | 20.8% | Independent | group defaults | Comparable-5.85 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | k2-v2-lowOpen weightsMBZUAI Institute of Foundation Models | 20.8% | Independent | group defaults | Comparable-5.85 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 350 | ling-flash-2-0Open weightsinclusionAI | 20.8% | Independent | group defaults | Comparable-5.85 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 354 | exaone-4-0-1-2bOpen weightsLG AI Research | 20.5% | Independent | group defaults | Comparable-6.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 355 | solar-miniOpen weightsUpstage | 20.2% | Independent | group defaults | Comparable-6.43 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 356 | devstral-mediumClosedMistral AI | 19.9% | Independent | group defaults | Comparable-6.73 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 356 | qwen3-vl-30b-a3b-reasoningOpen weightsAlibaba Group | 19.9% | Independent | group defaults | Comparable-6.73 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | Mistral Small 3Open weightsMistral AI | 19.6% | Independent | group defaults | Comparable-7.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | glm-4-5vOpen weightsZ.ai (Zhipu AI) | 19.6% | Independent | group defaults | Comparable-7.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | granite-4-0-h-nano-1bOpen weightsIBM | 19.6% | Independent | group defaults | Comparable-7.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | granite-4.1-3bOpen weightsIBM | 19.6% | Independent | group defaults | Comparable-7.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 358 | lfm2-5-1-2b-thinkingOpen weightsLiquid AI | 19.6% | Independent | group defaults | Comparable-7.02 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 363 | nvidia-nemotron-nano-12b-v2-vlOpen weightsNVIDIA | 19.3% | Independent | group defaults | Comparable-7.31 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 364 | Llama-3.1-405BRestricted weightsMeta AI | 19.0% | Independent | group defaults | Comparable-7.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 364 | Qwen3 VL 30B A3B InstructOpen weightsQwen | 19.0% | Independent | group defaults | Comparable-7.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 364 | Qwen3-4BOpen weightsQwen | 19.0% | Independent | group defaults | Comparable-7.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 364 | gemini-2-5-flash-liteClosedGoogle | 19.0% | Independent | group defaults | Comparable-7.60 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 368 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini | 18.4% | Independent | group defaults | Comparable-8.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 368 | mistral-small-4-non-reasoningOpen weightsMistral AI | 18.4% | Independent | group defaults | Comparable-8.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 370 | Llama 4 MaverickOpen weightsMeta AI | 17.8% | Independent | group defaults | Comparable-8.77 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 371 | nova-liteClosedAmazon Web Services | 17.5% | Independent | group defaults | Comparable-9.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 372 | exaone-4-0-32b-reasoningOpen weightsLG AI Research | 17.3% | Independent | group defaults | Comparable-9.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 372 | gpt-4.1-nanoClosedOpenAI | 17.3% | Independent | group defaults | Comparable-9.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 372 | granite-4-0-h-smallOpen weightsIBM | 17.3% | Independent | group defaults | Comparable-9.36 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 375 | Llama 3.1 8BRestricted weightsMeta AI | 16.4% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 375 | exaone-4-0-1-2b-reasoningOpen weightsLG AI Research | 16.4% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 375 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group | 16.4% | Independent | group defaults | Comparable-10.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | LFM2.5-8B-A1BOpen weightsLiquid AI | 16.1% | Independent | group defaults | Comparable-10.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 378 | step-3-vl-10bOpen weightsStepFun | 16.1% | Independent | group defaults | Comparable-10.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 380 | jamba-reasoning-3bOpen weightsAI21 Labs | 15.8% | Independent | group defaults | Comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 381 | Llama 4 ScoutRestricted weightsMeta AI | 15.5% | Independent | group defaults | Comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 381 | qwen3-vl-4b-reasoningOpen weightsAlibaba Group | 15.5% | Independent | group defaults | Comparable-11.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 383 | Command AOpen weightsCohere | 15.2% | Independent | group defaults | Comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 383 | Llama-3.1-70BOpen weightsMeta AI | 15.2% | Independent | group defaults | Comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 385 | Gemini 2.5 FlashClosedGoogle · Gemini | 14.9% | Independent | group defaults | Comparable-11.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 386 | granite-4-0-h-350mOpen weightsIBM | 14.6% | Independent | group defaults | Comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 386 | llama-3-2-instruct-11b-visionOpen weightsMeta AI | 14.6% | Independent | group defaults | Comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 386 | qwen3-0.6b-instructOpen weightsAlibaba Group | 14.6% | Independent | group defaults | Comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 389 | nova-microClosedAmazon Web Services | 14.0% | Independent | group defaults | Comparable-12.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 389 | nova-proClosedAmazon Web Services | 14.0% | Independent | group defaults | Comparable-12.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 391 | jamba-1-7-largeOpen weightsAI21 Labs | 13.4% | Independent | group defaults | Comparable-13.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 391 | lfm2-2-6bOpen weightsLiquid AI | 13.4% | Independent | group defaults | Comparable-13.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 393 | granite-4-0-350mOpen weightsIBM | 13.2% | Independent | group defaults | Comparable-13.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 393 | ling-mini-2-0Open weightsinclusionAI | 13.2% | Independent | group defaults | Comparable-13.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 395 | apertus-70b-instructOpen weightsSwiss AI Initiative | 12.9% | Independent | group defaults | Comparable-13.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 396 | Granite 4.0 MicroOpen weightsIBM | 12.6% | Independent | group defaults | Comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 396 | LFM2-1.2BOpen weightsLiquid AI | 12.6% | Independent | group defaults | Comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 396 | Olmo-3-7B-InstructOpen weightsAllen Institute for AI | 12.6% | Independent | group defaults | Comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 396 | jamba-1-7-miniOpen weightsAI21 Labs | 12.6% | Independent | group defaults | Comparable-14.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 400 | llama-3-1-nemotron-nano-4b-reasoningOpen weightsNVIDIA | 11.7% | Independent | group defaults | Comparable-14.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →