τ²-bench
dual-control tool-agent-user interaction (telecom, retail, airline)
Updated 3 h ago · first seen 11 Sept 2026
- Metric
- pass^1 · % ↑
- Current results
- 880
- Models
- 326
- Current leader
- Z.ai GLM 5.2 99.1%
Frontier over time · pass^1 · variant=Telecom · evaluator=Artificial Analysis
2 leader changes recorded, all dated 12 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 99.1%Z.ai GLM 5.2 Z.ai (Zhipu AI) Independent12 Sept 2026
- 90.3%grok-3-mini-reasoning SpaceXAI Independent12 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 308 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 100 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 | 78.1% | Independent | reasoningon | Partially comparable0.00 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 102 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 76.9% | Independent | reasoningoff | Partially comparable-1.17 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows | 76.0% | Independent | reasoning_effortxhigh | Partially comparable-2.05 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | Grok Build 0.1ClosedxAI · Grok | 75.7% | Independent | reasoningon | Partially comparable-2.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 75.7% | Independent | reasoningonreasoning_effortmedium | Partially comparable-2.34 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | grok-4ClosedSpaceXAI · Grok 4 | 74.8% | Independent | reasoningon | Partially comparable-3.22 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows | 74.3% | Independent | reasoningon | Partially comparable-3.80 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | Kimi K2 0905Open weightsMoonshot AI · Kimi | 73.4% | Independent | reasoningoff | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | claude-4-opusClosedAnthropic · Claude 4 | 73.4% | Independent | reasoningon | Partially comparable-4.68 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | Claude Opus 4.1ClosedAnthropic · Claude | 71.4% | Independent | reasoningon | Partially comparable-6.70 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows | 71.0% | Independent | reasoning_effortmedium | Partially comparable-7.02 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | Mercury 2ClosedInception | 70.8% | Independent | reasoningon | Partially comparable-7.31 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | apriel-v1-6-15b-thinkerOpen weightsServiceNow | 69.3% | Independent | reasoningon | Partially comparable-8.77 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 68.4% | Independent | reasoningon | Partially comparable-9.65 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 115 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 | 67.8% | Independent | reasoningon | Partially comparable-10.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows | 65.8% | Independent | reasoning_efforthigh | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 2 rows | 65.8% | Independent | reasoningon | Partially comparable-12.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 118 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 2 rows | 65.5% | Independent | reasoningoff | Partially comparable-12.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | Qwen3.5-0.8BOpen weightsQwen · Qwen3.5 · best of 2 rows | 65.2% | Independent | reasoningoff | Partially comparable-12.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 64.6% | Independent | reasoningon | Partially comparable-13.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | hypernova-60bOpen weightsMultiverse Computing | 63.2% | Independent | reasoning_efforthigh | Partially comparable-14.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 | 62.9% | Independent | reasoning_efforthigh | Partially comparable-15.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | o1ClosedOpenAI · OpenAI o-series | 62.6% | Independent | reasoningon | Partially comparable-15.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 61.1% | Independent | reasoningoff | Partially comparable-17.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 125 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows | 60.2% | Independent | reasoning_efforthigh | Partially comparable-17.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | doubao-seed-codeClosedByteDance · Seed | 58.2% | Independent | reasoningon | Partially comparable-19.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | o4-miniClosedOpenAI · OpenAI o-series | 55.6% | Independent | reasoning_efforthigh | Partially comparable-22.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 2 rows | 54.7% | Independent | reasoningon | Partially comparable-23.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 2 rows | 54.7% | Independent | reasoningon | Partially comparable-23.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 | 54.1% | Independent | reasoningon | Partially comparable-24.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 54.1% | Independent | reasoningon | Partially comparable-24.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 2 rows | 53.2% | Independent | reasoningon | Partially comparable-24.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron | 53.2% | Independent | reasoningon | Partially comparable-24.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | gpt-4.1-miniClosedOpenAI · GPT 4.1 | 52.9% | Independent | reasoningoff | Partially comparable-25.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | Magistral Medium 1.2ClosedMistral AI · Magistral | 52.0% | Independent | reasoningon | Partially comparable-26.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed | 49.4% | Independent | reasoningon | Partially comparable-28.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 | 49.4% | Independent | reasoningon | Partially comparable-28.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | midm-250-pro-rsnsftClosedKorea Telecom | 49.4% | Independent | reasoningon | Partially comparable-28.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | grok-3ClosedSpaceXAI · Grok 3 | 48.8% | Independent | reasoningoff | Partially comparable-29.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 140 | solar-open-100b-reasoningOpen weightsUpstage · Solar | 48.3% | Independent | reasoningon | Partially comparable-29.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 47.1% | Independent | reasoningoff | Partially comparable-31.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | gpt-4.1ClosedOpenAI · GPT 4.1 | 47.1% | Independent | reasoningoff | Partially comparable-31.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | sarvam-105bOpen weightsSarvam | 46.8% | Independent | reasoning_efforthigh | Partially comparable-31.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | GLM 4.5 AirOpen weightsZ.ai (Zhipu AI) · GLM4.5 | 46.5% | Independent | reasoningon | Partially comparable-31.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | motif-2-12-7bClosedMotif Technologies | 46.5% | Independent | reasoningon | Partially comparable-31.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 45.6% | Independent | reasoningon | Partially comparable-32.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 4 rows | 45.6% | Independent | reasoningon | Partially comparable-32.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 148 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 | 45.3% | Independent | reasoningon | Partially comparable-32.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 43.6% | Independent | reasoningon | Partially comparable-34.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 149 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 43.6% | Independent | reasoningoff | Partially comparable-34.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 | 43.0% | Independent | reasoningon | Partially comparable-35.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 152 | granite-4.1-30bOpen weightsIBM · Granite 4.1 | 42.1% | Independent | reasoningoff | Partially comparable-36.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 41.5% | Independent | reasoningon | Partially comparable-36.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | Mistral Small 4Open weightsMistral AI · Mistral · best of 2 rows | 41.2% | Independent | reasoningon | Partially comparable-36.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 155 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 40.9% | Independent | reasoningon | Partially comparable-37.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | Mistral Medium 3.1ClosedMistral AI · Mistral | 40.6% | Independent | reasoningoff | Partially comparable-37.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 157 | nova-premierClosedAmazon Web Services · Nova | 38.3% | Independent | reasoningoff | Partially comparable-39.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | Devstral Small 1.0Open weightsMistral AI · Devstral | 38.0% | Independent | reasoningoff | Partially comparable-40.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 37.4% | Independent | reasoningon | Partially comparable-40.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | North Mini Code (free)Open weightsCohere | 37.4% | Independent | reasoningon | Partially comparable-40.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 161 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 2 rows | 37.1% | Independent | reasoningoff | Partially comparable-40.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | Pixtral LargeOpen weightsMistral AI · Pixtral | 36.5% | Independent | reasoningoff | Partially comparable-41.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | deepseek-r1Open weightsDeepSeek · DeepSeek-R1 | 36.5% | Independent | reasoningon | Partially comparable-41.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows | 36.5% | Independent | reasoning_efforthigh | Partially comparable-41.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows | 36.3% | Independent | reasoningon | Partially comparable-41.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Qwen2.5 72B InstructOpen weightsQwen · Qwen2.5 | 34.5% | Independent | reasoningoff | Partially comparable-43.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Qwen3 Coder 30B A3B InstructOpen weightsQwen · Qwen3 | 34.5% | Independent | reasoningoff | Partially comparable-43.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | qwen3-14b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 34.5% | Independent | reasoningon | Partially comparable-43.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | sarvam-30bOpen weightsSarvam | 34.5% | Independent | reasoning_efforthigh | Partially comparable-43.6 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax | 34.2% | Independent | reasoningon | Partially comparable-43.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 171 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 33.9% | Independent | reasoningon | Partially comparable-44.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | Mistral Large 2.0Open weightsMistral AI · Mistral | 33.0% | Independent | reasoningoff | Partially comparable-45.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | ling-1tOpen weightsinclusionAI | 32.8% | Independent | reasoningoff | Partially comparable-45.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | qwen3-max-previewClosedAlibaba Group · Qwen3 | 32.8% | Independent | reasoningoff | Partially comparable-45.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | solar-pro-2ClosedUpstage · Solar · best of 2 rows | 31.9% | Independent | reasoningoff | Partially comparable-46.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | GLM 4.6VOpen weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 31.6% | Independent | reasoningon | Partially comparable-46.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 176 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax | 31.6% | Independent | reasoningon | Partially comparable-46.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 | 31.3% | Independent | reasoningon | Partially comparable-46.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 178 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 31.3% | Independent | reasoning_efforthigh | Partially comparable-46.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 3 rows | 30.7% | Independent | reasoningon | Partially comparable-47.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | mistral-large-2Open weightsMistral AI · Mistral | 30.7% | Independent | reasoningoff | Partially comparable-47.4 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 182 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 | 30.4% | Independent | reasoningoff | Partially comparable-47.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 183 | qwen3-32b-instructOpen weightsAlibaba Group · Qwen3 | 29.8% | Independent | reasoningon | Partially comparable-48.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | Gemini 2.0 FlashClosedGoogle · Gemini 2.0 | 29.5% | Independent | reasoningoff | Partially comparable-48.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | Mistral Small 3.2Open weightsMistral AI · Mistral | 29.5% | Independent | reasoningoff | Partially comparable-48.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Qwen3 VL 8B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 29.2% | Independent | reasoningoff | Partially comparable-48.8 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | GPT-4o (2024-08-06)ClosedOpenAI · GPT 4 | 28.9% | Independent | reasoningoff | Partially comparable-49.1 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 188 | devstral-smallOpen weightsMistral AI · Devstral | 28.4% | Independent | reasoningoff | Partially comparable-49.7 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | llama-nemotron-super-49b-v1-5Open weightsNVIDIA · Llama · best of 2 rows | 28.1% | Independent | reasoningon | Partially comparable-50.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 | 28.1% | Independent | reasoningon | Partially comparable-50.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 2 rows | 28.1% | Independent | reasoningon | Partially comparable-50.0 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | Magistral Small 1.2Open weightsMistral AI · Magistral | 27.8% | Independent | reasoningon | Partially comparable-50.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | falcon-h1r-7bOpen weightsTII UAE · Falcon | 27.8% | Independent | reasoningon | Partially comparable-50.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | granite-4.1-8bOpen weightsIBM · Granite 4.1 | 27.8% | Independent | reasoningoff | Partially comparable-50.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 3 rows | 27.8% | Independent | reasoning_efforthigh | Partially comparable-50.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 192 | qwen3-8b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 27.8% | Independent | reasoningon | Partially comparable-50.3 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | Ministral 3 14BOpen weightsMistral AI · Ministral 3 | 27.2% | Independent | reasoningoff | Partially comparable-50.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | qwen3-235b-a22b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 27.2% | Independent | reasoningoff | Partially comparable-50.9 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 199 | llama-3-3-nemotron-super-49bOpen weightsNVIDIA · Llama 3.3 | 26.9% | Independent | reasoningon | Partially comparable-51.2 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | Llama 3.3 70BOpen weightsMeta AI · Llama 3.3 | 26.6% | Independent | reasoningoff | Partially comparable-51.5 pt | obs. 12 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →