IFBench
precise instruction following with novel constraints
Updated 27 min ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 450
- Models
- 333
- Current leader
- Grok 4.3 83.3%
Score history · jt-mini 1 row
Not enough history to chart — a single observation (36.67% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 36.67%aa_slug=jt-mini · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · evaluator=Artificial Analysis
6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 83.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.2%Grok 4.20 xAI Independent11 Sept 2026
- 81.0%Grok 4.3 xAI Independent11 Sept 2026
- 73.5%gemma-4-12B Google Independent11 Sept 2026
- 45.9%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 333 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 101 | DeepSeek V3.2Open weightsDeepSeek · DeepSeek-V3 | 60.7% | Independent | group defaults | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 101 | Qwen3 Next 80B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 60.7% | Independent | reasoningon | Partially comparable0.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 103 | k2-v2Open weightsMBZUAI Institute of Foundation Models · best of 3 rows | 60.1% | Independent | group defaults | Partially comparable-0.54 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 104 | diffusiongemma-26b-a4bOpen weightsGoogle | 59.5% | Independent | group defaults | Partially comparable-1.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 105 | Qwen3 VL 32B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 59.4% | Independent | reasoningon | Partially comparable-1.29 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 106 | Claude Opus 4.7ClosedAnthropic · Claude · best of 2 rows | 58.6% | Independent | group defaults | Partially comparable-2.04 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 107 | nvidia-nemotron-3-nano-4bOpen weightsNVIDIA · Nemotron 3 | 58.2% | Independent | group defaults | Partially comparable-2.45 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | Claude Opus 4.5ClosedAnthropic · Claude · best of 2 rows | 58.0% | Independent | reasoningon | Partially comparable-2.72 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 108 | exaone-4-5-33bOpen weightsLG AI Research · EXAONE 4.5 | 58.0% | Independent | group defaults | Partially comparable-2.72 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 110 | solar-open-100b-reasoningOpen weightsUpstage · Solar | 57.7% | Independent | group defaults | Partially comparable-2.99 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 111 | North Mini Code (free)Open weightsCohere | 57.5% | Independent | group defaults | Partially comparable-3.13 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 112 | ling-2-6-flashOpen weightsinclusionAI | 57.4% | Independent | group defaults | Partially comparable-3.27 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 113 | Claude Sonnet 4.5ClosedAnthropic · Claude · best of 2 rows | 57.3% | Independent | reasoningon | Partially comparable-3.40 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | DeepSeek V3.1 TerminusOpen weightsDeepSeek · DeepSeek · best of 2 rows | 57.0% | Independent | reasoningon | Partially comparable-3.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 114 | motif-2-12-7bClosedMotif Technologies | 57.0% | Independent | group defaults | Partially comparable-3.67 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 116 | ling-2-6-1tOpen weightsinclusionAI | 56.9% | Independent | group defaults | Partially comparable-3.81 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 117 | Claude Sonnet 4.6ClosedAnthropic · Claude · best of 3 rows | 56.6% | Independent | reasoningadaptive | Partially comparable-4.08 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 118 | Qwen3 VL 235B A22B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 56.5% | Independent | reasoningon | Partially comparable-4.22 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 119 | Trinity Large ThinkingOpen weightsArcee AI | 56.3% | Independent | group defaults | Partially comparable-4.42 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 120 | LFM2.5-8B-A1BOpen weightsLiquid AI · LFM2.5 | 55.6% | Independent | group defaults | Partially comparable-5.03 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 121 | Claude Opus 4.1ClosedAnthropic · Claude | 55.4% | Independent | reasoningon | Partially comparable-5.24 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 122 | gemini-3-flashClosedGoogle · Gemini 3 | 55.1% | Independent | group defaults | Partially comparable-5.58 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 123 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 54.7% | Independent | reasoningon | Partially comparable-5.99 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 124 | tri-21b-think-v0-5Open weightsTrillion Labs | 54.6% | Independent | group defaults | Partially comparable-6.05 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 125 | falcon-h1r-7bOpen weightsTII UAE · Falcon | 54.4% | Independent | group defaults | Partially comparable-6.26 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 126 | Claude Haiku 4.5ClosedAnthropic · Claude · best of 2 rows | 54.3% | Independent | reasoningon | Partially comparable-6.39 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 127 | DeepSeek V3.2 ExpOpen weightsDeepSeek · DeepSeek-V3 | 54.1% | Independent | group defaults | Partially comparable-6.53 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 128 | qwen3-max-thinking-previewClosedAlibaba Group · Qwen3 | 53.8% | Independent | group defaults | Partially comparable-6.87 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 129 | Claude Opus 4ClosedAnthropic · Claude | 53.7% | Independent | group defaults | Partially comparable-6.94 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 130 | grok-4ClosedSpaceXAI · Grok 4 | 53.7% | Independent | group defaults | Partially comparable-7.01 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 131 | mimo-v2-omniClosedXiaomi | 53.5% | Independent | group defaults | Partially comparable-7.14 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 132 | Claude Opus 4.6ClosedAnthropic · Claude · best of 2 rows | 53.1% | Independent | reasoningadaptive | Partially comparable-7.55 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 133 | grok-4-1-fastClosedSpaceXAI · Grok 4.1 · best of 2 rows | 52.7% | Independent | reasoningon | Partially comparable-7.96 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 134 | gemini-2-5-flash-lite-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 52.6% | Independent | reasoningon | Partially comparable-8.09 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 135 | jamba-reasoning-3bOpen weightsAI21 Labs · Jamba | 52.5% | Independent | group defaults | Partially comparable-8.23 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 136 | gemini-2-5-flash-preview-09-2025ClosedGoogle · Gemini 2.5 · best of 2 rows | 52.3% | Independent | reasoningon | Partially comparable-8.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 137 | Qwen3.5-4BOpen weightsQwen · Qwen3.5 · best of 2 rows | 52.0% | Independent | group defaults | Partially comparable-8.71 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 138 | doubao-seed-codeClosedByteDance · Seed | 51.4% | Independent | group defaults | Partially comparable-9.25 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 139 | Qwen3 235B A22B Instruct 2507Open weightsQwen · Qwen3 · best of 2 rows | 51.2% | Independent | group defaults | Partially comparable-9.46 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 140 | qwen3-5-omni-plusClosedAlibaba Group · Qwen3.5 | 51.2% | Independent | group defaults | Partially comparable-9.52 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 141 | qwen3-30b-a3b-2507Open weightsAlibaba Group · Qwen3 · best of 2 rows | 50.7% | Independent | reasoningon | Partially comparable-10.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 142 | grok-4-fastClosedSpaceXAI · Grok 4 · best of 2 rows | 50.5% | Independent | reasoningon | Partially comparable-10.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 143 | Gemini 2.5 FlashClosedGoogle · Gemini 2.5 · best of 2 rows | 50.3% | Independent | reasoningon | Partially comparable-10.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 144 | step-3-vl-10bOpen weightsStepFun · Step3 | 50.2% | Independent | group defaults | Partially comparable-10.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 145 | Gemini 2.5 Flash-LiteClosedGoogle · Gemini 2.5 · best of 2 rows | 49.9% | Independent | group defaults | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 146 | qwen3-4b-2507-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 49.8% | Independent | reasoningon | Partially comparable-10.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | grok-4.20-0309-non-reasoningClosedxAI · Grok | 49.3% | Independent | group defaults | Partially comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | mi-dm-k-2-5-pro-dec28ClosedKorea Telecom | 49.3% | Independent | group defaults | Partially comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 147 | minicpm5-1bOpen weightsOpenBMB · best of 2 rows | 49.3% | Independent | group defaults | Partially comparable-11.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 150 | olmo-3-32b-thinkOpen weightsAllen Institute for AI · OLMo 3 | 49.1% | Independent | group defaults | Partially comparable-11.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 151 | DeepSeek V3Open weightsDeepSeek · DeepSeek · best of 2 rows | 49.0% | Independent | group defaults | Partially comparable-11.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 152 | Gemini 2.5 ProClosedGoogle · Gemini 2.5 | 48.7% | Independent | group defaults | Partially comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 153 | Claude 3.7 SonnetClosedAnthropic · Claude · best of 2 rows | 48.3% | Independent | reasoningon | Partially comparable-12.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 154 | Mistral Small 4Open weightsMistral AI · Mistral · best of 2 rows | 48.2% | Independent | group defaults | Partially comparable-12.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 155 | qwen3-max-previewClosedAlibaba Group · Qwen3 | 48.0% | Independent | group defaults | Partially comparable-12.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 156 | Hy3Open weightsTencent | 48.0% | Independent | reasoningoff | Partially comparable-12.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 157 | deepseek-v4-flash-0420-non-reasoningOpen weightsDeepSeek · DeepSeek | 47.2% | Independent | group defaults | Partially comparable-13.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 158 | tri-21b-think-previewOpen weightsTrillion Labs | 47.1% | Independent | group defaults | Partially comparable-13.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 159 | Llama 3.3 70BOpen weightsMeta AI · Llama 3.3 | 47.1% | Independent | group defaults | Partially comparable-13.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 160 | grok-3ClosedSpaceXAI · Grok 3 | 46.9% | Independent | group defaults | Partially comparable-13.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 161 | cogito-v2-1-reasoningOpen weightsDeep Cogito · Cogito | 46.3% | Independent | group defaults | Partially comparable-14.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | grok-3-mini-reasoningClosedSpaceXAI · Grok 3 | 45.9% | Independent | group defaults | Partially comparable-14.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 162 | lfm2-24b-a2bOpen weightsLiquid AI · LFM2 | 45.9% | Independent | group defaults | Partially comparable-14.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 164 | deepseek-v4-pro-0424-non-reasoningOpen weightsDeepSeek · DeepSeek | 45.8% | Independent | group defaults | Partially comparable-14.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 165 | midm-250-pro-rsnsftClosedKorea Telecom | 45.6% | Independent | group defaults | Partially comparable-15.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 166 | Qwen3 VL 30B A3B InstructOpen weightsQwen · Qwen3 · best of 2 rows | 45.1% | Independent | reasoningon | Partially comparable-15.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 167 | gpt-5-chatgptClosedOpenAI · GPT 5 | 45.0% | Independent | group defaults | Partially comparable-15.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | ring-1tOpen weightsinclusionAI | 44.6% | Independent | group defaults | Partially comparable-16.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 168 | ring-2-6-1tOpen weightsinclusionAI | 44.6% | Independent | group defaults | Partially comparable-16.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | Magistral Small 1.2Open weightsMistral AI · Magistral | 44.4% | Independent | group defaults | Partially comparable-16.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 170 | granite-4.1-30bOpen weightsIBM · Granite 4.1 | 44.4% | Independent | group defaults | Partially comparable-16.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 172 | gemma-4-E4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 44.2% | Independent | group defaults | Partially comparable-16.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 173 | GLM 4.5Open weightsZ.ai (Zhipu AI) · GLM4.5 | 44.1% | Independent | group defaults | Partially comparable-16.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 174 | LFM2.5-1.2B-InstructOpen weightsLiquid AI · LFM2.5 | 43.8% | Independent | group defaults | Partially comparable-16.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | GLM 4.6Open weightsZ.ai (Zhipu AI) · GLM4.6 · best of 2 rows | 43.4% | Independent | reasoningon | Partially comparable-17.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 175 | qwen3-omni-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 43.4% | Independent | reasoningon | Partially comparable-17.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 177 | claude-4-opusClosedAnthropic · Claude 4 | 43.3% | Independent | group defaults | Partially comparable-17.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 177 | ring-flash-2-0Open weightsinclusionAI | 43.3% | Independent | group defaults | Partially comparable-17.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 179 | deepseek-v3-2-0925Open weightsDeepSeek · DeepSeek | 43.1% | Independent | group defaults | Partially comparable-17.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 180 | longcat-flash-liteOpen weightsLongCat | 43.1% | Independent | group defaults | Partially comparable-17.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 | 43.0% | Independent | group defaults | Partially comparable-17.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | Magistral Medium 1.2ClosedMistral AI · Magistral | 43.0% | Independent | group defaults | Partially comparable-17.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 181 | gpt-4.1ClosedOpenAI · GPT 4.1 | 43.0% | Independent | group defaults | Partially comparable-17.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 184 | Claude Haiku 3.5ClosedAnthropic · Claude | 42.8% | Independent | group defaults | Partially comparable-17.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 185 | jt-35b-flashClosedChina Mobile | 42.0% | Independent | group defaults | Partially comparable-18.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 186 | Seed-OSS-36B-InstructOpen weightsByteDance · Seed | 41.9% | Independent | group defaults | Partially comparable-18.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 187 | lfm2-5-1-2b-thinkingOpen weightsLiquid AI · LFM2.5 | 41.8% | Independent | group defaults | Partially comparable-18.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 188 | MiniMax-M1-80kOpen weightsMiniMax · MiniMax | 41.8% | Independent | group defaults | Partially comparable-18.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 189 | Kimi K2 0905Open weightsMoonshot AI · Kimi | 41.7% | Independent | group defaults | Partially comparable-19.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | DeepSeek V3.1Open weightsDeepSeek · DeepSeek-V3 · best of 2 rows | 41.5% | Independent | reasoningon | Partially comparable-19.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 41.5% | Independent | group defaults | Partially comparable-19.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | Olmo-3-7B-ThinkOpen weightsAllen Institute for AI · OLMo 3 | 41.5% | Independent | group defaults | Partially comparable-19.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 190 | qwen3-30b-a3b-instructOpen weightsAlibaba Group · Qwen3 · best of 2 rows | 41.5% | Independent | reasoningon | Partially comparable-19.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | Grok Build 0.1ClosedxAI · Grok | 41.4% | Independent | group defaults | Partially comparable-19.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 194 | ernie-5-0-thinking-previewClosedBaidu · ERNIE 5.0 | 41.4% | Independent | group defaults | Partially comparable-19.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 196 | MiniMax-M1-40kOpen weightsMiniMax · MiniMax | 41.2% | Independent | group defaults | Partially comparable-19.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 197 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 41.0% | Independent | group defaults | Partially comparable-19.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 198 | Qwen3 14BOpen weightsQwen · Qwen3 | 40.5% | Independent | group defaults | Partially comparable-20.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 199 | qwen3-coder-480b-a35b-instructOpen weightsAlibaba Group · Qwen3-Coder | 40.5% | Independent | group defaults | Partially comparable-20.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 200 | Gemini 2.0 FlashClosedGoogle · Gemini 2.0 | 40.2% | Independent | group defaults | Partially comparable-20.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →