IFBench
precise instruction following with novel constraints
Updated 27 min ago · first seen 11 Sept 2026
- Metric
- accuracy · % ↑
- Current results
- 450
- Models
- 333
- Current leader
- Grok 4.3 83.3%
Score history · Mistral 7B 1 row
Not enough history to chart — a single observation (19.93% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 19.93%aa_slug=mistral-7b-instruct · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Frontier over time · accuracy · evaluator=Artificial Analysis
6 leader changes recorded, all dated 11 Sept 2026 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 83.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.3%Grok 4.3 xAI Independent11 Sept 2026
- 81.2%Grok 4.20 xAI Independent11 Sept 2026
- 81.0%Grok 4.3 xAI Independent11 Sept 2026
- 73.5%gemma-4-12B Google Independent11 Sept 2026
- 45.9%grok-3-mini-reasoning SpaceXAI Independent11 Sept 2026
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 333 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | Grok 4.3ClosedxAI · Grok · best of 4 rows | 83.3% | Independent | reasoning_effortmedium | leader | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 2 | grok-4-20-0309ClosedSpaceXAI · Grok 4.20 · best of 2 rows | 82.9% | Independent | group defaults | Partially comparable-0.40 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 3 | MiniMax-M3Open weightsMiniMax · MiniMax | 82.9% | Independent | group defaults | Partially comparable-0.47 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 4 | Nemotron 3 UltraOpen weightsNVIDIA · Nemotron 3 | 81.4% | Independent | group defaults | Partially comparable-1.97 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 5 | Grok 4.20ClosedxAI · Grok | 81.2% | Independent | group defaults | Partially comparable-2.11 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 6 | Qwen3.7 MaxClosedQwen · Qwen3.7 | 80.5% | Independent | group defaults | Partially comparable-2.79 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 7 | nemotron-cascade-2-30b-a3bOpen weightsNVIDIA · Nemotron | 80.4% | Independent | group defaults | Partially comparable-2.92 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 8 | MiMo-V2.5-ProOpen weightsXiaomi · best of 2 rows | 79.9% | Independent | group defaults | Partially comparable-3.47 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 9 | nova-2-0-proClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 79.6% | Independent | reasoningonreasoning_effortlow | Partially comparable-3.74 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 10 | deepseek-v4-flash-0420Open weightsDeepSeek · DeepSeek | 79.2% | Independent | group defaults | Partially comparable-4.15 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 11 | Qwen3.5 397B A17BOpen weightsQwen · Qwen3.5 · best of 2 rows | 78.8% | Independent | group defaults | Partially comparable-4.55 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | Gemini 3 Flash PreviewClosedGoogle · Gemini 3 | 78.0% | Independent | group defaults | Partially comparable-5.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 12 | Qwen 3.7 PlusClosedQwen · Qwen3.7 | 78.0% | Independent | group defaults | Partially comparable-5.37 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 14 | GPT-5.2-CodexClosedOpenAI · GPT 5.2 | 77.6% | Independent | group defaults | Partially comparable-5.71 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 15 | Gemini 3.1 Flash-Lite PreviewClosedGoogle · Gemini 3.1 | 77.2% | Independent | group defaults | Partially comparable-6.12 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 16 | Gemini 3.1 Pro PreviewClosedGoogle · Gemini 3.1 | 77.1% | Independent | group defaults | Partially comparable-6.19 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 17 | Qwen3.6 Max PreviewClosedQwen · Qwen3.6 | 76.6% | Independent | group defaults | Partially comparable-6.73 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 18 | deepseek-v4-pro-0424Open weightsDeepSeek · DeepSeek | 76.5% | Independent | group defaults | Partially comparable-6.87 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 19 | Gemini 3.5 FlashClosedGoogle · Gemini 3.5 · best of 3 rows | 76.3% | Independent | group defaults | Partially comparable-7.00 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 20 | GLM 5.1Open weightsZ.ai (Zhipu AI) · GLM5.1 · best of 2 rows | 76.3% | Independent | group defaults | Partially comparable-7.07 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 21 | Kimi K2.6Open weightsMoonshot AI · Kimi · best of 2 rows | 76.0% | Independent | group defaults | Partially comparable-7.34 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | gpt-5.4-nanoClosedOpenAI · GPT 5.4 · best of 3 rows | 75.9% | Independent | group defaults | Partially comparable-7.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 22 | muse-sparkClosedMeta AI | 75.9% | Independent | group defaults | Partially comparable-7.41 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 24 | gpt-5.5ClosedOpenAI · GPT 5.5 · best of 5 rows | 75.8% | Independent | group defaults | Partially comparable-7.48 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 25 | MiniMax M2.7Open weightsMiniMax · MiniMax | 75.7% | Independent | group defaults | Partially comparable-7.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 25 | Qwen3.5-122B-A10BOpen weightsQwen · Qwen3.5 · best of 2 rows | 75.7% | Independent | group defaults | Partially comparable-7.62 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 27 | Gemma 4 31BOpen weightsGoogle · Gemma 4 · best of 2 rows | 75.6% | Independent | group defaults | Partially comparable-7.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 27 | Qwen3.5-27BOpen weightsQwen · Qwen3.5 · best of 2 rows | 75.6% | Independent | group defaults | Partially comparable-7.75 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | gpt-5-miniClosedOpenAI · GPT 5 · best of 3 rows | 75.4% | Independent | group defaults | Partially comparable-7.89 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 29 | gpt-5.2ClosedOpenAI · GPT 5.2 · best of 3 rows | 75.4% | Independent | group defaults | Partially comparable-7.89 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 31 | gpt-5.3-codexClosedOpenAI · GPT 5.3 | 75.4% | Independent | group defaults | Partially comparable-7.96 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 32 | Qwen3.6 PlusClosedQwen · Qwen3.6 | 75.2% | Independent | group defaults | Partially comparable-8.16 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 33 | GPT-5-CodexClosedOpenAI · GPT 5 | 74.2% | Independent | group defaults | Partially comparable-9.18 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 34 | command-a-plusOpen weightsCohere · Command | 74.0% | Independent | group defaults | Partially comparable-9.38 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 34 | gpt-5.4ClosedOpenAI · GPT 5.4 · best of 3 rows | 74.0% | Independent | group defaults | Partially comparable-9.38 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 36 | gemma-4-12BOpen weightsGoogle · Gemma 4 · best of 2 rows | 73.5% | Independent | group defaults | Partially comparable-9.79 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 37 | deepseek-v4-flash-0420-highOpen weightsDeepSeek · DeepSeek | 73.5% | Independent | group defaults | Partially comparable-9.86 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 38 | Z.ai GLM 5.2Open weightsZ.ai (Zhipu AI) · GLM5.2 | 73.3% | Independent | group defaults | Partially comparable-10.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 39 | gpt-5.4-miniClosedOpenAI · GPT 5.4 · best of 3 rows | 73.3% | Independent | group defaults | Partially comparable-10.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 40 | GLM 5 TurboClosedZ.ai (Zhipu AI) · GLM5 | 73.2% | Independent | group defaults | Partially comparable-10.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 41 | gpt-5ClosedOpenAI · GPT 5 · best of 4 rows | 73.1% | Independent | group defaults | Partially comparable-10.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 42 | gpt-5.1ClosedOpenAI · GPT 5.1 · best of 2 rows | 72.9% | Independent | group defaults | Partially comparable-10.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 43 | gpt-5.6-solClosedOpenAI · GPT 5.6 · best of 5 rows | 72.7% | Independent | group defaults | Partially comparable-10.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 44 | Qwen3.5-35B-A3BOpen weightsQwen · Qwen3.5 · best of 2 rows | 72.5% | Independent | group defaults | Partially comparable-10.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 45 | Gemma 4 26B A4BOpen weightsGoogle · Gemma 4 · best of 2 rows | 72.5% | Independent | group defaults | Partially comparable-10.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 46 | GLM 5Open weightsZ.ai (Zhipu AI) · GLM5 · best of 2 rows | 72.3% | Independent | group defaults | Partially comparable-11.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 46 | MiniMax M2Open weightsMiniMax · MiniMax | 72.3% | Independent | group defaults | Partially comparable-11.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 48 | mimo-v2-0206Open weightsXiaomi | 71.8% | Independent | group defaults | Partially comparable-11.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 49 | MiniMax M2.5Open weightsMiniMax · MiniMax | 71.6% | Independent | group defaults | Partially comparable-11.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | Nemotron 3 SuperOpen weightsNVIDIA · Nemotron 3 | 71.5% | Independent | group defaults | Partially comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 50 | gpt-5-5-instant-05-26ClosedOpenAI · GPT 5.5 | 71.5% | Independent | group defaults | Partially comparable-11.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 52 | o3ClosedOpenAI · OpenAI o-series | 71.4% | Independent | group defaults | Partially comparable-11.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 53 | deepseek-v4-pro-0424-highOpen weightsDeepSeek · DeepSeek | 71.3% | Independent | group defaults | Partially comparable-12.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 54 | gpt-5.6-terraClosedOpenAI · GPT 5.6 · best of 5 rows | 71.2% | Independent | group defaults | Partially comparable-12.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 55 | Solar Pro 3ClosedUpstage · Solar | 71.2% | Independent | group defaults | Partially comparable-12.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 56 | Nemotron 3 Nano 30B A3BOpen weightsNVIDIA · Nemotron 3 · best of 2 rows | 71.1% | Independent | reasoningon | Partially comparable-12.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 57 | Qwen3 MaxClosedQwen · Qwen3 · best of 2 rows | 70.8% | Independent | reasoningon | Partially comparable-12.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 57 | nova-2-0-liteClosedAmazon Web Services · Nova 2.0 · best of 4 rows | 70.8% | Independent | reasoningon | Partially comparable-12.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 59 | gemini-3-proClosedGoogle · Gemini 3 · best of 2 rows | 70.4% | Independent | group defaults | Partially comparable-12.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 60 | o1ClosedOpenAI · OpenAI o-series | 70.3% | Independent | group defaults | Partially comparable-13.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 61 | Kimi K2.5Open weightsMoonshot AI · Kimi · best of 2 rows | 70.2% | Independent | group defaults | Partially comparable-13.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 62 | GPT-5.1-CodexClosedOpenAI · GPT 5.1 | 70% | Independent | group defaults | Partially comparable-13.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 63 | MiniMax M2.1Open weightsMiniMax · MiniMax | 69.9% | Independent | group defaults | Partially comparable-13.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 64 | Mercury 2ClosedInception | 69.8% | Independent | group defaults | Partially comparable-13.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 65 | apriel-v1-6-15b-thinkerOpen weightsServiceNow | 69.1% | Independent | group defaults | Partially comparable-14.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 66 | gpt-oss-120bOpen weightsOpenAI · gpt-oss · best of 2 rows | 69.0% | Independent | group defaults | Partially comparable-14.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 67 | mimo-v2-proClosedXiaomi | 68.8% | Independent | group defaults | Partially comparable-14.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 68 | Mistral Medium 3.5Open weightsMistral AI · Mistral | 68.8% | Independent | group defaults | Partially comparable-14.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 69 | o4-miniClosedOpenAI · OpenAI o-series | 68.7% | Independent | group defaults | Partially comparable-14.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 70 | kat-coder-pro-v1ClosedKwaiKAT | 68.4% | Independent | group defaults | Partially comparable-15.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 71 | Kimi K2 ThinkingOpen weightsMoonshot AI · Kimi | 68.1% | Independent | group defaults | Partially comparable-15.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 72 | GLM 4.7Open weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 67.9% | Independent | group defaults | Partially comparable-15.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 72 | GPT-5.1-Codex MiniClosedOpenAI · GPT 5.1 | 67.9% | Independent | group defaults | Partially comparable-15.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 74 | Qwen3.6 27BOpen weightsQwen · Qwen3.6 · best of 2 rows | 67.5% | Independent | group defaults | Partially comparable-15.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 74 | gpt-5-nanoClosedOpenAI · GPT 5 · best of 3 rows | 67.5% | Independent | group defaults | Partially comparable-15.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 76 | mimo-v2-omni-0327ClosedXiaomi | 67.3% | Independent | group defaults | Partially comparable-16.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 77 | Step 3.7 FlashOpen weightsStepFun · Step3.7 | 67.3% | Independent | group defaults | Partially comparable-16.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | MiMo-V2.5Open weightsXiaomi | 67.1% | Independent | group defaults | Partially comparable-16.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 78 | o3-miniClosedOpenAI · OpenAI o-series | 67.1% | Independent | reasoning_efforthigh | Partially comparable-16.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 80 | Qwen3.5-9BOpen weightsQwen · Qwen3.5 · best of 2 rows | 66.7% | Independent | group defaults | Partially comparable-16.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 81 | KAT-Coder-Pro V2ClosedKwaipilot | 66.7% | Independent | group defaults | Partially comparable-16.7 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 82 | Step 3.5 FlashOpen weightsStepFun · Step3.5 · best of 2 rows | 66.5% | Independent | group defaults | Partially comparable-16.8 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 83 | hypernova-60bOpen weightsMultiverse Computing | 66.5% | Independent | group defaults | Partially comparable-16.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 84 | nex-n2-proOpen weightsNex AGI | 66.2% | Independent | group defaults | Partially comparable-17.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 84 | nova-2-0-omniClosedAmazon Web Services · Nova 2.0 · best of 3 rows | 66.2% | Independent | reasoningonreasoning_effortmedium | Partially comparable-17.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 86 | olmo-3-1-32b-instructOpen weightsAllen Institute for AI · OLMo 3.1 · best of 2 rows | 66.0% | Independent | reasoningon | Partially comparable-17.3 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 87 | gpt-oss-20bOpen weightsOpenAI · gpt-oss · best of 2 rows | 65.1% | Independent | group defaults | Partially comparable-18.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 88 | k-exaoneOpen weightsLG AI Research · EXAONE · best of 2 rows | 64.7% | Independent | group defaults | Partially comparable-18.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 89 | Qwen3.6 35B A3BOpen weightsQwen · Qwen3.6 · best of 2 rows | 64.3% | Independent | group defaults | Partially comparable-19.0 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 90 | mimo-v2-flashOpen weightsXiaomi · best of 2 rows | 64.2% | Independent | reasoningon | Partially comparable-19.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 91 | deepseek-v3-2-specialeOpen weightsDeepSeek · DeepSeek | 63.9% | Independent | group defaults | Partially comparable-19.4 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 92 | Claude Fable 5ClosedAnthropic · Claude | 63.5% | Independent | group defaults | Partially comparable-19.9 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 93 | nemotron-3-nano-omni-30b-a3bOpen weightsNVIDIA · Nemotron 3 | 63.2% | Independent | group defaults | Partially comparable-20.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 94 | Hy3 previewOpen weightsTencent | 63.1% | Independent | group defaults | Partially comparable-20.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 94 | Kimi K2.7 CodeOpen weightsMoonshot AI · Kimi | 63.1% | Independent | group defaults | Partially comparable-20.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 96 | k2-think-v2Open weightsMBZUAI Institute of Foundation Models | 62.8% | Independent | group defaults | Partially comparable-20.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 97 | Claude Opus 4.8ClosedAnthropic · Claude | 62.2% | Independent | group defaults | Partially comparable-21.1 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 98 | apriel-v1-5-15b-thinkerOpen weightsServiceNow | 61.7% | Independent | group defaults | Partially comparable-21.6 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 99 | GLM 5V TurboClosedZ.ai (Zhipu AI) · GLM5 | 61.1% | Independent | group defaults | Partially comparable-22.2 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
| 100 | GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI) · GLM4.7 · best of 2 rows | 60.8% | Independent | group defaults | Partially comparable-22.5 pt | obs. 11 Sept 2026 | artificialanalysis.aiT2 | History |
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →