Aider polyglot — well-formed responses
share of aider polyglot cases where every edit was syntactically well formed (parsable edit blocks)
Updated 2 h ago · first seen 12 Sept 2026
- Metric
- percent_cases_well_formed · % ↑
- Current results
- 67
- Models
- 61
- Current leader
- Codestral 25.01 100%
Frontier over time · percent_cases_well_formed
1 leader change recorded, all dated 21 Dec 2024 — the frontier line needs at least two distinct dates. The corpus is young: every result was first observed on the same day, so leader changes will separate in time as sources are re-crawled.
- 100%GPT-4o-mini (2024-07-18) OpenAI Official board21 Dec 2024
Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.
Leaderboard 61 models
Select models with +, then Compare.
| # | Model | Score | Trust | Configuration | vs leader | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|---|---|
| 1 | Codestral 25.01Mistral AI · Codestral 25.01 | 100% | Official board | edit_formatwhole | leader | 13 Jan 2025 | aider.chatT2 | History |
| 1 | DeepSeek R1 + claude-3-5-sonnet-20241022 · Claude 3.5 | 100% | Official board | edit_formatarchitect | leader | 23 Jan 2025 | aider.chatT2 | History |
| 1 | GPT-4o-mini (2024-07-18)OpenAI · GPT 4 | 100% | Official board | edit_formatwhole | leader | 21 Dec 2024 | aider.chatT2 | History |
| 1 | Gemini 2.0 Pro exp-02-05 · Gemini 2.0 | 100% | Official board | edit_formatwhole | leader | 25 Feb 2025 | aider.chatT2 | History |
| 1 | Gemini 2.5 Pro Preview 06-05Google · Gemini 2.5 · best of 2 rows | 100% | Official board | edit_formatdiff-fencedreasoningon | leader | 6 Jun 2025 | aider.chatT2 | History |
| 1 | Gemma 3 27BOpen weightsGoogle · Gemma 3 | 100% | Official board | edit_formatwhole | leader | 15 Mar 2025 | aider.chatT2 | History |
| 1 | Grok 3 Mini Beta (low) · Grok 3 | 100% | Official board | edit_formatwhole | leader | 10 Apr 2025 | aider.chatT2 | History |
| 1 | QwQ-32B + Qwen 2.5 Coder Instruct · Qwen2.5 | 100% | Official board | edit_formatarchitect | leader | 7 Mar 2025 | aider.chatT2 | History |
| 1 | gemini-2.0-flash-expClosedGoogle · Gemini 2.0 | 100% | Official board | edit_formatwhole | leader | 22 Dec 2024 | aider.chatT2 | History |
| 1 | o3 (high) + gpt-4.1 · GPT 4.1 | 100% | Official board | edit_formatarchitect | leader | 27 Jun 2025 | aider.chatT2 | History |
| 11 | DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V3 | 99.6% | Official board | edit_formatdiff | Partially comparable-0.40 pt | 24 Mar 2025 | aider.chatT2 | History |
| 11 | Grok 3 Beta · Grok 3 | 99.6% | Official board | edit_formatdiff | Partially comparable-0.40 pt | 10 Apr 2025 | aider.chatT2 | History |
| 11 | Grok 3 Mini Beta (high) · Grok 3 | 99.6% | Official board | edit_formatwhole | Comparable-0.40 pt | 10 Apr 2025 | aider.chatT2 | History |
| 11▼9 | Qwen2.5 Coder 32B InstructOpen weightsQwen · Qwen2.5 | 99.6% | Official board | edit_formatwhole | Comparable-0.40 pt | 26 Dec 2024 | aider.chatT2 | History |
| 11 | claude-3-5-sonnet-20241022Anthropic · Claude 3.5 | 99.6% | Official board | edit_formatdiff | Partially comparable-0.40 pt | 17 Jan 2025 | aider.chatT2 | History |
| 11 | command-a-03-2025-quality · Command | 99.6% | Official board | edit_formatwhole | Comparable-0.40 pt | 14 Mar 2025 | aider.chatT2 | History |
| 17 | Llama 4 MaverickOpen weightsMeta AI · Llama 4 | 99.1% | Official board | edit_formatwhole | Comparable-0.90 pt | 6 Apr 2025 | aider.chatT2 | History |
| 18 | Claude Opus 4ClosedAnthropic · Claude · best of 2 rows | 98.7% | Official board | edit_formatdiffreasoningoff | Partially comparable-1.30 pt | 25 May 2025 | aider.chatT2 | History |
| 18 | DeepSeek Chat V3 (prev) · DeepSeek | 98.7% | Official board | edit_formatdiff | Partially comparable-1.30 pt | 25 Dec 2024 | aider.chatT2 | History |
| 20 | Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows | 98.2% | Official board | edit_formatdiffreasoningoff | Partially comparable-1.80 pt | 24 May 2025 | aider.chatT2 | History |
| 20 | DeepSeek-V3.2-Exp (Chat) · DeepSeek | 98.2% | Official board | edit_formatdiff | Partially comparable-1.80 pt | 3 Oct 2025 | aider.chatT2 | History |
| 20 | Quasar Alpha | 98.2% | Official board | edit_formatdiff | Partially comparable-1.80 pt | 4 Apr 2025 | aider.chatT2 | History |
| 20 | gemini-exp-1206 · Gemini | 98.2% | Official board | edit_formatwhole | Comparable-1.80 pt | 22 Dec 2024 | aider.chatT2 | History |
| 20 | gpt-4.1ClosedOpenAI · GPT 4.1 | 98.2% | Official board | edit_formatdiff | Partially comparable-1.80 pt | 14 Apr 2025 | aider.chatT2 | History |
| 25 | claude-3-7-sonnet-20250219 (32k thinking tokens) · Claude 3.7 | 97.8% | Official board | edit_formatdiff | Partially comparable-2.20 pt | 24 Feb 2025 | aider.chatT2 | History |
| 25 | o3-proClosedOpenAI · OpenAI o-series | 97.8% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-2.20 pt | 28 Jun 2025 | aider.chatT2 | History |
| 27 | DeepSeek-V3.2-Exp (Reasoner) · DeepSeek | 97.3% | Official board | edit_formatdiff | Partially comparable-2.70 pt | 3 Oct 2025 | aider.chatT2 | History |
| 27 | GPT-4.5 PreviewClosedOpenAI · GPT 4.5 | 97.3% | Official board | edit_formatdiff | Partially comparable-2.70 pt | 27 Feb 2025 | aider.chatT2 | History |
| 27 | Gemini 2.5 Pro Preview 05-06Google · Gemini 2.5 | 97.3% | Official board | edit_formatdiff-fenced | Partially comparable-2.70 pt | 7 May 2025 | aider.chatT2 | History |
| 27 | Optimus Alpha | 97.3% | Official board | edit_formatdiff | Partially comparable-2.70 pt | 10 Apr 2025 | aider.chatT2 | History |
| 27 | grok-4ClosedSpaceXAI · Grok 4 | 97.3% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-2.70 pt | 11 Jul 2025 | aider.chatT2 | History |
| 32 | R1Open weightsDeepSeek | 96.9% | Official board | edit_formatdiff | Partially comparable-3.10 pt | 20 Jan 2025 | aider.chatT2 | History |
| 32 | o1-mini-2024-09-12 · OpenAI o-series | 96.9% | Official board | edit_formatwhole | Comparable-3.10 pt | 22 Dec 2024 | aider.chatT2 | History |
| 34 | gemini-2.5-flash-preview-05-20 (24k think) · Gemini 2.5 | 95.6% | Official board | edit_formatdiff | Partially comparable-4.40 pt | 25 May 2025 | aider.chatT2 | History |
| 35 | GPT-4o (2024-11-20)OpenAI · GPT 4 | 95.1% | Official board | edit_formatdiff | Partially comparable-4.90 pt | 30 Dec 2024 | aider.chatT2 | History |
| 35 | o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows | 95.1% | Official board | edit_formatdiffreasoning_effortmedium | Partially comparable-4.90 pt | 31 Jan 2025 | aider.chatT2 | History |
| 35 | openhands-lm-32b-v0.1 | 95.1% | Official board | edit_formatwhole | Comparable-4.90 pt | 19 Apr 2025 | aider.chatT2 | History |
| 38 | o3ClosedOpenAI · OpenAI o-series · best of 2 rows | 94.7% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-5.30 pt | 25 Jun 2025 | aider.chatT2 | History |
| 39 | R1 0528Open weightsDeepSeek | 94.6% | Official board | edit_formatdiff | Partially comparable-5.40 pt | 6 Jun 2025 | aider.chatT2 | History |
| 40 | GPT-4o (2024-08-06)ClosedOpenAI · GPT 4 | 94.2% | Official board | edit_formatdiff | Partially comparable-5.80 pt | 30 Dec 2024 | aider.chatT2 | History |
| 40 | gpt-4.1-nanoClosedOpenAI · GPT 4.1 | 94.2% | Official board | edit_formatwhole | Comparable-5.80 pt | 14 Apr 2025 | aider.chatT2 | History |
| 42 | gemini-2.5-flash-preview-05-20 (no think) · Gemini 2.5 | 93.8% | Official board | edit_formatdiff | Partially comparable-6.20 pt | 26 May 2025 | aider.chatT2 | History |
| 43 | Claude 3.7 SonnetClosedAnthropic · Claude | 93.3% | Official board | edit_formatdiffreasoningoff | Partially comparable-6.70 pt | 24 Feb 2025 | aider.chatT2 | History |
| 43 | chatgpt-4o-latest (2025-02-15) · GPT 4 | 93.3% | Official board | edit_formatdiff | Partially comparable-6.70 pt | 15 Feb 2025 | aider.chatT2 | History |
| 45 | DeepSeek Chat V2.5 · DeepSeek | 92.9% | Official board | edit_formatdiff | Partially comparable-7.10 pt | 21 Dec 2024 | aider.chatT2 | History |
| 45 | Kimi K2 0711Open weightsMoonshot AI · Kimi | 92.9% | Official board | edit_formatdiff | Partially comparable-7.10 pt | 17 Jul 2025 | aider.chatT2 | History |
| 45 | Qwen3 235B A22B diff, no think, Alibaba API · Qwen3 | 92.9% | Official board | edit_formatdiff | Partially comparable-7.10 pt | 9 May 2025 | aider.chatT2 | History |
| 45 | yi-lightning · Yi | 92.9% | Official board | edit_formatwhole | Comparable-7.10 pt | 23 Dec 2024 | aider.chatT2 | History |
| 49 | Gemini 2.5 Pro Preview 03-25 · Gemini 2.5 | 92.4% | Official board | edit_formatdiff-fenced | Partially comparable-7.60 pt | 12 Apr 2025 | aider.chatT2 | History |
| 49 | gpt-4.1-miniClosedOpenAI · GPT 4.1 | 92.4% | Official board | edit_formatdiff | Partially comparable-7.60 pt | 14 Apr 2025 | aider.chatT2 | History |
| 51 | o1ClosedOpenAI · OpenAI o-series | 91.5% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-8.50 pt | 21 Dec 2024 | aider.chatT2 | History |
| 52 | Claude Haiku 3.5ClosedAnthropic · Claude | 91.1% | Official board | edit_formatdiff | Partially comparable-8.90 pt | 21 Dec 2024 | aider.chatT2 | History |
| 53 | o4-miniClosedOpenAI · OpenAI o-series | 90.7% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-9.30 pt | 16 Apr 2025 | aider.chatT2 | History |
| 54 | qwen-max-2025-01-25 · Qwen | 90.2% | Official board | edit_formatdiff | Partially comparable-9.80 pt | 28 Jan 2025 | aider.chatT2 | History |
| 55▼54 | gpt-5ClosedOpenAI · GPT 5 · best of 2 rows | 88.4% | Official board | edit_formatdiffreasoning_effortmedium | Partially comparable-11.6 pt | 25 Aug 2025 | aider.chatT2 | History |
| 56 | gemini-2.5-flash-preview-04-17 (default) · Gemini 2.5 | 85.3% | Official board | edit_formatdiff | Partially comparable-14.7 pt | 20 Apr 2025 | aider.chatT2 | History |
| 57 | Qwen3 32BOpen weightsQwen · Qwen3 | 83.6% | Official board | edit_formatdiff | Partially comparable-16.4 pt | 8 May 2025 | aider.chatT2 | History |
| 58 | gpt-oss-120bOpen weightsOpenAI · gpt-oss | 79.1% | Official board | edit_formatdiffreasoning_efforthigh | Partially comparable-20.9 pt | 6 Aug 2025 | aider.chatT2 | History |
| 59 | gemini-2.0-flash-thinking-exp-01-21ClosedGoogle · Gemini 2.0 | 77.8% | Official board | edit_formatdiff | Partially comparable-22.2 pt | 21 Jan 2025 | aider.chatT2 | History |
| 60 | QwQ-32BOpen weightsAlibaba Group · Qwen | 67.6% | Official board | edit_formatdiff | Partially comparable-32.4 pt | 6 Mar 2025 | aider.chatT2 | History |
| 61 | chatgpt-4o-latest (2025-03-29) · GPT 4 | 64.4% | Official board | edit_formatdiff | Partially comparable-35.6 pt | 29 Mar 2025 | aider.chatT2 | History |
61 results
One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →