Skip to content
AI Atlas
BenchmarkActivecategory · codingfamily · aider-polyglot · variant polyglot

Aider polyglot

aider.chat/docs/leaderboards

225 Exercism exercises in 6 languages, edit-format aware

data quality57

Updated 6 h ago · first seen 11 Sept 2026

Metric
pass_rate_2 · %
Current results
67
Models
61
Current leader
gpt-5 86.7%

Score history · o4-mini 1 row

Not enough history to chart — a single observation (72% on 16 Apr 2025). Rows under different configurations count separately; the list below shows each one.

  • 72%date=2025-04-16 · command=aider --model o4-mini · dirname=2025-04-16-22-01-58--o4-mini-high-diff-exsys · versions=0.82.1.dev16 Apr 2025

Back to the leaderboard

Frontier over time · pass_rate_2

Frontier of Aider polyglot0%20%40%60%80%100%Jan 25Feb 25Mar 25Apr 25May 25Jun 25Jul 25Aug 25
  1. 88%gpt-5 OpenAI Official board23 Aug 2025
  2. 84.9%o3-pro OpenAI Official board28 Jun 2025
  3. 83.1%Gemini 2.5 Pro Preview 06-05 Google Official board6 Jun 2025
  4. 79.1%Gemini 2.5 Pro Preview 06-05 Google Official board6 Jun 2025
  5. 76.9%Gemini 2.5 Pro Preview 05-06 Google Official board7 May 2025
  6. 72.9%Gemini 2.5 Pro Preview 03-25 Official board12 Apr 2025
  7. 64.9%claude-3-7-sonnet-20250219 (32k thinking tokens) Official board24 Feb 2025
  8. 64%DeepSeek R1 + claude-3-5-sonnet-20241022 Official board23 Jan 2025

Includes closed rows (history). A point is emitted whenever a result beats every earlier result of the same group, ordered by evaluated_at when the source publishes it, else observed_at.

Leaderboard 61 models

Select models with +, then Compare.

Leaderboard
#ModelScoreTrustConfigurationvs leaderEvaluatedSourceActions
1gpt-5ClosedOpenAI · GPT 5 · best of 2 rows86.7%Official boardedit_formatdiffreasoning_effortmediumleader25 Aug 2025aider.chatT2History
2o3-proClosedOpenAI · OpenAI o-series84.9%Official boardedit_formatdiffreasoning_efforthighPartially comparable-1.80 pt28 Jun 2025aider.chatT2History
3Gemini 2.5 Pro Preview 06-05Google · Gemini 2.5 · best of 2 rows83.1%Official boardedit_formatdiff-fencedreasoningonthinking_budget32kPartially comparable-3.60 pt6 Jun 2025aider.chatT2History
4o3ClosedOpenAI · OpenAI o-series · best of 2 rows81.3%Official boardedit_formatdiffreasoning_efforthighPartially comparable-5.40 pt25 Jun 2025aider.chatT2History
5grok-4ClosedSpaceXAI · Grok 479.6%Official boardedit_formatdiffreasoning_efforthighPartially comparable-7.10 pt11 Jul 2025aider.chatT2History
6o3 (high) + gpt-4.1 · GPT 4.178.2%Official boardedit_formatarchitectPartially comparable-8.50 pt27 Jun 2025aider.chatT2History
7Gemini 2.5 Pro Preview 05-06Google · Gemini 2.576.9%Official boardedit_formatdiff-fencedPartially comparable-9.80 pt7 May 2025aider.chatT2History
8DeepSeek-V3.2-Exp (Reasoner) · DeepSeek74.2%Official boardedit_formatdiffPartially comparable-12.5 pt3 Oct 2025aider.chatT2History
9Gemini 2.5 Pro Preview 03-25 · Gemini 2.572.9%Official boardedit_formatdiff-fencedPartially comparable-13.8 pt12 Apr 2025aider.chatT2History
10Claude Opus 4ClosedAnthropic · Claude · best of 2 rows72%Official boardedit_formatdiffreasoningonthinking_budget32kPartially comparable-14.7 pt25 May 2025aider.chatT2History
10o4-miniClosedOpenAI · OpenAI o-series72%Official boardedit_formatdiffreasoning_efforthighPartially comparable-14.7 pt16 Apr 2025aider.chatT2History
12R1 0528Open weightsDeepSeek71.4%Official boardedit_formatdiffPartially comparable-15.3 pt6 Jun 2025aider.chatT2History
13DeepSeek-V3.2-Exp (Chat) · DeepSeek70.2%Official boardedit_formatdiffPartially comparable-16.5 pt3 Oct 2025aider.chatT2History
14claude-3-7-sonnet-20250219 (32k thinking tokens) · Claude 3.764.9%Official boardedit_formatdiffPartially comparable-21.8 pt24 Feb 2025aider.chatT2History
15DeepSeek R1 + claude-3-5-sonnet-20241022 · Claude 3.564%Official boardedit_formatarchitectPartially comparable-22.7 pt23 Jan 2025aider.chatT2History
16o1ClosedOpenAI · OpenAI o-series61.7%Official boardedit_formatdiffreasoning_efforthighPartially comparable-25.0 pt21 Dec 2024aider.chatT2History
17Claude Sonnet 4ClosedAnthropic · Claude · best of 2 rows61.3%Official boardedit_formatdiffreasoningonthinking_budget32kPartially comparable-25.4 pt24 May 2025aider.chatT2History
18Claude 3.7 SonnetClosedAnthropic · Claude60.4%Official boardedit_formatdiffreasoningoffPartially comparable-26.3 pt24 Feb 2025aider.chatT2History
18o3-miniClosedOpenAI · OpenAI o-series · best of 2 rows60.4%Official boardedit_formatdiffreasoning_efforthighPartially comparable-26.3 pt31 Jan 2025aider.chatT2History
20Qwen3 235B A22B diff, no think, Alibaba API · Qwen359.6%Official boardedit_formatdiffPartially comparable-27.1 pt9 May 2025aider.chatT2History
21Kimi K2 0711Open weightsMoonshot AI · Kimi59.1%Official boardedit_formatdiffPartially comparable-27.6 pt17 Jul 2025aider.chatT2History
22R1Open weightsDeepSeek56.9%Official boardedit_formatdiffPartially comparable-29.8 pt20 Jan 2025aider.chatT2History
23DeepSeek V3 0324Open weightsDeepSeek · DeepSeek-V355.1%Official boardedit_formatdiffPartially comparable-31.6 pt24 Mar 2025aider.chatT2History
23gemini-2.5-flash-preview-05-20 (24k think) · Gemini 2.555.1%Official boardedit_formatdiffPartially comparable-31.6 pt25 May 2025aider.chatT2History
25Quasar Alpha54.7%Official boardedit_formatdiffPartially comparable-32.0 pt4 Apr 2025aider.chatT2History
26Grok 3 Beta · Grok 353.3%Official boardedit_formatdiffPartially comparable-33.4 pt10 Apr 2025aider.chatT2History
27Optimus Alpha52.9%Official boardedit_formatdiffPartially comparable-33.8 pt10 Apr 2025aider.chatT2History
28gpt-4.1ClosedOpenAI · GPT 4.152.4%Official boardedit_formatdiffPartially comparable-34.3 pt14 Apr 2025aider.chatT2History
29claude-3-5-sonnet-20241022Anthropic · Claude 3.551.6%Official boardedit_formatdiffPartially comparable-35.1 pt17 Jan 2025aider.chatT2History
30Grok 3 Mini Beta (high) · Grok 349.3%Official boardedit_formatwholePartially comparable-37.4 pt10 Apr 2025aider.chatT2History
31DeepSeek Chat V3 (prev) · DeepSeek48.4%Official boardedit_formatdiffPartially comparable-38.3 pt25 Dec 2024aider.chatT2History
32gemini-2.5-flash-preview-04-17 (default) · Gemini 2.547.1%Official boardedit_formatdiffPartially comparable-39.6 pt20 Apr 2025aider.chatT2History
33chatgpt-4o-latest (2025-03-29) · GPT 445.3%Official boardedit_formatdiffPartially comparable-41.4 pt29 Mar 2025aider.chatT2History
34GPT-4.5 PreviewClosedOpenAI · GPT 4.544.9%Official boardedit_formatdiffPartially comparable-41.8 pt27 Feb 2025aider.chatT2History
35gemini-2.5-flash-preview-05-20 (no think) · Gemini 2.544%Official boardedit_formatdiffPartially comparable-42.7 pt26 May 2025aider.chatT2History
36gpt-oss-120bOpen weightsOpenAI · gpt-oss41.8%Official boardedit_formatdiffreasoning_efforthighPartially comparable-44.9 pt6 Aug 2025aider.chatT2History
37Qwen3 32BOpen weightsQwen · Qwen340%Official boardedit_formatdiffPartially comparable-46.7 pt8 May 2025aider.chatT2History
38gemini-exp-1206 · Gemini38.2%Official boardedit_formatwholePartially comparable-48.5 pt22 Dec 2024aider.chatT2History
39Gemini 2.0 Pro exp-02-05 · Gemini 2.035.6%Official boardedit_formatwholePartially comparable-51.1 pt25 Feb 2025aider.chatT2History
40Grok 3 Mini Beta (low) · Grok 334.7%Official boardedit_formatwholePartially comparable-52.0 pt10 Apr 2025aider.chatT2History
41o1-mini-2024-09-12 · OpenAI o-series32.9%Official boardedit_formatwholePartially comparable-53.8 pt22 Dec 2024aider.chatT2History
42gpt-4.1-miniClosedOpenAI · GPT 4.132.4%Official boardedit_formatdiffPartially comparable-54.3 pt14 Apr 2025aider.chatT2History
43Claude Haiku 3.5ClosedAnthropic · Claude28%Official boardedit_formatdiffPartially comparable-58.7 pt21 Dec 2024aider.chatT2History
44chatgpt-4o-latest (2025-02-15) · GPT 427.1%Official boardedit_formatdiffPartially comparable-59.6 pt15 Feb 2025aider.chatT2History
45QwQ-32B + Qwen 2.5 Coder Instruct · Qwen2.526.2%Official boardedit_formatarchitectPartially comparable-60.5 pt7 Mar 2025aider.chatT2History
46GPT-4o (2024-08-06)ClosedOpenAI · GPT 423.1%Official boardedit_formatdiffPartially comparable-63.6 pt30 Dec 2024aider.chatT2History
47gemini-2.0-flash-expClosedGoogle · Gemini 2.022.2%Official boardedit_formatwholePartially comparable-64.5 pt22 Dec 2024aider.chatT2History
48qwen-max-2025-01-25 · Qwen21.8%Official boardedit_formatdiffPartially comparable-64.9 pt28 Jan 2025aider.chatT2History
49QwQ-32BOpen weightsAlibaba Group · Qwen20.9%Official boardedit_formatdiffPartially comparable-65.8 pt6 Mar 2025aider.chatT2History
50GPT-4o (2024-11-20)OpenAI · GPT 418.2%Official boardedit_formatdiffPartially comparable-68.5 pt30 Dec 2024aider.chatT2History
50gemini-2.0-flash-thinking-exp-01-21ClosedGoogle · Gemini 2.018.2%Official boardedit_formatdiffPartially comparable-68.5 pt21 Jan 2025aider.chatT2History
52DeepSeek Chat V2.5 · DeepSeek17.8%Official boardedit_formatdiffPartially comparable-68.9 pt21 Dec 2024aider.chatT2History
5351Qwen2.5 Coder 32B InstructOpen weightsQwen · Qwen2.516.4%Official boardedit_formatwholePartially comparable-70.3 pt26 Dec 2024aider.chatT2History
54Llama 4 MaverickOpen weightsMeta AI · Llama 415.6%Official boardedit_formatwholePartially comparable-71.1 pt6 Apr 2025aider.chatT2History
55yi-lightning · Yi12.9%Official boardedit_formatwholePartially comparable-73.8 pt23 Dec 2024aider.chatT2History
56command-a-03-2025-quality · Command12%Official boardedit_formatwholePartially comparable-74.7 pt14 Mar 2025aider.chatT2History
57Codestral 25.01Mistral AI · Codestral 25.0111.1%Official boardedit_formatwholePartially comparable-75.6 pt13 Jan 2025aider.chatT2History
58openhands-lm-32b-v0.110.2%Official boardedit_formatwholePartially comparable-76.5 pt19 Apr 2025aider.chatT2History
59gpt-4.1-nanoClosedOpenAI · GPT 4.18.90%Official boardedit_formatwholePartially comparable-77.8 pt14 Apr 2025aider.chatT2History
60Gemma 3 27BOpen weightsGoogle · Gemma 34.90%Official boardedit_formatwholePartially comparable-81.8 pt15 Mar 2025aider.chatT2History
61GPT-4o-mini (2024-07-18)OpenAI · GPT 43.60%Official boardedit_formatwholePartially comparable-83.1 pt21 Dec 2024aider.chatT2History

61 results

One row per canonical model — its best current row inside this comparability group (effort variants are folded into the model). Bars are relative to the page's best score. “vs leader” reads comparability: partially comparable = same task, conditions differ (reasoning effort, temperature, judge). Rules →