Updated 53 min ago · first seen 11 Sept 2026
model_01M29AEFE33X48SBR2SENSRMHV
Specification
No structured attributes yet.
Each value shows its source, tier and observation time. Conflicting claims are kept side by side and flagged — never averaged. How AI Atlas records facts →
Provenance
Attributed facts
0
Source tiers
—
Freshest observation
—
Conflicts
None
Modalities
Modalities unavailable.
Capabilities
Tool calling
Unavailable
Structured output
Unavailable
Reasoning
Unavailable
Vision
Unavailable
Audio
Unavailable
Fine-tuning available
Unavailable
No capability flags have been observed from a source yet — we do not infer them.
No structured attributes yet.
| Benchmark | Score | Metric | Config | Evaluated | Source |
|---|---|---|---|---|---|
| SWE-bench (full test split) | 44.25% | resolved | date=2025-10-27 · board=Test · system=Salesforce AI Research SAGE · model_tag=claude-sonnet-4.5 | 27 Oct 2025 | swebench.comT2 |
| SWE-bench Lite | 60% | resolved | date=2025-04-25 · board=Lite · system=Refact.ai Agent · model_tag=claude-3-7-sonnet-20250219 | 25 Apr 2025 | swebench.comT2 |
| SWE-bench Lite | 51.67% | resolved | date=2025-06-25 · board=Lite · system=SemAgent_Multi-v1.0 · model_tag=claude-3-7-sonnet-20250219 | 25 Jun 2025 | swebench.comT2 |
| SWE-bench Lite | 49% | resolved | date=2025-05-28 · board=Lite · system=Codev · model_tag=claude-3-7-sonnet-20250219 | 28 May 2025 | swebench.comT2 |
| SWE-bench Lite | 48.33% | resolved | date=2025-06-13 · board=Lite · system=ExpeRepair-v1.0 · model_tag=claude-3.5-sonnet-20241022 | 13 Jun 2025 | swebench.comT2 |
| SWE-bench Lite | 21.67% | resolved | date=2024-08-28 · board=Lite · system=Bytedance AutoSE · model_tag=gpt-4o-2024-08-06 | 28 Aug 2024 | swebench.comT2 |
| SWE-bench Lite | 41.67% | resolved | date=2025-05-15 · board=Lite · system=Codart AI · model_tag=claude-3-5-haiku-latest | 15 May 2025 | swebench.comT2 |
| SWE-bench Lite | 41% | resolved | date=2024-10-30 · board=Lite · system=Composio SWE-Kit · model_tag=claude-3-5-sonnet-20241022 | 30 Oct 2024 | swebench.comT2 |
| SWE-bench Lite | 36% | resolved | date=2024-11-13 · board=Lite · system=AppMap Navie v2 · model_tag=claude-3-5-sonnet-20241022 | 13 Nov 2024 | swebench.comT2 |
| SWE-bench Lite | 23.67% | resolved | date=2024-10-16 · board=Lite · system=IBM AI Agent SWE-1.0 · submission=20241016_IBM-SWE-1.0 | 16 Oct 2024 | swebench.comT2 |
| SWE-bench Lite | 47% | resolved | date=2025-02-05 · board=Lite · system=DARS Agent · model_tag=claude-3-5-sonnet-20241022 | 5 Feb 2025 | swebench.comT2 |
| SWE-bench Verified | 70.4% | resolved | date=2025-05-15 · board=Verified · system=Refact.ai Agent · model_tag=claude-3-7-sonnet-20250219 | 15 May 2025 | swebench.comT2 |
| SWE-bench Verified | 70.2% | resolved | date=2025-05-19 · board=Verified · system=devlo · model_tag=claude-3-7-sonnet-20250219 | 19 May 2025 | swebench.comT2 |
| SWE-bench Verified | 70% | resolved | date=2025-04-30 · board=Verified · system=Zencoder · model_tag=claude-3-7-sonnet-20250219 | 30 Apr 2025 | swebench.comT2 |
| SWE-bench Verified | 68.2% | resolved | date=2025-05-16 · board=Verified · system=Nemotron-CORTEXA · model_tag=NV-EmbedCode | 16 May 2025 | swebench.comT2 |
| SWE-bench Verified | 58.2% | resolved | date=2025-04-10 · board=Verified · system=Nemotron-CORTEXA · model_tag=NV-EmbedCode | 10 Apr 2025 | swebench.comT2 |
| SWE-bench Verified | 40.6% | resolved | date=2024-11-13 · board=Verified · system=Nebius AI · model_tag=Llama 3.1 | 13 Nov 2024 | swebench.comT2 |
| SWE-bench Verified | 49.2% | resolved | date=2024-11-05 · board=Verified · system=nFactorial · model_tag=claude-3-5-sonnet-20241022 | 5 Nov 2024 | swebench.comT2 |
| SWE-bench Verified | 48.6% | resolved | date=2024-10-25 · board=Verified · system=Composio SWE-Kit · model_tag=claude-3-5-sonnet-20241022 | 25 Oct 2024 | swebench.comT2 |
| SWE-bench Verified | 47.2% | resolved | date=2024-11-06 · board=Verified · system=AppMap Navie v2 · model_tag=claude-3-5-sonnet-20241022 | 6 Nov 2024 | swebench.comT2 |
| SWE-bench Verified | 46.6% | resolved | date=2024-10-23 · board=Verified · system=Emergent E1 · model_tag=claude-3-5-sonnet-20241022 | 23 Oct 2024 | swebench.comT2 |
| SWE-bench Verified | 41.6% | resolved | date=2024-10-30 · board=Verified · system=nFactorial · model_tag=claude-3-5-sonnet-20241022 | 30 Oct 2024 | swebench.comT2 |
| SWE-bench Verified | 57.2% | resolved | date=2024-12-23 · board=Verified · system=Emergent E1 · model_tag=claude-3-5-sonnet-20241022 | 23 Dec 2024 | swebench.comT2 |
| SWE-bench Verified | 76.8% | resolved | date=2025-09-02 · board=Verified · system=Atlassian Rovo Dev · model_tag=claude-sonnet-4-20250514 | 2 Sept 2025 | swebench.comT2 |
| SWE-bench Verified | 76.4% | resolved | date=2025-08-19 · board=Verified · system=ACoder · model_tag=claude-4-sonnet | 19 Aug 2025 | swebench.comT2 |
| SWE-bench Verified | 75.6% | resolved | date=2025-09-01 · board=Verified · system=Warp · model_tag=gpt-5 | 1 Sept 2025 | swebench.comT2 |
| SWE-bench Verified | 75.2% | resolved | date=2025-06-12 · board=Verified · system=TRAE · model_tag=claude-4-sonnet-20250522 | 12 Jun 2025 | swebench.comT2 |
| SWE-bench Verified | 74.6% | resolved | date=2025-09-15 · board=Verified · system=JoyCode · model_tag=claude-4-sonnet | 15 Sept 2025 | swebench.comT2 |
| SWE-bench Verified | 74.4% | resolved | date=2025-06-03 · board=Verified · system=Refact.ai Agent · model_tag=claude-4-sonnet | 3 Jun 2025 | swebench.comT2 |
| SWE-bench Verified | 73.8% | resolved | date=2025-11-03 · board=Verified · system=Salesforce AI Research SAGE · model_tag=claude-sonnet-4.5 | 3 Nov 2025 | swebench.comT2 |
| SWE-bench Verified | 73% | resolved | date=2025-10-21 · board=Verified · system=Salesforce AI Research SAGE · model_tag=claude-sonnet-4.5 | 21 Oct 2025 | swebench.comT2 |
| SWE-bench Verified | 71.2% | resolved | date=2025-07-15 · board=Verified · system=Qodo Command · model_tag=claude-sonnet-4-20250514 | 15 Jul 2025 | swebench.comT2 |
| SWE-bench Verified | 71% | resolved | date=2025-06-23 · board=Verified · system=Warp · model_tag=claude-sonnet-4-20250514 | 23 Jun 2025 | swebench.comT2 |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). Results with different configs are not directly comparable — see methodology.
Current prices
No current prices recorded
Price history
No hardware estimate available
No lineage recorded
Papers 0
No papers linked yet.
Repositories 0
No repositories linked yet.
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
No claims recorded yet
Multiple scores 40.6% on SWE-bench Verified
swebench_leaderboardMultiple scores 41.6% on SWE-bench Verified
swebench_leaderboardMultiple scores 46.6% on SWE-bench Verified
swebench_leaderboardMultiple scores 47.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 48.6% on SWE-bench Verified
swebench_leaderboardMultiple scores 49.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 57.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 58.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 68.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 70.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 70.4% on SWE-bench Verified
swebench_leaderboardMultiple scores 71.2% on SWE-bench Verified
swebench_leaderboardMultiple scores 73.8% on SWE-bench Verified
swebench_leaderboardMultiple scores 74.4% on SWE-bench Verified
swebench_leaderboardMultiple scores 74.6% on SWE-bench Verified
swebench_leaderboardMultiple scores 75.2% on SWE-bench Verified
swebench_leaderboard
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| SWE-bench leaderboards | swebench.com/ | leaderboard | T2· Quality secondary | 53 min ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.