VERIFIED AI BENCHMARK
SWE-bench Verified Leaderboard
Explore verified SWE-bench Verified AI benchmark results, rankings, methodology, sources and tested models on AI Orbit.
Software Engineering · % · Higher is better · Version Verified · DeepSeek V3.1
Only verified results are included in this public leaderboard.
Only verified results are included in this public leaderboard.
| # | Model / Tool | Score | Tested | Source |
|---|---|---|---|---|
| 1 | Claude Sonnet 5 | 85.20 % | Aug 22, 2026 | Anthropic Claude Sonnet 5 System Card |
| 2 | GPT-5 | 74.90 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 3 | Claude Opus 4.1 | 74.50 % | Aug 5, 2025 | Anthropic Claude Opus 4.1 announcement |
| 4 | Claude Sonnet 4 | 72.70 % | May 22, 2025 | Anthropic Claude 4 announcement |
| 5 | Claude Opus 4 | 72.50 % | May 22, 2025 | Anthropic Claude 4 announcement |
| 6 | GPT-5 mini | 71.00 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 7 | o3 | 69.10 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 8 | o4-mini | 68.10 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 9 | DeepSeek-V3.1 | 66.00 % | Aug 21, 2025 | DeepSeek API changelog |
| 10 | Gemini 2.5 Pro | 63.80 % | Mar 25, 2025 | Google Gemini 2.5 announcement |
| 11 | Claude 3.7 Sonnet | 62.30 % | May 22, 2025 | Anthropic Claude 4 announcement |
| 12 | GPT-5 nano | 54.70 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 13 | GPT-4.1 | 54.60 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 14 | GPT-4o | 33.20 % | Apr 14, 2025 | OpenAI GPT-4.1 announcement |
| 15 | GPT-4.1 mini | 23.60 % | Aug 7, 2025 | OpenAI GPT-5 developer announcement |
| 16 | GPT-4o mini | 8.70 % | Apr 14, 2025 | OpenAI GPT-4.1 announcement |
About SWE-bench Verified
This leaderboard uses the latest verified result available for each listed entity. Results retain their source and test date so readers can evaluate freshness and methodology.