AI OrbitExplore • Compare • Stay Ahead
VERIFIED AI BENCHMARK

SWE-bench Verified Leaderboard

Explore verified SWE-bench Verified AI benchmark results, rankings, methodology, sources and tested models on AI Orbit.

Software Engineering · % · Higher is better · Version Verified · DeepSeek V3.1
Only verified results are included in this public leaderboard.

Official methodology / benchmark source

#Model / ToolScoreTestedSource
1Claude Sonnet 585.20 %Aug 22, 2026Anthropic Claude Sonnet 5 System Card
2GPT-574.90 %Aug 7, 2025OpenAI GPT-5 developer announcement
3Claude Opus 4.174.50 %Aug 5, 2025Anthropic Claude Opus 4.1 announcement
4Claude Sonnet 472.70 %May 22, 2025Anthropic Claude 4 announcement
5Claude Opus 472.50 %May 22, 2025Anthropic Claude 4 announcement
6GPT-5 mini71.00 %Aug 7, 2025OpenAI GPT-5 developer announcement
7o369.10 %Aug 7, 2025OpenAI GPT-5 developer announcement
8o4-mini68.10 %Aug 7, 2025OpenAI GPT-5 developer announcement
9DeepSeek-V3.166.00 %Aug 21, 2025DeepSeek API changelog
10Gemini 2.5 Pro63.80 %Mar 25, 2025Google Gemini 2.5 announcement
11Claude 3.7 Sonnet62.30 %May 22, 2025Anthropic Claude 4 announcement
12GPT-5 nano54.70 %Aug 7, 2025OpenAI GPT-5 developer announcement
13GPT-4.154.60 %Aug 7, 2025OpenAI GPT-5 developer announcement
14GPT-4o33.20 %Apr 14, 2025OpenAI GPT-4.1 announcement
15GPT-4.1 mini23.60 %Aug 7, 2025OpenAI GPT-5 developer announcement
16GPT-4o mini8.70 %Apr 14, 2025OpenAI GPT-4.1 announcement

About SWE-bench Verified

This leaderboard uses the latest verified result available for each listed entity. Results retain their source and test date so readers can evaluate freshness and methodology.