all the models — AI benchmark observatory
← Benchmarks

SWE-Bench Verified

A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases.

id swe-bench-verified · max 1 · 116 models reported

#ModelScore
1Claude Fable 5
Anthropic
0.95
2Claude Mythos Preview
Anthropic
0.94
3Claude Opus 4.8
Anthropic
0.89
4Claude Opus 4.7
Anthropic
0.88
5Claude Sonnet 5
Anthropic
0.85
6Claude Opus 4.5
Anthropic
0.81
7Claude Opus 4.6
Anthropic
0.81
8DeepSeek-V4-Pro-Max
DeepSeek · open
0.81
9Gemini 3.1 Pro
Google
0.81
10MiniMax M3
MiniMax · open
0.81
11Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.80
12Inkling-Small
Thinking Machines Lab · open
0.80
13Kimi K2.6
Moonshot AI · open
0.80
14MiniMax M2.5
MiniMax · open
0.80
15GPT-5.2
OpenAI
0.80
16Claude Sonnet 4.6
Anthropic
0.80
17DeepSeek-V4-Flash-Max
DeepSeek · open
0.79
18MiMo-V2.5-Pro
Xiaomi · open
0.79
19Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.79
20DeepSeek-V4-Flash-0423
DeepSeek · open
0.79
21Gemini 3 Flash
Google
0.78
22Hy3
Tencent · open
0.78
23MiMo-V2-Pro
Xiaomi
0.78
24GLM-5
Zhipu AI · open
0.78
25Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.78
26Inkling
Thinking Machines Lab · open
0.78
27Mistral Medium 3.5
Mistral AI · open
0.78
28Muse Spark
Meta
0.77
29Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.77
30Kimi K2.5
Moonshot AI · open
0.77
31Seed 2.0 Pro
ByteDance
0.77
32Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.76
33GPT-5.1
OpenAI
0.76
34GPT-5.1 Instant
OpenAI
0.76
35GPT-5.1 Thinking
OpenAI
0.76
36Gemini 3 Pro
Google
0.76
37Muse Glimmer-30B
Meta · open
0.76
38Qwen3 Max Thinking
Alibaba Cloud / Qwen Team
0.75
39GPT-5
OpenAI
0.75
40MiMo-V2-Omni
Xiaomi
0.75
41Claude Opus 4.1
Anthropic
0.74
42GPT-5 Codex
OpenAI
0.74
43Step-3.5-Flash
StepFun · open
0.74
44GLM-4.7
Zhipu AI · open
0.74
45GPT-5.1 Codex
OpenAI
0.74
46MAI-Thinking-1
Microsoft
0.73
47Seed 2.0 Lite
ByteDance
0.73
48MiMo-V2-Flash
Xiaomi · open
0.73
49Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.73
50Claude Haiku 4.5
Anthropic
0.73
51DeepSeek-V3.2
DeepSeek · open
0.73
52DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.73
53DeepSeek-V3.2-Speciale
DeepSeek · open
0.73
54Seed 1.8
ByteDance
0.73
55Claude Sonnet 4
Anthropic
0.73
56MAI-Code-1.1-Flash
Microsoft
0.73
57Claude Opus 4
Anthropic
0.72
58Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.72
59Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.72
60MAI-Code-1-Flash
Microsoft
0.72
61Kimi K2-Thinking-0905
Moonshot AI · open
0.71
62Laguna XS 2.1
Poolside · open
0.71
63Grok Code Fast 1
xAI
0.71
64Nemotron 3 Ultra (550B A55B)
NVIDIA · open
0.71
65Solar Pro 4
Upstage
0.71
66Claude 3.7 Sonnet
Anthropic
0.70
67LongCat-Flash-Thinking-2601
Meituan · open
0.70
68Nova 2 Pro
Amazon
0.70
69Qwen3 Max
Alibaba Cloud / Qwen Team
0.70
70Qwen3-Coder 480B A35B Instruct
Alibaba Cloud / Qwen Team · open
0.70
71MiniMax M2
MiniMax · open
0.69
72Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.69
73o3
OpenAI
0.69
74o4-mini
OpenAI
0.68
75GLM-4.6
Zhipu AI · open
0.68
76DeepSeek-V3.2-Exp
DeepSeek · open
0.68
77North Mini Code 1.0
Cohere · open
0.68
78Gemini 2.5 Pro Preview 06-05
Google
0.67
79MiniMax M2.1
MiniMax · open
0.67
80DeepSeek-V3.1
DeepSeek · open
0.66
81Kimi K2-Instruct-0905
Moonshot AI · open
0.66
82Nova 2 Lite
Amazon
0.65
83GLM-4.5
Zhipu AI · open
0.64
84Gemini 2.5 Pro
Google
0.63
85Devstral Medium
Mistral AI
0.62
86Gemini 2.5 Flash
Google
0.60
87LongCat-Flash-Chat
Meituan · open
0.60
88LongCat-Flash-Thinking
Meituan · open
0.59
89GLM-4.7-Flash
Zhipu AI · open
0.59
90GLM-4.5-Air
Zhipu AI · open
0.58
91IBM Granite 4.2 30B
IBM · open
0.57
92MiniMax M1 80K
MiniMax · open
0.56
93MiniMax M1 40K
MiniMax · open
0.56
94GPT-4.1
OpenAI
0.55
95LongCat-Flash-Lite
Meituan · open
0.54
96Nemotron 3 Super (120B A12B)
NVIDIA · open
0.54
97Devstral Small 1.1
Mistral AI · open
0.54
98Nemotron 3.5 Lightning (30B A3B)
NVIDIA · open
0.52
99o3-mini
OpenAI
0.49
100Claude 3.5 Sonnet
Anthropic
0.49
SWE-Bench Verified Leaderboard · all the models