all the models — AI benchmark observatory
← Benchmarks

DeepSWE 1.1

DeepSWE 1.1 evaluates software engineering agents using the mini-swe-agent harness.

id deepswe-1.1 · max 1 · 38 models reported

#ModelScore
1Muse Spark 1.3
Meta
0.75
2Claude Opus 5.5
Anthropic
0.74
3DeepSeek-V4.1-Flash
DeepSeek · open
0.74
4GPT-6 Astra
OpenAI
0.74
5Gemini 3.8 Flash
Google
0.74
6GPT-5.6 Sol
OpenAI
0.73
7Claude Fable 5
Anthropic
0.70
8GPT-5.6 Terra
OpenAI
0.70