← Benchmarks
DeepSWE 1.1
DeepSWE 1.1 evaluates software engineering agents using the mini-swe-agent harness.
id deepswe-1.1 · max 1 · 38 models reported
| # | Model | Score |
|---|---|---|
| 1 | Muse Spark 1.3 Meta | 0.75 |
| 2 | Claude Opus 5.5 Anthropic | 0.74 |
| 3 | DeepSeek-V4.1-Flash DeepSeek · open | 0.74 |
| 4 | GPT-6 Astra OpenAI | 0.74 |
| 5 | Gemini 3.8 Flash Google | 0.74 |
| 6 | GPT-5.6 Sol OpenAI | 0.73 |
| 7 | Claude Fable 5 Anthropic | 0.70 |
| 8 | GPT-5.6 Terra OpenAI | 0.70 |
