all the models — AI benchmark observatory
← Benchmarks

SWE-bench Multilingual

A multilingual benchmark for issue resolving in software engineering that covers Java, TypeScript, JavaScript, Go, Rust, C, and C++. Contains 1,632 high-quality instances carefully annotated from 2,456 candidates by 68 expert annotators, designed to evaluate Large Language Models across diverse software ecosystems beyond Python.

id swe-bench-multilingual · max 1 · 46 models reported

#ModelScore
1Claude Opus 5.5
Anthropic
0.94
2Claude Mythos Preview
Anthropic
0.87
3Claude Opus 4.8
Anthropic
0.84
4Hy4 preview
Tencent · open
0.83
5Qwen3.8 Flash
Alibaba Cloud / Qwen Team
0.81
6Qwen3.8-Flash-Next
Alibaba Cloud / Qwen Team · open
0.81
7Laguna S 2.1
Poolside · open
0.79
8Claude Sonnet 5
Anthropic
0.78
9Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.78
10Claude Opus 4.6
Anthropic
0.78
11Kimi K2.6
Moonshot AI · open
0.77
12MiniMax M2.7
MiniMax · open
0.77
13DeepSeek-V4-Pro-Max
DeepSeek · open
0.76
14Hy3
Tencent · open
0.76
15Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.76
16Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.74
17DeepSeek-V4-Flash-Max
DeepSeek · open
0.73
18Kimi K2.5
Moonshot AI · open
0.73
19MiniMax M2.1
MiniMax · open
0.72
20Ling 3.0 Flash
InclusionAI
0.72
21MiMo-V2-Flash
Xiaomi · open
0.72
22MiMo-V2-Pro
Xiaomi
0.72
23Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.71