all the models — AI benchmark observatory
← Benchmarks

SWE-Lancer (IC-Diamond subset)

SWE-Lancer (IC-Diamond subset) is a benchmark of real-world freelance software engineering tasks from Upwork, ranging from $50 bug fixes to $32,000 feature implementations. It evaluates AI models on independent engineering tasks using end-to-end tests triple-verified by experienced software engineers, and includes managerial tasks where models choose between technical implementation proposals.

id swe-lancer-(ic-diamond-subset) · max 1 · 6 models reported

#ModelScore
1GPT-5
OpenAI
1.00
2GPT-5.3 Codex
OpenAI
0.81
3GPT-5.2
OpenAI
0.75