← Benchmarks
SWE-Lancer (IC-Diamond subset)
SWE-Lancer (IC-Diamond subset) is a benchmark of real-world freelance software engineering tasks from Upwork, ranging from $50 bug fixes to $32,000 feature implementations. It evaluates AI models on independent engineering tasks using end-to-end tests triple-verified by experienced software engineers, and includes managerial tasks where models choose between technical implementation proposals.
id swe-lancer-(ic-diamond-subset) · max 1 · 6 models reported
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 OpenAI | 1.00 |
| 2 | GPT-5.3 Codex OpenAI | 0.81 |
| 3 | GPT-5.2 OpenAI | 0.75 |
