all the models — AI benchmark observatory
← Benchmarks

FrontierCode 1.1

FrontierCode 1.1 evaluates whether coding-agent changes are mergeable, using unit tests, maintainer-defined rubrics, and verifiers. Runs flagged for unfair internet use receive a zero score.

id frontiercode-1.1 · max 1 · 20 models reported

#ModelScore

No scores for this benchmark yet.