all the models — AI benchmark observatory
← Benchmarks

CFEval

CFEval benchmark for evaluating code generation and problem-solving capabilities

id cfeval · max 10000 · 2 models reported

#ModelScore
1Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
2134.00
2Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team · open
2071.00
CFEval Leaderboard · all the models