all the models — AI benchmark observatory
← Benchmarks

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark for large language models for code. It continuously collects new problems from programming contests (LeetCode, AtCoder, CodeForces) and evaluates four different scenarios: code generation, self-repair, code execution, and test output prediction. Problems are annotated with release dates to enable evaluation on unseen problems released after a model's training cutoff.

id livecodebench · max 1 · 75 models reported

#ModelScore
1DeepSeek-V4-Pro-Max
DeepSeek · open
0.94
2DeepSeek-V4-Flash-Max
DeepSeek · open
0.92
3DeepSeek-V4-Flash-0423
DeepSeek · open
0.88
4Solar Pro 4
Upstage
0.88
5DeepSeek-V3.2
DeepSeek · open
0.83
6DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.83
7MiniMax M2
MiniMax · open
0.83
8LongCat-Flash-Thinking-2601
Meituan · open
0.83
9Nemotron 3 Super (120B A12B)
NVIDIA · open
0.81
10Grok-3 Mini
xAI
0.80
11Grok 4 Fast
xAI
0.80
12Grok-3
xAI
0.79
13Grok-4 Heavy
xAI
0.79
14LongCat-Flash-Thinking
Meituan · open
0.79
15Grok-4
xAI
0.79
16MiniMax M2.1
MiniMax · open
0.78
17Nova 2 Pro
Amazon
0.75
18DeepSeek-V3.2-Exp
DeepSeek · open
0.74
19DeepSeek-R1-0528
DeepSeek · open
0.73
20GLM-4.5
Zhipu AI · open
0.73
21Nemotron Nano 9B v2
NVIDIA · open
0.71
22Nova 2 Lite
Amazon
0.71
23GLM-4.5-Air
Zhipu AI · open
0.71
24Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.71
25Gemini 2.5 Pro Preview 06-05
Google
0.69
26Mercury 2
Inception
0.67
27Llama 3.1 Nemotron Ultra 253B v1
NVIDIA · open
0.66
28Qwen3 32B
Alibaba Cloud / Qwen Team · open
0.66
29MiniMax M1 80K
MiniMax · open
0.65
30Ministral 3 (14B Reasoning 2512)
Mistral AI · open
0.65
31Mistral Small 4
Mistral AI · open
0.64
32QwQ-32B
Alibaba Cloud / Qwen Team · open
0.63
33Qwen3 30B A3B
Alibaba Cloud / Qwen Team · open
0.63
34MiniMax M1 40K
MiniMax · open
0.62
35Ministral 3 (8B Reasoning 2512)
Mistral AI · open
0.62
36DeepSeek R1 Distill Llama 70B
DeepSeek · open
0.57
37DeepSeek R1 Distill Qwen 32B
DeepSeek · open
0.57
38DeepSeek-V3.1
DeepSeek · open
0.56
39Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.56
40Min istral 3 (3B Reasoning 2512)
Mistral AI · open
0.55
41Phi 4 Reasoning
Microsoft · open
0.54
42Kimi K2-Instruct-0905
Moonshot AI · open
0.54
43DeepSeek R1 Distill Qwen 14B
DeepSeek · open
0.53
44Phi 4 Reasoning Plus
Microsoft · open
0.53
45Magistral Small 2506
Mistral AI · open
0.51
46Magistral Medium
Mistral AI · open
0.50
47DeepSeek R1 Zero
DeepSeek · open
0.50
48QwQ-32B-Preview
Alibaba Cloud / Qwen Team · open
0.50
49DeepSeek-V3 0324
DeepSeek · open
0.49
50LongCat-Flash-Chat
Meituan · open
0.48
51Llama 4 Maverick
Meta · open
0.43
52DeepSeek R1 Distill Llama 8B
DeepSeek · open
0.40
53DeepSeek R1 Distill Qwen 7B
DeepSeek · open
0.38
54DeepSeek-V3
DeepSeek · open
0.38
55Gemini 2.0 Flash
Google
0.35
56Mistral Large 3 (675B Base)
Mistral AI · open
0.34
57Mistral Large 3 (675B Instruct 2512 Eagle)
Mistral AI · open
0.34
58Mistral Large 3 (675B Instruct 2512 NVFP4)
Mistral AI · open
0.34
59Mistral Large 3 (675B Instruct 2512)
Mistral AI · open
0.34
60Gemini 2.5 Flash-Lite
Google · open
0.34
61Llama 4 Scout
Meta · open
0.33
62Qwen2.5-Coder 32B Instruct
Alibaba Cloud / Qwen Team · open
0.31
63Gemini Diffusion
Google
0.31
64Gemma 3 27B
Google · open
0.30
65Qwen2.5 7B Instruct
Alibaba Cloud / Qwen Team · open
0.29
66Qwen2 7B Instruct
Alibaba Cloud / Qwen Team · open
0.27
67Gemma 3 12B
Google · open
0.25
68Qwen2.5-Coder 7B Instruct
Alibaba Cloud / Qwen Team · open
0.18
69DeepSeek R1 Distill Qwen 1.5B
DeepSeek · open
0.17
70Gemma 3n E2B Instructed
Google
0.13
71Gemma 3n E2B Instructed LiteRT (Preview)
Google · open
0.13
72Gemma 3n E4B Instructed
Google
0.13
73Gemma 3n E4B Instructed LiteRT Preview
Google · open
0.13
74Gemma 3 4B
Google · open
0.13
75Gemma 3 1B
Google · open
0.02