all the models — AI benchmark observatory
← Benchmarks

HumanEval

A benchmark that measures functional correctness for synthesizing programs from docstrings, consisting of 164 original programming problems assessing language comprehension, algorithms, and simple mathematics

id humaneval · max 1 · 66 models reported

#ModelScore
1MiniCPM-SALA
OpenBMB · open
0.95
2Kimi K2 0905
Moonshot AI
0.94
3Claude 3.5 Sonnet
Anthropic
0.94
4GPT-5
OpenAI
0.93
5Kimi K2 Instruct
Moonshot AI · open
0.93
6Qwen2.5-Coder 32B Instruct
Alibaba Cloud / Qwen Team · open
0.93
7o1-mini
OpenAI
0.92
8Sarvam-30B
Sarvam AI · open
0.92
9Claude 3.5 Sonnet
Anthropic
0.92
10Mistral Large 2
Mistral AI · open
0.92
11Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.92
12GPT-4o
OpenAI
0.90
13Granite 3.3 8B Base
IBM · open
0.90
14Granite 3.3 8B Instruct
IBM · open
0.90
15Gemini Diffusion
Google
0.90
16DeepSeek-V2.5
DeepSeek · open
0.89
17Llama 3.1 405B Instruct
Meta · open
0.89
18Nova Pro
Amazon
0.89
19LongCat-Flash-Chat
Meituan · open
0.88
20Mistral Small 3.1 24B Instruct
Mistral AI · open
0.88
21Grok-2
xAI
0.88
22Llama 3.3 70B Instruct
Meta · open
0.88
23Qwen2.5 32B Instruct
Alibaba Cloud / Qwen Team · open
0.88
24Qwen2.5-Coder 7B Instruct
Alibaba Cloud / Qwen Team · open
0.88
25Claude 3.5 Haiku
Anthropic
0.88
26o1
OpenAI
0.88
27GPT-4.5
OpenAI
0.88
28Gemma 3 27B
Google · open
0.88
29GPT-4o mini
OpenAI
0.87
30GPT-4 Turbo
OpenAI
0.87
31Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.87
32Qwen2 72B Instruct
Alibaba Cloud / Qwen Team · open
0.86
33Grok-2 mini
xAI
0.86
34Gemma 3 12B
Google · open
0.85
35Nova Lite
Amazon
0.85
36Claude 3 Opus
Anthropic
0.85
37Mistral Small 3 24B Instruct
Mistral AI · open
0.85
38Qwen2.5 7B Instruct
Alibaba Cloud / Qwen Team · open
0.85
39Gemini 1.5 Pro
Google
0.84
40Qwen2.5 14B Instruct
Alibaba Cloud / Qwen Team · open
0.83
41Phi 4
Microsoft · open
0.83
42IBM Granite 4.0 Tiny Preview
IBM · open
0.82
43Codestral-22B
Mistral AI · open
0.81
44Nova Micro
Amazon
0.81
45Llama 3.1 70B Instruct
Meta · open
0.81
46Qwen2 7B Instruct
Alibaba Cloud / Qwen Team · open
0.80
47Qwen2.5-Omni-7B
Alibaba Cloud / Qwen Team · open
0.79
48Claude 3 Haiku
Anthropic
0.76
49Gemma 3n E4B Instructed
Google
0.75
50Gemma 3n E4B Instructed LiteRT Preview
Google · open
0.75
51Gemini 1.5 Flash
Google
0.74
52Grok-1.5
xAI
0.74
53Claude 3 Sonnet
Anthropic
0.73
54Llama 3.1 8B Instruct
Meta · open
0.73
55Pixtral-12B
Mistral AI · open
0.72
56Gemma 3 4B
Google · open
0.71
57Phi-3.5-MoE-instruct
Microsoft · open
0.71
58GPT-3.5 Turbo
OpenAI
0.68
59GPT-4
OpenAI
0.67
60Gemma 3n E2B Instructed
Google
0.67
61Gemma 3n E2B Instructed LiteRT (Preview)
Google · open
0.67
62Phi-3.5-mini-instruct
Microsoft · open
0.63
63Gemma 2 27B
Google · open
0.52
64Gemma 3 1B
Google · open
0.41
65Gemma 2 9B
Google · open
0.40
66Ministral 8B Instruct
Mistral AI · open
0.35