all the models — AI benchmark observatory
← Benchmarks

IFEval

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

id ifeval · max 1 · 70 models reported

#ModelScore
1Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.95
2Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.95
3Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.94
4Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.94
5o3-mini
OpenAI
0.94
6Qwen3 Max Thinking
Alibaba Cloud / Qwen Team
0.93
7Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.93
8Claude 3.7 Sonnet
Anthropic
0.93
9Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.93
10Llama 3.3 70B Instruct
Meta · open
0.92
11Nova Pro
Amazon
0.92
12Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.92
13Qwen3.5-9B
Alibaba Cloud / Qwen Team · open
0.92
14Gemma 3 27B
Google · open
0.90
15Nemotron Nano 9B v2
NVIDIA · open
0.90
16Gemma 3 4B
Google · open
0.90
17Kimi K2 Instruct
Moonshot AI · open
0.90
18Kimi K2-Instruct-0905
Moonshot AI · open
0.90
19Qwen3.5-4B
Alibaba Cloud / Qwen Team · open
0.90
20Nova Lite
Amazon
0.90
21LongCat-Flash-Chat
Meituan · open
0.90
22EXAONE 4.5 33B
LG AI Research
0.90
23Llama 3.1 Nemotron Ultra 253B v1
NVIDIA · open
0.89
24Gemma 3 12B
Google · open
0.89
25Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team · open
0.89
26Qwen3-235B-A22B-Instruct-2507
Alibaba Cloud / Qwen Team · open
0.89
27Llama 3.1 405B Instruct
Meta · open
0.89
28GPT-4.5
OpenAI
0.88
29Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.88
30Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.88
31Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.88
32Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
0.88
33Qwen3-Next-80B-A3B-Instruct
Alibaba Cloud / Qwen Team · open
0.88
34Llama 3.1 70B Instruct
Meta · open
0.88
35GPT-4.1
OpenAI
0.87
36Kimi-k1.5
Moonshot AI
0.87
37Nova Micro
Amazon
0.87
38DeepSeek-V3
DeepSeek · open
0.86
39Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.86
40Qwen3 14B
Alibaba Cloud / Qwen Team · open
0.85
41Phi 4 Reasoning Plus
Microsoft · open
0.85
42Sarvam-105B
Sarvam AI · open
0.85
43Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.85
44GPT-4.1 mini
OpenAI
0.84
45Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.84
46QwQ-32B
Alibaba Cloud / Qwen Team · open
0.84
47Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.84
48Phi 4 Reasoning
Microsoft · open
0.83
49Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.83
50Mistral Small 3 24B Instruct
Mistral AI · open
0.83
51Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.83
52LFM2.5-VL-3B
Liquid AI · open
0.82
53Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team · open
0.82
54Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.82
55GPT-4o
OpenAI
0.81
56Llama 3.1 8B Instruct
Meta · open
0.80
57Gemma 3 1B
Google · open
0.80
58Llama 3.1 Nemotron Nano 8B V1
NVIDIA · open
0.79
59Qwen3.5-2B
Alibaba Cloud / Qwen Team · open
0.79
60Llama 3.2 3B Instruct
Meta · open
0.77
61MiniCPM-SALA
OpenBMB · open
0.76
62North Micro Vision Instruct
Cohere · open
0.75
63Granite 3.3 8B Base
IBM · open
0.75
64Granite 3.3 8B Instruct
IBM · open
0.75
65GPT-4.1 nano
OpenAI
0.74
66Qwen2.5 7B Instruct
Alibaba Cloud / Qwen Team · open
0.71
67IBM Granite 4.0 Tiny Preview
IBM · open
0.63
68Phi 4
Microsoft · open
0.63
69Pixtral-12B
Mistral AI · open
0.61
70Qwen3.5-0.8B
Alibaba Cloud / Qwen Team · open
0.44