all the models — AI benchmark observatory
← Benchmarks

MMLU-Pro

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

id mmlu-pro · max 1 · 142 models reported

#ModelScore
1Sakana Namazu
Sakana AI
0.90
2Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.90
3Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.89
4Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.89
5MiniMax M2.1
MiniMax · open
0.88
6Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.88
7DeepSeek-V4-Pro-Max
DeepSeek · open
0.88
8Kimi K2.5
Moonshot AI · open
0.87
9ERNIE 5.0
Baidu
0.87
10Nemotron 3 Ultra (550B A55B)
NVIDIA · open
0.87
11Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.87
12DeepSeek-V4-Flash-0423
DeepSeek · open
0.86
13Solar Pro 4
Upstage
0.86
14DeepSeek-V4-Flash-Max
DeepSeek · open
0.86
15Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.86
16Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.86
17Qwen3 Max Thinking
Alibaba Cloud / Qwen Team
0.86
18Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.85
19Gemma 4 31B
Google · open
0.85
20Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.85
21DeepSeek-R1-0528
DeepSeek · open
0.85
22DeepSeek-V3.2
DeepSeek · open
0.85
23DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.85
24DeepSeek-V3.2-Exp
DeepSeek · open
0.85
25MAI-Thinking-1
Microsoft
0.85
26MiMo-V2-Flash
Xiaomi · open
0.85
27Seed 1.8
ByteDance
0.85
28GLM-4.5
Zhipu AI · open
0.85
29Kimi K2-Thinking-0905
Moonshot AI · open
0.85
30Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
0.84
31GLM-4.7
Zhipu AI · open
0.84
32K-EXAONE-236B-A23B
LG AI Research
0.84
33Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.84
34Nemotron 3 Super (120B A12B)
NVIDIA · open
0.84
35DeepSeek-V3.1
DeepSeek · open
0.84
36Seed 2.0 Mini
ByteDance
0.84
37EXAONE 4.5 33B
LG AI Research
0.83
38Qwen3-235B-A22B-Instruct-2507
Alibaba Cloud / Qwen Team · open
0.83
39Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team · open
0.83
40LongCat-Flash-Chat
Meituan · open
0.83
41Gemma 4 26B-A4B
Google · open
0.83
42LongCat-Flash-Thinking
Meituan · open
0.83
43Kimi K2 0905
Moonshot AI
0.82
44Qwen3.5-9B
Alibaba Cloud / Qwen Team · open
0.82
45Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.82
46MiniMax M2
MiniMax · open
0.82
47Nemotron 3.5 Lightning (30B A3B)
NVIDIA · open
0.82
48Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.82
49Sarvam-105B
Sarvam AI · open
0.82
50Nova 2 Pro
Amazon
0.82
51GLM-4.5-Air
Zhipu AI · open
0.81
52DeepSeek-V3 0324
DeepSeek · open
0.81
53Kimi K2 Instruct
Moonshot AI · open
0.81
54Kimi K2-Instruct-0905
Moonshot AI · open
0.81
55MiniMax M1 80K
MiniMax · open
0.81
56Nova 2 Lite
Amazon
0.81
57GPT OSS 120B High
OpenAI · open
0.81
58Nova 2 Omni
Amazon
0.81
59MiniMax M1 40K
MiniMax · open
0.81
60Qwen3-Next-80B-A3B-Instruct
Alibaba Cloud / Qwen Team · open
0.81
61Llama 4 Maverick
Meta · open
0.81
62Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.81
63Sarvam-30B
Sarvam AI · open
0.80
64Qwen3.5-4B
Alibaba Cloud / Qwen Team · open
0.79
65Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.79
66Nemotron 3 Nano (30B A3B)
NVIDIA · open
0.78
67LongCat-Flash-Lite
Meituan · open
0.78
68Mistral Small 4
Mistral AI · open
0.78
69Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.78
70Claude 3.5 Sonnet
Anthropic
0.78
71DiffusionGemma 26B-A4B
Google · open
0.78
72IBM Granite 4.2 30B
IBM · open
0.78
73Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.77
74Gemma 4 12B
Google · open
0.77
75Gemini 2.0 Flash
Google
0.76
76Claude 3.5 Sonnet
Anthropic
0.76
77Phi 4 Reasoning Plus
Microsoft · open
0.76
78DeepSeek-V3
DeepSeek · open
0.76
79Gemini 1.5 Pro
Google
0.76
80Grok-2
xAI
0.76
81GPT-4o
OpenAI
0.75
82Llama 4 Scout
Meta · open
0.74
83Phi 4 Reasoning
Microsoft · open
0.74
84IBM Granite 4.2 8B
IBM · open
0.74
85Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.74
86Llama 3.1 405B Instruct
Meta · open
0.73
87GPT-4o
OpenAI
0.73
88Grok-2 mini
xAI
0.72
89Gemini 2.0 Flash-Lite
Google
0.72
90Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.72
91Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.71
92Phi 4
Microsoft · open
0.70
93Gemma 4 E4B
Google · open
0.69
94Kimi K2 Base
Moonshot AI · open
0.69
95Mistral Small 3.2 24B Instruct
Mistral AI · open
0.69
96Qwen2.5 32B Instruct
Alibaba Cloud / Qwen Team · open
0.69
97Llama 3.3 70B Instruct
Meta · open
0.69
98Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.69
99Claude 3 Opus
Anthropic
0.69
100MiMo-V2.5-Pro
Xiaomi · open
0.69