all the models — AI benchmark observatory
← Benchmarks

MMMU-Pro

A more robust multi-discipline multimodal understanding benchmark that enhances MMMU through a three-step process: filtering text-only answerable questions, augmenting candidate options, and introducing vision-only input settings. Achieves significantly lower model performance (16.8-26.9%) compared to original MMMU, providing more rigorous evaluation that closely mimics real-world scenarios.

id mmmu-pro · max 1 · 72 models reported

#ModelScore
1Gemini 3.5 Flash
Google
0.84
2GPT-5.5
OpenAI
0.83
3GPT-5.6 Sol
OpenAI
0.83
4Seed 2.1 Pro
ByteDance
0.83
5Qwen3.8 Max
Alibaba Cloud / Qwen Team · open
0.82
6Seed 2.1 Turbo
ByteDance
0.82
7Kimi K3
Moonshot AI · open
0.82
8Gemini 3 Flash
Google
0.81
9GPT-5.4
OpenAI
0.81
10Gemini 3 Pro
Google
0.81
11GPT-5.6 Terra
OpenAI
0.81
12Gemini 3.1 Pro
Google
0.81
13Muse Spark
Meta
0.80
14Kimi K2.6
Moonshot AI · open
0.80
15GPT-5.2
OpenAI
0.80
16Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.79
17Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.79
18Kimi K2.5
Moonshot AI · open
0.79
19GPT-5
OpenAI
0.78
20GPT-5.6 Luna
OpenAI
0.78
21MiniMax M3
MiniMax · open
0.78
22MiMo-V2.5
Xiaomi · open
0.78
23Claude Opus 4.6
Anthropic
0.77
24Gemma 4 31B
Google · open
0.77
25Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.77
26Gemini 3.1 Flash-Lite
Google
0.77
27GPT-5.4 mini
OpenAI
0.77
28o3
OpenAI
0.76
29GPT-5.5 Instant
OpenAI
0.76
30Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.76
31Claude Sonnet 4.6
Anthropic
0.76
32Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.75
33Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.75
34Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.75
35Inkling-Small
Thinking Machines Lab · open
0.74
36Muse Glimmer-30B
Meta · open
0.74
37Gemma 4 26B-A4B
Google · open
0.74
38Inkling
Thinking Machines Lab · open
0.73
39Seed 1.8
ByteDance
0.73
40Seed 2.0 Mini
ByteDance
0.71
41Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.69
42Gemma 4 12B
Google · open
0.69
43EXAONE 4.5 33B
LG AI Research
0.69
44Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.68
45Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.68
46GPT-5.4 nano
OpenAI
0.66
47Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.65
48Nova 2 Pro
Amazon
0.64
49Command A+
Cohere · open
0.63
50Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.63
51Nova 2 Lite
Amazon
0.62
52Nova 2 Omni
Amazon
0.61
53Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.60
54Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.60
55Mistral Small 4
Mistral AI · open
0.60
56GPT-4o
OpenAI
0.60
57Llama 4 Maverick
Meta · open
0.60
58Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.57
59Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.56
60DiffusionGemma 26B-A4B
Google · open
0.54
61Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team · open
0.53
62Gemma 4 E4B
Google · open
0.53
63Qwen2.5 VL 72B Instruct
Alibaba Cloud / Qwen Team · open
0.51
64Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.49
65Qwen2-VL-72B-Instruct
Alibaba Cloud / Qwen Team · open
0.46
66Llama 3.2 90B Instruct
Meta · open
0.45
67Gemma 4 E2B
Google · open
0.44
68Phi-4-multimodal-instruct
Microsoft · open
0.39
69Qwen2.5 VL 7B Instruct
Alibaba Cloud / Qwen Team · open
0.38
70Qwen2.5-Omni-7B
Alibaba Cloud / Qwen Team · open
0.37
71Llama 3.2 11B Instruct
Meta · open
0.33
72LFM2.5-VL-3B
Liquid AI · open
0.30