all the models — AI benchmark observatory
← Benchmarks

MMMU

MMMU (Massive Multi-discipline Multimodal Understanding) is a benchmark designed to evaluate multimodal models on college-level subject knowledge and deliberate reasoning. Contains 11.5K meticulously collected multimodal questions from college exams, quizzes, and textbooks, covering six core disciplines: Art & Design, Business, Science, Health & Medicine, Humanities & Social Science, and Tech & Engineering across 30 subjects and 183 subfields.

id mmmu · max 1 · 66 models reported

#ModelScore
1Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.86
2GPT-5.1
OpenAI
0.85
3GPT-5.1 Instant
OpenAI
0.85
4GPT-5.1 Thinking
OpenAI
0.85
5GPT-5
OpenAI
0.84
6Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.84
7Seed 1.8
ByteDance
0.83
8o3
OpenAI
0.83
9Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.83
10Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.82
11Gemini 2.5 Pro Preview 06-05
Google
0.82
12Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.82
13o4-mini
OpenAI
0.82
14Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.81
15Gemini 2.5 Flash
Google
0.80
16Seed 2.0 Mini
ByteDance
0.80
17Gemini 2.5 Pro
Google
0.80
18EXAONE 4.5 33B
LG AI Research
0.79
19Step3-VL-10B
StepFun · open
0.78
20Grok-3
xAI
0.78
21o1
OpenAI
0.78
22Gemini 2.0 Flash Thinking
Google
0.75
23GPT-4.5
OpenAI
0.75
24Command A+
Cohere · open
0.75
25Claude 3.7 Sonnet
Anthropic
0.75
26GPT-4.1
OpenAI
0.75
27Claude Sonnet 4
Anthropic
0.74
28Llama 4 Maverick
Meta · open
0.73
29Gemini 2.5 Flash-Lite
Google · open
0.73
30GPT-4.1 mini
OpenAI
0.73
31GPT-4o
OpenAI
0.72
32Gemini 2.0 Flash
Google
0.71
33QvQ-72B-Preview
Alibaba Cloud / Qwen Team · open
0.70
34Qwen2.5 VL 72B Instruct
Alibaba Cloud / Qwen Team · open
0.70
35Kimi-k1.5
Moonshot AI
0.70
36Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.70
37Llama 4 Scout
Meta · open
0.69
38Claude 3.5 Sonnet
Anthropic
0.68
39Gemini 2.0 Flash-Lite
Google
0.68
40Grok-2
xAI
0.66
41Gemini 1.5 Pro
Google
0.66
42Pixtral Large
Mistral AI · open
0.64
43Grok-2 mini
xAI
0.63
44Mistral Small 3.2 24B Instruct
Mistral AI · open
0.63
45Gemini 1.5 Flash
Google
0.62
46Nova Pro
Amazon
0.62
47Llama 3.2 90B Instruct
Meta · open
0.60
48GPT-4o mini
OpenAI
0.59
49Mistral Small 3.1 24B Base
Mistral AI · open
0.59
50Mistral Small 3.1 24B Instruct
Mistral AI · open
0.59
51Qwen2.5-Omni-7B
Alibaba Cloud / Qwen Team · open
0.59
52Qwen2.5 VL 7B Instruct
Alibaba Cloud / Qwen Team · open
0.59
53Nova Lite
Amazon
0.56
54GPT-4.1 nano
OpenAI
0.55
55Phi-4-multimodal-instruct
Microsoft · open
0.55
56Gemini 1.5 Flash 8B
Google
0.54
57Grok-1.5
xAI
0.54
58Grok-1.5V
xAI
0.54
59Pixtral-12B
Mistral AI · open
0.53
60DeepSeek VL2
DeepSeek · open
0.51
61Llama 3.2 11B Instruct
Meta · open
0.51
62DeepSeek VL2 Small
DeepSeek · open
0.48
63Gemini 1.0 Pro
Google
0.48
64Phi-3.5-vision-instruct
Microsoft · open
0.43
65DeepSeek VL2 Tiny
DeepSeek · open
0.41
66GPT-3.5 Turbo
OpenAI
0.00