all the models — AI benchmark observatory
← Benchmarks

MMLU

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

id mmlu · max 1 · 103 models reported

#ModelScore
1GPT-5
OpenAI
0.93
2Seed 1.8
ByteDance
0.92
3o1
OpenAI
0.92
4GPT-4.5
OpenAI
0.91
5o1-preview
OpenAI
0.91
6Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.91
7Sarvam-105B
Sarvam AI · open
0.91
8Claude 3.5 Sonnet
Anthropic
0.90
9Claude 3.5 Sonnet
Anthropic
0.90
10GPT-4.1
OpenAI
0.90
11Kimi K2 0905
Moonshot AI
0.90
12GPT OSS 120B
OpenAI · open
0.90
13LongCat-Flash-Chat
Meituan · open
0.90
14Kimi K2 Instruct
Moonshot AI · open
0.90
15Kimi K2-Instruct-0905
Moonshot AI · open
0.90
16MiMo-V2.5-Pro
Xiaomi · open
0.89
17Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.89
18GPT-4o
OpenAI
0.89
19Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.89
20DeepSeek-V3
DeepSeek · open
0.89
21Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.88
22Kimi K2 Base
Moonshot AI · open
0.88
23Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.88
24GPT-4.1 mini
OpenAI
0.88
25Grok-2
xAI
0.88
26Kimi-k1.5
Moonshot AI
0.87
27Llama 3.1 405B Instruct
Meta · open
0.87
28o3-mini
OpenAI
0.87
29Claude 3 Opus
Anthropic
0.87
30GPT-4 Turbo
OpenAI
0.86
31GPT-4
OpenAI
0.86
32Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.86
33Grok-2 mini
xAI
0.86
34Llama 3.2 90B Instruct
Meta · open
0.86
35Llama 3.3 70B Instruct
Meta · open
0.86
36Gemini 1.5 Pro
Google
0.86
37Nova Pro
Amazon
0.86
38GPT-4o
OpenAI
0.86
39LongCat-Flash-Lite
Meituan · open
0.86
40Llama 4 Maverick
Meta · open
0.85
41GPT OSS 20B
OpenAI · open
0.85
42o1-mini
OpenAI
0.85
43Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.85
44Sarvam-30B
Sarvam AI · open
0.85
45Hermes 3 405B
Nous Research · open
0.85
46Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.85
47Phi 4
Microsoft · open
0.85
48Mistral Large 2
Mistral AI · open
0.84
49Llama 3.1 70B Instruct
Meta · open
0.84
50Qwen2.5 32B Instruct
Alibaba Cloud / Qwen Team · open
0.83
51Qwen2 72B Instruct
Alibaba Cloud / Qwen Team · open
0.82
52GPT-4o mini
OpenAI
0.82
53Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.81
54Grok-1.5
xAI
0.81
55Jamba 1.5 Large
AI21 Labs · open
0.81
56Mistral Small 3.1 24B Base
Mistral AI · open
0.81
57Mistral Small 3 24B Base
Mistral AI · open
0.81
58Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.81
59Mistral Small 3.1 24B Instruct
Mistral AI · open
0.81
60Mistral Small 3.2 24B Instruct
Mistral AI · open
0.81
61Nova Lite
Amazon
0.81
62DeepSeek-V2.5
DeepSeek · open
0.80
63Llama 3.1 Nemotron 70B Instruct
NVIDIA · open
0.80
64GPT-4.1 nano
OpenAI
0.80
65Qwen2.5 14B Instruct
Alibaba Cloud / Qwen Team · open
0.80
66Llama 4 Scout
Meta · open
0.80
67Ministral 3 (14B Base 2512)
Mistral AI · open
0.79
68Hermes 3 70B
Nous Research · open
0.79
69Claude 3 Sonnet
Anthropic
0.79
70Gemini 1.5 Flash
Google
0.79
71Phi-3.5-MoE-instruct
Microsoft · open
0.79
72Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.78
73Nova Micro
Amazon
0.78
74Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team · open
0.77
75Ministral 3 (8B Base 2512)
Mistral AI · open
0.76
76Command R+
Cohere · open
0.76
77Claude 3 Haiku
Anthropic
0.75
78Gemma 2 27B
Google · open
0.75
79Qwen2.5-Coder 32B Instruct
Alibaba Cloud / Qwen Team · open
0.75
80Llama 3.2 11B Instruct
Meta · open
0.73
81Gemini 1.0 Pro
Google
0.72
82Gemma 2 9B
Google · open
0.71
83Ministral 3 (3B Base 2512)
Mistral AI · open
0.71
84Qwen2 7B Instruct
Alibaba Cloud / Qwen Team · open
0.70
85GPT-3.5 Turbo
OpenAI
0.70
86Jamba 1.5 Mini
AI21 Labs · open
0.70
87Llama 3.1 8B Instruct
Meta · open
0.69
88Pixtral-12B
Mistral AI · open
0.69
89Phi-3.5-mini-instruct
Microsoft · open
0.69
90Mistral NeMo Instruct
Mistral AI · open
0.68
91Qwen2.5-Coder 7B Instruct
Alibaba Cloud / Qwen Team · open
0.68
92Phi 4 Mini
Microsoft · open
0.67
93Granite 3.3 8B Instruct
IBM · open
0.66
94Ministral 8B Instruct
Mistral AI · open
0.65
95Gemma 3n E4B Instructed
Google
0.65
96Gemma 3n E4B Instructed LiteRT Preview
Google · open
0.65
97Granite 3.3 8B Base
IBM · open
0.64
98Llama 3.2 3B Instruct
Meta · open
0.63
99IBM Granite 4.0 Tiny Preview
IBM · open
0.60
100Gemma 3n E2B Instructed
Google
0.60