all the models — AI benchmark observatory
← Benchmarks

MMLU-Redux

An improved version of the MMLU benchmark featuring manually re-annotated questions to identify and correct errors in the original dataset. Provides more reliable evaluation metrics for language models by addressing dataset quality issues found in the original MMLU.

id mmlu-redux · max 1 · 50 models reported

#ModelScore
1Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.95
2Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.95
3Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.94
4Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.94
5Kimi K2-Thinking-0905
Moonshot AI · open
0.94
6Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.94
7Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
0.94
8Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.94
9Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.94
10DeepSeek-R1-0528
DeepSeek · open
0.93
11Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.93
12Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.93
13Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.93
14Qwen3-235B-A22B-Instruct-2507
Alibaba Cloud / Qwen Team · open
0.93
15MiMo-V2.5-Pro
Xiaomi · open
0.93
16Qwen3 Max Thinking
Alibaba Cloud / Qwen Team
0.93
17Kimi K2 Instruct
Moonshot AI · open
0.93
18Kimi K2-Instruct-0905
Moonshot AI · open
0.93
19Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team · open
0.93
20Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.92
21Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.92
22DeepSeek-V3.1
DeepSeek · open
0.92
23Qwen3.5-9B
Alibaba Cloud / Qwen Team · open
0.91
24Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.91
25Qwen3-Next-80B-A3B-Instruct
Alibaba Cloud / Qwen Team · open
0.91
26Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.90
27LongCat-Flash-Thinking
Meituan · open
0.89
28DeepSeek-V3
DeepSeek · open
0.89
29Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.89
30Qwen3.5-4B
Alibaba Cloud / Qwen Team · open
0.89
MMLU-Redux Leaderboard · all the models