all the models — AI benchmark observatory
← Benchmarks

MLVU

A comprehensive benchmark for multi-task long video understanding that evaluates multimodal large language models on videos ranging from 3 minutes to 2 hours across 9 distinct tasks including reasoning, captioning, recognition, and summarization.

id mlvu · max 1 · 10 models reported

#ModelScore
1Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.87
2Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.87
3Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.87
4Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.87
5Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.86
6Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.86
7Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.86