← Benchmarks
MLVU
A comprehensive benchmark for multi-task long video understanding that evaluates multimodal large language models on videos ranging from 3 minutes to 2 hours across 9 distinct tasks including reasoning, captioning, recognition, and summarization.
id mlvu · max 1 · 10 models reported
| # | Model | Score |
|---|---|---|
| 1 | Qwen3.7-Plus Alibaba Cloud / Qwen Team | 0.87 |
| 2 | Qwen3.5-122B-A10B Alibaba Cloud / Qwen Team · open | 0.87 |
| 3 | Qwen3.6 Plus Alibaba Cloud / Qwen Team | 0.87 |
| 4 | Qwen3.6-27B Alibaba Cloud / Qwen Team · open | 0.87 |
| 5 | Qwen3.6-35B-A3B Alibaba Cloud / Qwen Team · open | 0.86 |
| 6 | Qwen3.5-27B Alibaba Cloud / Qwen Team · open | 0.86 |
| 7 | Qwen3.5-35B-A3B Alibaba Cloud / Qwen Team · open | 0.86 |
