all the models — AI benchmark observatory
← Benchmarks

MMBench-V1.1

Version 1.1 of MMBench, an improved bilingual benchmark for assessing multi-modal capabilities of vision-language models through multiple-choice questions in both English and Chinese, providing systematic evaluation across diverse vision-language tasks.

id mmbench-v1.1 · max 1 · 20 models reported

#ModelScore
1Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.93
2Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.93
3Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.93
4Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.92
5Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.92
6Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.91
7Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.91
8Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.90
9Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.89
10Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.88
11Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.87
12Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.87
13Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team · open
0.85
14Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.85