all the models — AI benchmark observatory
← Benchmarks

AndroidWorld

AndroidWorld evaluates an agent's ability to operate in real Android GUI environments, completing multi-step tasks by perceiving screen content and executing touch/type actions.

id androidworld · max 1 · 8 models reported

#ModelScore
1Qwen3.8 Max
Alibaba Cloud / Qwen Team · open
0.85
2Qwen3.8 Flash
Alibaba Cloud / Qwen Team
0.84
3Qwen3.8-Flash-Next
Alibaba Cloud / Qwen Team · open
0.84
4Qwen3.8-27B
Alibaba Cloud / Qwen Team · open
0.82
5Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.81
6GLM-5V-Turbo
Zhipu AI
0.76
7Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.70