all the models — AI benchmark observatory
← Benchmarks

ScreenSpot

ScreenSpot is the first realistic GUI grounding benchmark that encompasses mobile, desktop, and web environments. The dataset comprises over 1,200 instructions from iOS, Android, macOS, Windows and Web environments, along with annotated element types (text and icon/widget), designed to evaluate visual GUI agents' ability to accurately locate screen elements based on natural language instructions.

id screenspot · max 1 · 16 models reported

#ModelScore
1Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.96
2Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.96
3Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.95
4Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.95
5Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.95
6Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.95
7Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.94
8Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team · open
0.94
9Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.94
10Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.93
11Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.89
12Nova 2 Pro
Amazon
0.88
13Qwen2.5 VL 72B Instruct
Alibaba Cloud / Qwen Team · open
0.87
14Nova 2 Omni
Amazon
0.85