all the models — AI benchmark observatory
← Benchmarks

OSWorld-Verified

OSWorld-Verified is a verified subset of OSWorld, a scalable real computer environment for multimodal agents supporting task setup, execution-based evaluation, and interactive learning across Ubuntu, Windows, and macOS.

id osworld-verified · max 1 · 26 models reported

#ModelScore
1Qwen3.8 Max
Alibaba Cloud / Qwen Team · open
0.86
2Claude Fable 5
Anthropic
0.85
3Qwen3.8-27B
Alibaba Cloud / Qwen Team · open
0.84
4Claude Opus 4.8
Anthropic
0.83
5Gemini 3.6 Flash
Google
0.83
6MiMo-V2.6-Pro
Xiaomi · open
0.82
7Claude Sonnet 5
Anthropic
0.81
8MiMo-V2.6-Flash
Xiaomi · open
0.81
9Muse Spark 1.1
Meta
0.81
10Claude Mythos Preview
Anthropic
0.80
11GPT-5.5
OpenAI
0.79
12Gemini 3.5 Flash
Google
0.78
13Claude Opus 4.7
Anthropic
0.78
14GPT-5.4
OpenAI
0.75
15Gemini 3.5 Flash-Lite
Google
0.74
16Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.73
17Kimi K2.6
Moonshot AI · open
0.73
18GPT-5.4 mini
OpenAI
0.72
19MiniMax M3
MiniMax · open
0.70