all the models — AI benchmark observatory
← Benchmarks

Terminal-Bench 2.1

Terminal-Bench 2.1 is an updated release of the Terminal-Bench benchmark that tests AI agents' ability to operate a computer via the terminal. It evaluates how well models handle real-world, end-to-end tasks autonomously, including compiling code, training models, setting up servers, system administration, data science workflows, and security tasks.

id terminal-bench-2.1 · max 1 · 42 models reported

#ModelScore
1DeepSeek-V4.1-Flash
DeepSeek · open
0.91
2MiMo-V2.6-Pro
Xiaomi · open
0.90
3Gemini 3.8 Flash
Google
0.89
4GPT-5.6 Sol
OpenAI
0.89
5Muse Spark 1.3
Meta
0.89
6Kimi K3
Moonshot AI · open
0.88
7GLM-5.3
Zhipu AI · open
0.88
8DeepSeek-V4-Pro-0813
DeepSeek · open
0.88
9MiMo-V2.6-Flash
Xiaomi · open
0.88
10GPT-5.6 Terra
OpenAI
0.87
11Qwen3.8 Max
Alibaba Cloud / Qwen Team · open
0.87
12Gemini 3.7 Flash
Google
0.86
13Hy4 preview
Tencent · open
0.85
14GPT-5.6 Luna
OpenAI
0.85
15Claude Fable 5
Anthropic
0.84
16GLM-5.3-Flash
Zhipu AI · open
0.84
17DeepSeek-V4-Flash-Vision-Exp
DeepSeek
0.84
18Grok 4.5
xAI
0.83
19Muse Spark 1.2
Meta
0.83
20DeepSeek-V4-Flash-0731
DeepSeek · open
0.83
21GLM-5.2
Zhipu AI · open
0.83
22Muse Spark 1.1
Meta
0.80
23Atria Dawn Preview
Shanghai AI Laboratory · open
0.78
24Gemini 3.6 Flash
Google
0.78
25Qwen3.8-27B
Alibaba Cloud / Qwen Team · open
0.73
26Hy3
Tencent · open
0.72
27Seed 2.1 Pro
ByteDance
0.71
28Laguna S 2.1
Poolside · open
0.70