← Benchmarks
Terminal-Bench 2.1
Terminal-Bench 2.1 is an updated release of the Terminal-Bench benchmark that tests AI agents' ability to operate a computer via the terminal. It evaluates how well models handle real-world, end-to-end tasks autonomously, including compiling code, training models, setting up servers, system administration, data science workflows, and security tasks.
id terminal-bench-2.1 · max 1 · 42 models reported
| # | Model | Score |
|---|---|---|
| 1 | DeepSeek-V4.1-Flash DeepSeek · open | 0.91 |
| 2 | MiMo-V2.6-Pro Xiaomi · open | 0.90 |
| 3 | Gemini 3.8 Flash Google | 0.89 |
| 4 | GPT-5.6 Sol OpenAI | 0.89 |
| 5 | Muse Spark 1.3 Meta | 0.89 |
| 6 | Kimi K3 Moonshot AI · open | 0.88 |
| 7 | GLM-5.3 Zhipu AI · open | 0.88 |
| 8 | DeepSeek-V4-Pro-0813 DeepSeek · open | 0.88 |
| 9 | MiMo-V2.6-Flash Xiaomi · open | 0.88 |
| 10 | GPT-5.6 Terra OpenAI | 0.87 |
| 11 | Qwen3.8 Max Alibaba Cloud / Qwen Team · open | 0.87 |
| 12 | Gemini 3.7 Flash Google | 0.86 |
| 13 | Hy4 preview Tencent · open | 0.85 |
| 14 | GPT-5.6 Luna OpenAI | 0.85 |
| 15 | Claude Fable 5 Anthropic | 0.84 |
| 16 | GLM-5.3-Flash Zhipu AI · open | 0.84 |
| 17 | DeepSeek-V4-Flash-Vision-Exp DeepSeek | 0.84 |
| 18 | Grok 4.5 xAI | 0.83 |
| 19 | Muse Spark 1.2 Meta | 0.83 |
| 20 | DeepSeek-V4-Flash-0731 DeepSeek · open | 0.83 |
| 21 | GLM-5.2 Zhipu AI · open | 0.83 |
| 22 | Muse Spark 1.1 Meta | 0.80 |
| 23 | Atria Dawn Preview Shanghai AI Laboratory · open | 0.78 |
| 24 | Gemini 3.6 Flash Google | 0.78 |
| 25 | Qwen3.8-27B Alibaba Cloud / Qwen Team · open | 0.73 |
| 26 | Hy3 Tencent · open | 0.72 |
| 27 | Seed 2.1 Pro ByteDance | 0.71 |
| 28 | Laguna S 2.1 Poolside · open | 0.70 |
