← Benchmarks
MCP Atlas
MCP Atlas is a benchmark for evaluating AI models on scaled tool use capabilities, measuring how well models can coordinate and utilize multiple tools across complex multi-step tasks.
id mcp-atlas · max 1 · 36 models reported
| # | Model | Score |
|---|---|---|
| 1 | Muse Spark 1.1 Meta | 0.88 |
| 2 | Kimi K3 Moonshot AI · open | 0.84 |
| 3 | Seed 2.1 Pro ByteDance | 0.84 |
| 4 | Hy4 preview Tencent · open | 0.84 |
| 5 | Gemini 3.5 Flash Google | 0.84 |
| 6 | Claude Opus 4.8 Anthropic | 0.82 |
| 7 | Seed 2.1 Turbo ByteDance | 0.80 |
| 8 | Inkling-Small Thinking Machines Lab · open | 0.80 |
| 9 | Hy3 Tencent · open | 0.79 |
| 10 | Claude Opus 4.7 Anthropic | 0.77 |
| 11 | GLM-5.2 Zhipu AI · open | 0.77 |
| 12 | Qwen3.7 Max Alibaba Cloud / Qwen Team | 0.76 |
| 13 | Inkling Thinking Machines Lab · open | 0.76 |
| 14 | Kimi K2.7 Code Moonshot AI · open | 0.76 |
| 15 | Muse Glimmer-30B Meta · open | 0.76 |
| 16 | GPT-5.5 OpenAI | 0.75 |
| 17 | MiniMax M3 MiniMax · open | 0.74 |
| 18 | Qwen3.6 Plus Alibaba Cloud / Qwen Team | 0.74 |
| 19 | DeepSeek-V4-Pro-Max DeepSeek · open | 0.74 |
| 20 | Qwen3.7-Plus Alibaba Cloud / Qwen Team | 0.73 |
| 21 | GLM-5.1 Zhipu AI · open | 0.72 |
