all the models — AI benchmark observatory
← Benchmarks

MCP Atlas

MCP Atlas is a benchmark for evaluating AI models on scaled tool use capabilities, measuring how well models can coordinate and utilize multiple tools across complex multi-step tasks.

id mcp-atlas · max 1 · 36 models reported

#ModelScore
1Muse Spark 1.1
Meta
0.88
2Kimi K3
Moonshot AI · open
0.84
3Seed 2.1 Pro
ByteDance
0.84
4Hy4 preview
Tencent · open
0.84
5Gemini 3.5 Flash
Google
0.84
6Claude Opus 4.8
Anthropic
0.82
7Seed 2.1 Turbo
ByteDance
0.80
8Inkling-Small
Thinking Machines Lab · open
0.80
9Hy3
Tencent · open
0.79
10Claude Opus 4.7
Anthropic
0.77
11GLM-5.2
Zhipu AI · open
0.77
12Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.76
13Inkling
Thinking Machines Lab · open
0.76
14Kimi K2.7 Code
Moonshot AI · open
0.76
15Muse Glimmer-30B
Meta · open
0.76
16GPT-5.5
OpenAI
0.75
17MiniMax M3
MiniMax · open
0.74
18Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.74
19DeepSeek-V4-Pro-Max
DeepSeek · open
0.74
20Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.73
21GLM-5.1
Zhipu AI · open
0.72