all the models — AI benchmark observatory
← Benchmarks

t2-bench

t2-bench is a benchmark for evaluating agentic tool use capabilities, measuring how well models can select, sequence, and utilize tools to solve complex tasks. It tests autonomous planning and execution in multi-step scenarios.

id t2-bench · max 1 · 23 models reported

#ModelScore
1Gemini 3.1 Pro
Google
0.99
2Gemini 3 Flash
Google
0.90
3GLM-5
Zhipu AI · open
0.90
4Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.87
5Gemma 4 31B
Google · open
0.86
6Gemma 4 26B-A4B
Google · open
0.85
7Gemini 3 Pro
Google
0.85
8Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.81
9DeepSeek-V3.2
DeepSeek · open
0.80
10DeepSeek-V3.2-Speciale
DeepSeek · open
0.80
11DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.80
12Qwen3.5-4B
Alibaba Cloud / Qwen Team · open
0.80
13Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.80
14Qwen3.5-9B
Alibaba Cloud / Qwen Team · open
0.79
15Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.79
16Qwen3 Max
Alibaba Cloud / Qwen Team
0.75
17K-EXAONE-236B-A23B
LG AI Research
0.73