← Benchmarks
t2-bench
t2-bench is a benchmark for evaluating agentic tool use capabilities, measuring how well models can select, sequence, and utilize tools to solve complex tasks. It tests autonomous planning and execution in multi-step scenarios.
id t2-bench · max 1 · 23 models reported
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3.1 Pro Google | 0.99 |
| 2 | Gemini 3 Flash Google | 0.90 |
| 3 | GLM-5 Zhipu AI · open | 0.90 |
| 4 | Qwen3.5-397B-A17B Alibaba Cloud / Qwen Team · open | 0.87 |
| 5 | Gemma 4 31B Google · open | 0.86 |
| 6 | Gemma 4 26B-A4B Google · open | 0.85 |
| 7 | Gemini 3 Pro Google | 0.85 |
| 8 | Qwen3.5-35B-A3B Alibaba Cloud / Qwen Team · open | 0.81 |
| 9 | DeepSeek-V3.2 DeepSeek · open | 0.80 |
| 10 | DeepSeek-V3.2-Speciale DeepSeek · open | 0.80 |
| 11 | DeepSeek-V3.2 (Thinking) DeepSeek · open | 0.80 |
| 12 | Qwen3.5-4B Alibaba Cloud / Qwen Team · open | 0.80 |
| 13 | Qwen3.5-122B-A10B Alibaba Cloud / Qwen Team · open | 0.80 |
| 14 | Qwen3.5-9B Alibaba Cloud / Qwen Team · open | 0.79 |
| 15 | Qwen3.5-27B Alibaba Cloud / Qwen Team · open | 0.79 |
| 16 | Qwen3 Max Alibaba Cloud / Qwen Team | 0.75 |
| 17 | K-EXAONE-236B-A23B LG AI Research | 0.73 |
