all the models — AI benchmark observatory
← Benchmarks

Tau2 Telecom

τ²-Bench telecom domain evaluates conversational agents in a dual-control environment modeled as a Dec-POMDP, where both agent and user use tools in shared telecommunications troubleshooting scenarios that test coordination and communication capabilities.

id tau2-telecom · max 1 · 36 models reported

#ModelScore
1Claude Opus 4.6
Anthropic
0.99
2LongCat-Flash-Thinking-2601
Meituan · open
0.99
3GPT-5.4
OpenAI
0.99
4GPT-5.2
OpenAI
0.99
5Claude Opus 4.5
Anthropic
0.98
6GPT-5.5
OpenAI
0.98
7Claude Sonnet 4.6
Anthropic
0.98
8MiMo-V2-Pro
Xiaomi
0.97
9GPT-5
OpenAI
0.97
10GPT-5.1
OpenAI
0.96
11GPT-5.1 Instant
OpenAI
0.96
12GPT-5.1 Thinking
OpenAI
0.96
13GPT-5.4 mini
OpenAI
0.93
14Nova 2 Pro
Amazon
0.93
15GPT-5.4 nano
OpenAI
0.93