all the models — AI benchmark observatory
← Benchmarks

AA-Briefcase v1.1

AA-Briefcase v1.1 evaluates multi-hour professional office work and reports Elo scores. Kept separate from unversioned AA-Briefcase results.

id aa-briefcase-1.1 · max 3000 · 2 models reported

#ModelScore
1Claude Opus 5.5
Anthropic
1822.00
2Grok 4.7
xAI
1657.00