all the models — AI benchmark observatory
← Benchmarks

GSM8k

Grade School Math 8K, a dataset of 8.5K high-quality linguistically diverse grade school math word problems requiring multi-step reasoning and elementary arithmetic operations.

id gsm8k · max 1 · 48 models reported

#ModelScore
1MiMo-V2.5-Pro
Xiaomi · open
1.00
2Kimi K2 Instruct
Moonshot AI · open
0.97
3o1
OpenAI
0.97
4GPT-4.5
OpenAI
0.97
5Llama 3.1 405B Instruct
Meta · open
0.97
6Claude 3.5 Sonnet
Anthropic
0.96
7Claude 3.5 Sonnet
Anthropic
0.96
8Gemma 3 27B
Google · open
0.96
9Qwen2.5 32B Instruct
Alibaba Cloud / Qwen Team · open
0.96
10Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.96
11DeepSeek-V2.5
DeepSeek · open
0.95
12Claude 3 Opus
Anthropic
0.95
13Nova Pro
Amazon
0.95
14Qwen2.5 14B Instruct
Alibaba Cloud / Qwen Team · open
0.95
15Nova Lite
Amazon
0.94
16Gemma 3 12B
Google · open
0.94
17Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.94
18Mistral Large 2
Mistral AI · open
0.93
19Claude 3 Sonnet
Anthropic
0.92
20Nova Micro
Amazon
0.92
21Kimi K2 Base
Moonshot AI · open
0.92
22Qwen2.5 7B Instruct
Alibaba Cloud / Qwen Team · open
0.92
23Llama 3.1 Nemotron 70B Instruct
NVIDIA · open
0.91
24Qwen2 72B Instruct
Alibaba Cloud / Qwen Team · open
0.91
25Qwen2.5-Coder 32B Instruct
Alibaba Cloud / Qwen Team · open
0.91
26Gemini 1.5 Pro
Google
0.91
27Grok-1.5
xAI
0.90
28Gemma 3 4B
Google · open
0.89
29Claude 3 Haiku
Anthropic
0.89
30Phi-3.5-MoE-instruct
Microsoft · open
0.89
31Qwen2.5-Omni-7B
Alibaba Cloud / Qwen Team · open
0.89
32Phi 4 Mini
Microsoft · open
0.89