← Benchmarks
GSM8k
Grade School Math 8K, a dataset of 8.5K high-quality linguistically diverse grade school math word problems requiring multi-step reasoning and elementary arithmetic operations.
id gsm8k · max 1 · 48 models reported
| # | Model | Score |
|---|---|---|
| 1 | MiMo-V2.5-Pro Xiaomi · open | 1.00 |
| 2 | Kimi K2 Instruct Moonshot AI · open | 0.97 |
| 3 | o1 OpenAI | 0.97 |
| 4 | GPT-4.5 OpenAI | 0.97 |
| 5 | Llama 3.1 405B Instruct Meta · open | 0.97 |
| 6 | Claude 3.5 Sonnet Anthropic | 0.96 |
| 7 | Claude 3.5 Sonnet Anthropic | 0.96 |
| 8 | Gemma 3 27B Google · open | 0.96 |
| 9 | Qwen2.5 32B Instruct Alibaba Cloud / Qwen Team · open | 0.96 |
| 10 | Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team · open | 0.96 |
| 11 | DeepSeek-V2.5 DeepSeek · open | 0.95 |
| 12 | Claude 3 Opus Anthropic | 0.95 |
| 13 | Nova Pro Amazon | 0.95 |
| 14 | Qwen2.5 14B Instruct Alibaba Cloud / Qwen Team · open | 0.95 |
| 15 | Nova Lite Amazon | 0.94 |
| 16 | Gemma 3 12B Google · open | 0.94 |
| 17 | Qwen3 235B A22B Alibaba Cloud / Qwen Team · open | 0.94 |
| 18 | Mistral Large 2 Mistral AI · open | 0.93 |
| 19 | Claude 3 Sonnet Anthropic | 0.92 |
| 20 | Nova Micro Amazon | 0.92 |
| 21 | Kimi K2 Base Moonshot AI · open | 0.92 |
| 22 | Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team · open | 0.92 |
| 23 | Llama 3.1 Nemotron 70B Instruct NVIDIA · open | 0.91 |
| 24 | Qwen2 72B Instruct Alibaba Cloud / Qwen Team · open | 0.91 |
| 25 | Qwen2.5-Coder 32B Instruct Alibaba Cloud / Qwen Team · open | 0.91 |
| 26 | Gemini 1.5 Pro Google | 0.91 |
| 27 | Grok-1.5 xAI | 0.90 |
| 28 | Gemma 3 4B Google · open | 0.89 |
| 29 | Claude 3 Haiku Anthropic | 0.89 |
| 30 | Phi-3.5-MoE-instruct Microsoft · open | 0.89 |
| 31 | Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team · open | 0.89 |
| 32 | Phi 4 Mini Microsoft · open | 0.89 |
