all the models — AI benchmark observatory
← Benchmarks

MATH

MATH dataset contains 12,500 challenging competition mathematics problems from AMC 10, AMC 12, AIME, and other mathematics competitions. Each problem includes full step-by-step solutions and spans multiple difficulty levels (1-5) across seven mathematical subjects including Prealgebra, Algebra, Number Theory, Counting and Probability, Geometry, Intermediate Algebra, and Precalculus.

id math · max 1 · 71 models reported

#ModelScore
1o3-mini
OpenAI
0.98
2o1
OpenAI
0.96
3MiniStral 3 (14B Instruct 2512)
Mistral AI · open
0.90
4Mistral Large 3
Mistral AI · open
0.90
5Gemini 2.0 Flash
Google
0.90
6Kimi K2 0905
Moonshot AI
0.89
7Gemma 3 27B
Google · open
0.89
8Ministral 3 (8B Instruct 2512)
Mistral AI · open
0.88
9Gemini 2.0 Flash-Lite
Google
0.87
10Gemini 1.5 Pro
Google
0.86
11MiMo-V2.5-Pro
Xiaomi · open
0.86
12o1-preview
OpenAI
0.85
13GPT-5
OpenAI
0.85
14Gemma 3 12B
Google · open
0.84
15Qwen2.5 32B Instruct
Alibaba Cloud / Qwen Team · open
0.83
16Qwen2.5 72B Instruct
Alibaba Cloud / Qwen Team · open
0.83
17Ministral 3 (3B Instruct 2512)
Mistral AI · open
0.83
18Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.82
19Phi 4
Microsoft · open
0.80
20Qwen2.5 14B Instruct
Alibaba Cloud / Qwen Team · open
0.80
21Claude 3.5 Sonnet
Anthropic
0.78
22Gemini 1.5 Flash
Google
0.78
23Llama 3.3 70B Instruct
Meta · open
0.77
24GPT-4o
OpenAI
0.77
25Nova Pro
Amazon
0.77
26Grok-2
xAI
0.76
27Gemma 3 4B
Google · open
0.76
28Qwen2.5 7B Instruct
Alibaba Cloud / Qwen Team · open
0.76
29DeepSeek-V2.5
DeepSeek · open
0.75
30Llama 3.1 405B Instruct
Meta · open
0.74
31Nova Lite
Amazon
0.73
32Grok-2 mini
xAI
0.73
33GPT-4 Turbo
OpenAI
0.73
34Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.72
35Qwen2.5-Omni-7B
Alibaba Cloud / Qwen Team · open
0.71
36Claude 3.5 Sonnet
Anthropic
0.71
37Mistral Small 3 24B Instruct
Mistral AI · open
0.71
38GPT-4o mini
OpenAI
0.70
39Kimi K2 Base
Moonshot AI · open
0.70
40Mistral Small 3.2 24B Instruct
Mistral AI · open
0.69
41Claude 3.5 Haiku
Anthropic
0.69
42Mistral Small 3.1 24B Instruct
Mistral AI · open
0.69
43Nova Micro
Amazon
0.69
44Llama 3.2 90B Instruct
Meta · open
0.68
45Phi 4 Mini
Microsoft · open
0.64
46Llama 4 Maverick
Meta · open
0.61
47Claude 3 Opus
Anthropic
0.60
48Qwen2 72B Instruct
Alibaba Cloud / Qwen Team · open
0.60
49Phi-3.5-MoE-instruct
Microsoft · open
0.59
50Gemini 1.5 Flash 8B
Google
0.59
51Qwen2.5-Coder 32B Instruct
Alibaba Cloud / Qwen Team · open
0.57
52Ministral 8B Instruct
Mistral AI · open
0.55
53Llama 3.2 11B Instruct
Meta · open
0.52
54Grok-1.5
xAI
0.51
55Llama 4 Scout
Meta · open
0.50
56Qwen2 7B Instruct
Alibaba Cloud / Qwen Team · open
0.50
57Phi-3.5-mini-instruct
Microsoft · open
0.48
58Pixtral-12B
Mistral AI · open
0.48
59Gemma 3 1B
Google · open
0.48
60Llama 3.2 3B Instruct
Meta · open
0.48
61Qwen2.5-Coder 7B Instruct
Alibaba Cloud / Qwen Team · open
0.47
62Mistral Small 3 24B Base
Mistral AI · open
0.46
63Claude 3 Sonnet
Anthropic
0.43
64GPT-3.5 Turbo
OpenAI
0.43
65Gemma 2 27B
Google · open
0.42
66GPT-4
OpenAI
0.42
67Claude 3 Haiku
Anthropic
0.39
68Gemma 2 9B
Google · open
0.37
69Gemini 1.0 Pro
Google
0.33
70Hermes 3 70B
Nous Research · open
0.21
71ERNIE 4.5
Baidu
0.12