all the models — AI benchmark observatory
← Benchmarks

AIME 2024

American Invitational Mathematics Examination 2024, consisting of 30 challenging mathematical reasoning problems from AIME I and AIME II competitions. Each problem requires an integer answer between 0-999 and tests advanced mathematical reasoning across algebra, geometry, combinatorics, and number theory. Used as a benchmark for evaluating mathematical reasoning capabilities in large language models at Olympiad-level difficulty.

id aime-2024 · max 1 · 54 models reported

#ModelScore
1Grok-3 Mini
xAI
0.96
2o4-mini
OpenAI
0.93
3Grok-3
xAI
0.93
4LongCat-Flash-Thinking
Meituan · open
0.93
5Gemini 2.5 Pro
Google
0.92
6o3
OpenAI
0.92
7DeepSeek-R1-0528
DeepSeek · open
0.91
8GLM-4.5
Zhipu AI · open
0.91
9Ministral 3 (14B Reasoning 2512)
Mistral AI · open
0.90
10GLM-4.5-Air
Zhipu AI · open
0.89
11Gemini 2.5 Flash
Google
0.88
12o3-mini
OpenAI
0.87
13DeepSeek R1 Distill Llama 70B
DeepSeek · open
0.87
14DeepSeek R1 Zero
DeepSeek · open
0.87
15MiniMax M1 80K
MiniMax · open
0.86
16Ministral 3 (8B Reasoning 2512)
Mistral AI · open
0.86
17o1-pro
OpenAI
0.86
18Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.86
19MiniCPM-SALA
OpenBMB · open
0.84
20DeepSeek R1 Distill Qwen 32B
DeepSeek · open
0.83
21DeepSeek R1 Distill Qwen 7B
DeepSeek · open
0.83
22MiniMax M1 40K
MiniMax · open
0.83
23Qwen3 32B
Alibaba Cloud / Qwen Team · open
0.81
24Phi 4 Reasoning Plus
Microsoft · open
0.81
25Granite 3.3 8B Base
IBM · open
0.81
26Granite 3.3 8B Instruct
IBM · open
0.81
27Qwen3 30B A3B
Alibaba Cloud / Qwen Team · open
0.80
28Claude 3.7 Sonnet
Anthropic
0.80
29DeepSeek R1 Distill Llama 8B
DeepSeek · open
0.80
30DeepSeek R1 Distill Qwen 14B
DeepSeek · open
0.80
31QwQ-32B
Alibaba Cloud / Qwen Team · open
0.80
32Qwen3 14B
Alibaba Cloud / Qwen Team · open
0.79
33Kimi-k1.5
Moonshot AI
0.78
34Min istral 3 (3B Reasoning 2512)
Mistral AI · open
0.78
35Phi 4 Reasoning
Microsoft · open
0.75
36o1
OpenAI
0.74
37Magistral Medium
Mistral AI · open
0.74
38Gemini 2.0 Flash Thinking
Google
0.73
39LongCat-Flash-Lite
Meituan · open
0.72
40Kimi K2 0905
Moonshot AI
0.72
41Magistral Small 2506
Mistral AI · open
0.71
42Kimi K2 Instruct
Moonshot AI · open
0.70
43Kimi K2-Instruct-0905
Moonshot AI · open
0.70
44DeepSeek-V3.1
DeepSeek · open
0.66
45DeepSeek-V3 0324
DeepSeek · open
0.59
46DeepSeek R1 Distill Qwen 1.5B
DeepSeek · open
0.53
47QwQ-32B-Preview
Alibaba Cloud / Qwen Team · open
0.50
48GPT-4.1 mini
OpenAI
0.50
49GPT-4.1
OpenAI
0.48
50o1-preview
OpenAI
0.42
51DeepSeek-V3
DeepSeek · open
0.39
52GPT-4.5
OpenAI
0.37
53GPT-4.1 nano
OpenAI
0.29
54GPT-4o
OpenAI
0.13