all the models — AI benchmark observatory
← Benchmarks

AIME 2025

All 30 problems from the 2025 American Invitational Mathematics Examination (AIME I and AIME II), testing olympiad-level mathematical reasoning with integer answers from 000-999. Used as an AI benchmark to evaluate large language models' ability to solve complex mathematical problems requiring multi-step logical deductions and structured symbolic reasoning.

id aime-2025 · max 1 · 122 models reported

#ModelScore
1Gemini 3 Pro
Google
1.00
2GPT-5.2
OpenAI
1.00
3GPT-5.2 Pro
OpenAI
1.00
4Grok-4 Heavy
xAI
1.00
5Kimi K2-Thinking-0905
Moonshot AI · open
1.00
6Claude Opus 4.6
Anthropic
1.00
7Gemini 3 Flash
Google
1.00
8GPT-5.1 High
OpenAI
1.00
9LongCat-Flash-Thinking-2601
Meituan · open
1.00
10Nemotron 3 Nano (30B A3B)
NVIDIA · open
0.99
11GPT OSS 20B High
OpenAI · open
0.99
12GPT-5.1 Medium
OpenAI
0.98
13Seed 2.0 Pro
ByteDance
0.98
14Step-3.5-Flash
StepFun · open
0.97
15MAI-Thinking-1
Microsoft
0.97
16GPT-5.1 Codex High
OpenAI
0.97
17Sarvam-105B
Sarvam AI · open
0.97
18Sarvam-30B
Sarvam AI · open
0.97
19Kimi K2.5
Moonshot AI · open
0.96
20DeepSeek-V3.2-Speciale
DeepSeek · open
0.96
21GLM-4.7
Zhipu AI · open
0.96
22GPT-5
OpenAI
0.95
23GPT-5 High
OpenAI
0.95
24Seed 1.8
ByteDance
0.94
25MiMo-V2-Flash
Xiaomi · open
0.94
26GPT-5.1
OpenAI
0.94
27GPT-5.1 Instant
OpenAI
0.94
28GPT-5.1 Thinking
OpenAI
0.94
29GLM-4.6
Zhipu AI · open
0.94
30Grok-3
xAI
0.93
31DeepSeek-V3.2
DeepSeek · open
0.93
32DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.93
33Seed 2.0 Lite
ByteDance
0.93
34EXAONE 4.5 33B
LG AI Research
0.93
35K-EXAONE-236B-A23B
LG AI Research
0.93
36o4-mini
OpenAI
0.93
37GPT OSS 120B High
OpenAI · open
0.93
38Nova 2 Pro
Amazon
0.92
39Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
0.92
40Nova 2 Omni
Amazon
0.92
41Grok 4 Fast
xAI
0.92
42Grok-4
xAI
0.92
43GLM-4.7-Flash
Zhipu AI · open
0.92
44GPT-5 mini
OpenAI
0.91
45Mercury 2
Inception
0.91
46Nova 2 Lite
Amazon
0.91
47Grok-3 Mini
xAI
0.91
48LongCat-Flash-Thinking
Meituan · open
0.91
49Nemotron 3 Super (120B A12B)
NVIDIA · open
0.90
50Command A+
Cohere · open
0.90
51Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.90
52DeepSeek-V3.2-Exp
DeepSeek · open
0.89
53IBM Granite 4.2 30B
IBM · open
0.89
54GPT-5 Medium
OpenAI
0.89
55Gemini 2.5 Pro Preview 06-05
Google
0.88
56Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team · open
0.88
57Step3-VL-10B
StepFun · open
0.88
58DeepSeek-R1-0528
DeepSeek · open
0.88
59Claude Sonnet 4.5
Anthropic
0.87
60ERNIE 5.0
Baidu
0.87
61Seed 2.0 Mini
ByteDance
0.87
62IBM Granite 4.2 8B
IBM · open
0.87
63o3
OpenAI
0.86
64Mistral Medium 3.5
Mistral AI · open
0.86
65GPT-5 nano
OpenAI
0.85
66Ministral 3 (14B Reasoning 2512)
Mistral AI · open
0.85
67Mistral Small 4
Mistral AI · open
0.84
68Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.84
69Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.83
70Gemini 2.5 Pro
Google
0.83
71Qwen3 Max
Alibaba Cloud / Qwen Team
0.82
72Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.81
73GPT-5.5 Instant
OpenAI
0.81
74MiniMax M2.1
MiniMax · open
0.81
75Claude Haiku 4.5
Anthropic
0.81
76Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.80
77Ministral 3 (8B Reasoning 2512)
Mistral AI · open
0.79
78IBM Granite 4.2 3B
IBM · open
0.78
79MiniCPM-SALA
OpenBMB · open
0.78
80Claude Opus 4.1
Anthropic
0.78
81MiniMax M2
MiniMax · open
0.78
82Phi 4 Reasoning Plus
Microsoft · open
0.78
83MiniMax M1 80K
MiniMax · open
0.77
84Claude Opus 4
Anthropic
0.76
85Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.75
86MiniMax M1 40K
MiniMax · open
0.75
87Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team · open
0.74
88Qwen3 32B
Alibaba Cloud / Qwen Team · open
0.73
89Llama 3.1 Nemotron Ultra 253B v1
NVIDIA · open
0.72
90Min istral 3 (3B Reasoning 2512)
Mistral AI · open
0.72
91Nemotron Nano 9B v2
NVIDIA · open
0.72
92Gemini 2.5 Flash
Google
0.72
93Qwen3 30B A3B
Alibaba Cloud / Qwen Team · open
0.71
94Claude Sonnet 4
Anthropic
0.70
95Qwen3 14B
Alibaba Cloud / Qwen Team · open
0.70
96Qwen3-235B-A22B-Instruct-2507
Alibaba Cloud / Qwen Team · open
0.70
97Qwen3-Next-80B-A3B-Instruct
Alibaba Cloud / Qwen Team · open
0.69
98Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.69
99Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.66
100Magistral Medium
Mistral AI · open
0.65