all the models — AI benchmark observatory
← Benchmarks

GPQA

A challenging dataset of 448 multiple-choice questions written by domain experts in biology, physics, and chemistry. Questions are Google-proof and extremely difficult, with PhD experts reaching 65% accuracy.

id gpqa · max 1 · 250 models reported

#ModelScore
1GPT-6 Astra
OpenAI
0.96
2Claude Mythos Preview
Anthropic
0.95
3GPT-5.6 Sol
OpenAI
0.95
4Gemini 3.1 Pro
Google
0.94
5Claude Opus 4.7
Anthropic
0.94
6Claude Opus 4.8
Anthropic
0.94
7GPT-5.5
OpenAI
0.94
8Kimi K3
Moonshot AI · open
0.94
9GPT-5.2 Pro
OpenAI
0.93
10Grok 4.5
xAI
0.93
11GPT-5.6 Terra
OpenAI
0.93
12GPT-5.4
OpenAI
0.93
13Qwen3.8 Max
Alibaba Cloud / Qwen Team · open
0.93
14GPT-5.2
OpenAI
0.92
15Qwen3.7 Max
Alibaba Cloud / Qwen Team
0.92
16GPT-5.6 Luna
OpenAI
0.92
17Hy4 preview
Tencent · open
0.92
18Gemini 3 Pro
Google
0.92
19Qwen3.8 Flash
Alibaba Cloud / Qwen Team
0.92
20Qwen3.8-Flash-Next
Alibaba Cloud / Qwen Team · open
0.92
21Claude Opus 4.6
Anthropic
0.91
22GLM-5.2
Zhipu AI · open
0.91
23DeepSeek-V4.1-Flash
DeepSeek · open
0.91
24Kimi K2.6
Moonshot AI · open
0.91
25Gemini 3 Flash
Google
0.90
26Hy3
Tencent · open
0.90
27Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.90
28Qwen3.7-Plus
Alibaba Cloud / Qwen Team
0.90
29DeepSeek-V4-Pro-Max
DeepSeek · open
0.90
30Claude Sonnet 4.6
Anthropic
0.90
31Inkling-Small
Thinking Machines Lab · open
0.90
32Muse Spark
Meta
0.90
33Qwen3.8-27B
Alibaba Cloud / Qwen Team · open
0.89
34Solar Pro 4
Upstage
0.89
35Seed 2.0 Pro
ByteDance
0.89
36Grok-4 Heavy
xAI
0.88
37Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team · open
0.88
38DeepSeek-V4-Flash-Max
DeepSeek · open
0.88
39GPT-5 Medium
OpenAI
0.88
40GPT-5.1
OpenAI
0.88
41GPT-5.1 High
OpenAI
0.88
42GPT-5.1 Instant
OpenAI
0.88
43GPT-5.1 Thinking
OpenAI
0.88
44GPT-5.4 mini
OpenAI
0.88
45Qwen3.6-27B
Alibaba Cloud / Qwen Team · open
0.88
46Kimi K2.5
Moonshot AI · open
0.88
47Grok-4
xAI
0.88
48DeepSeek-V4-Flash-0423
DeepSeek · open
0.87
49Qwen3 Max Thinking
Alibaba Cloud / Qwen Team
0.87
50GPT-5 High
OpenAI
0.87
51Claude Opus 4.5
Anthropic
0.87
52Nemotron 3 Ultra (550B A55B)
NVIDIA · open
0.87
53Gemini 3.1 Flash-Lite
Google
0.87
54Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.87
55Gemini 2.5 Pro Preview 06-05
Google
0.86
56GLM-5.1
Zhipu AI · open
0.86
57Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.86
58GLM-4.7
Zhipu AI · open
0.86
59GPT-5
OpenAI
0.86
60Grok 4 Fast
xAI
0.86
61GPT-5.5 Instant
OpenAI
0.86
62Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.85
63Seed 2.0 Lite
ByteDance
0.85
64ERNIE 5.0
Baidu
0.85
65Claude 3.7 Sonnet
Anthropic
0.85
66Grok-3
xAI
0.85
67MAI-Code-1-Flash
Microsoft
0.85
68Kimi K2-Thinking-0905
Moonshot AI · open
0.84
69Gemma 4 31B
Google · open
0.84
70MAI-Thinking-1
Microsoft
0.84
71Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.84
72ChatGPT-4o Latest
OpenAI
0.84
73Grok-3 Mini
xAI
0.84
74MiMo-V2-Flash
Xiaomi · open
0.84
75Muse Glimmer-30B
Meta · open
0.83
76Claude Sonnet 4.5
Anthropic
0.83
77o3
OpenAI
0.83
78Gemini 2.5 Pro
Google
0.83
79Gemini 2.5 Flash
Google
0.83
80GPT-5.4 nano
OpenAI
0.83
81Nemotron 3 Super (120B A12B)
NVIDIA · open
0.83
82DeepSeek-V3.2
DeepSeek · open
0.82
83DeepSeek-V3.2 (Thinking)
DeepSeek · open
0.82
84Gemma 4 26B-A4B
Google · open
0.82
85GPT-5 mini
OpenAI
0.82
86Qwen3.5-9B
Alibaba Cloud / Qwen Team · open
0.82
87LongCat-Flash-Thinking
Meituan · open
0.81
88Nova 2 Pro
Amazon
0.81
89o4-mini
OpenAI
0.81
90Qwen3-235B-A22B-Thinking-2507
Alibaba Cloud / Qwen Team · open
0.81
91DeepSeek-R1-0528
DeepSeek · open
0.81
92GLM-4.6
Zhipu AI · open
0.81
93MiniMax M2.1
MiniMax · open
0.81
94Claude Opus 4.1
Anthropic
0.81
95GPT OSS 120B High
OpenAI · open
0.81
96EXAONE 4.5 33B
LG AI Research
0.81
97LongCat-Flash-Thinking-2601
Meituan · open
0.81
98GPT OSS 120B
OpenAI · open
0.80
99DeepSeek-V3.2-Exp
DeepSeek · open
0.80
100Claude Opus 4
Anthropic
0.80