all the models — AI benchmark observatory
← Benchmarks

AI2D

AI2D is a dataset of 4,903 illustrative diagrams from grade school natural sciences (such as food webs, human physiology, and life cycles) with over 15,000 multiple choice questions and answers. The benchmark evaluates diagram understanding and visual reasoning capabilities, requiring models to interpret diagrammatic elements, relationships, and structure to answer questions about scientific concepts represented in visual form.

id ai2d · max 1 · 35 models reported

#ModelScore
1Claude 3.5 Sonnet
Anthropic
0.95
2Qwen3.6 Plus
Alibaba Cloud / Qwen Team
0.94
3GPT-4o
OpenAI
0.94
4Pixtral Large
Mistral AI · open
0.94
5Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team · open
0.93
6Mistral Small 3.2 24B Instruct
Mistral AI · open
0.93
7Qwen3.5-27B
Alibaba Cloud / Qwen Team · open
0.93
8Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team · open
0.93
9Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team · open
0.93
10Llama 3.2 90B Instruct
Meta · open
0.92
11Llama 3.2 11B Instruct
Meta · open
0.91
12Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team · open
0.90
13Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.90
14Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team · open
0.89
15Seed 1.8
ByteDance
0.89
16EXAONE 4.5 33B
LG AI Research
0.89
17Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.89
18Qwen2.5 VL 72B Instruct
Alibaba Cloud / Qwen Team · open
0.88
19Grok-1.5V
xAI
0.88
20Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.87
21Qwen3 VL 8B Instruct
Alibaba Cloud / Qwen Team · open
0.86
22Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.85