← Benchmarks
AI2D
AI2D is a dataset of 4,903 illustrative diagrams from grade school natural sciences (such as food webs, human physiology, and life cycles) with over 15,000 multiple choice questions and answers. The benchmark evaluates diagram understanding and visual reasoning capabilities, requiring models to interpret diagrammatic elements, relationships, and structure to answer questions about scientific concepts represented in visual form.
id ai2d · max 1 · 35 models reported
| # | Model | Score |
|---|---|---|
| 1 | Claude 3.5 Sonnet Anthropic | 0.95 |
| 2 | Qwen3.6 Plus Alibaba Cloud / Qwen Team | 0.94 |
| 3 | GPT-4o OpenAI | 0.94 |
| 4 | Pixtral Large Mistral AI · open | 0.94 |
| 5 | Qwen3.5-122B-A10B Alibaba Cloud / Qwen Team · open | 0.93 |
| 6 | Mistral Small 3.2 24B Instruct Mistral AI · open | 0.93 |
| 7 | Qwen3.5-27B Alibaba Cloud / Qwen Team · open | 0.93 |
| 8 | Qwen3.6-35B-A3B Alibaba Cloud / Qwen Team · open | 0.93 |
| 9 | Qwen3.5-35B-A3B Alibaba Cloud / Qwen Team · open | 0.93 |
| 10 | Llama 3.2 90B Instruct Meta · open | 0.92 |
| 11 | Llama 3.2 11B Instruct Meta · open | 0.91 |
| 12 | Qwen3 VL 235B A22B Instruct Alibaba Cloud / Qwen Team · open | 0.90 |
| 13 | Qwen3 VL 32B Instruct Alibaba Cloud / Qwen Team · open | 0.90 |
| 14 | Qwen3 VL 235B A22B Thinking Alibaba Cloud / Qwen Team · open | 0.89 |
| 15 | Seed 1.8 ByteDance | 0.89 |
| 16 | EXAONE 4.5 33B LG AI Research | 0.89 |
| 17 | Qwen3 VL 32B Thinking Alibaba Cloud / Qwen Team · open | 0.89 |
| 18 | Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team · open | 0.88 |
| 19 | Grok-1.5V xAI | 0.88 |
| 20 | Qwen3 VL 30B A3B Thinking Alibaba Cloud / Qwen Team · open | 0.87 |
| 21 | Qwen3 VL 8B Instruct Alibaba Cloud / Qwen Team · open | 0.86 |
| 22 | Qwen3 VL 30B A3B Instruct Alibaba Cloud / Qwen Team · open | 0.85 |
