all the models — AI benchmark observatory
← Benchmarks

CharXiv-D

CharXiv-D is the descriptive questions subset of the CharXiv benchmark, designed to assess multimodal large language models' ability to extract basic information from scientific charts. It contains descriptive questions covering information extraction, enumeration, pattern recognition, and counting across 2,323 diverse charts from arXiv papers, all curated and verified by human experts.

id charxiv-d · max 1 · 18 models reported

#ModelScore
1Seed 2.1 Pro
ByteDance
0.95
2Seed 2.1 Turbo
ByteDance
0.95
3Seed 2.0 Mini
ByteDance
0.92
4Qwen3 VL 32B Instruct
Alibaba Cloud / Qwen Team · open
0.91
5Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team · open
0.90
6GPT-4.5
OpenAI
0.90
7GPT-4.1 mini
OpenAI
0.88
8Command A+
Cohere · open
0.88
9GPT-4.1
OpenAI
0.88
10Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team · open
0.87
11Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team · open
0.86
12Qwen3 VL 30B A3B Instruct
Alibaba Cloud / Qwen Team · open
0.85
13GPT-4o
OpenAI
0.85