all the models — AI benchmark observatory
← Models

Grok-2

xAI · proprietary · grok-2

Grok-2 is a frontier language model with state-of-the-art reasoning capabilities, featuring advanced abilities in chat, coding, and reasoning. It demonstrates superior performance in visual math reasoning, document-based question answering, and excels across various academic benchmarks including reasoning, reading comprehension, math, and science.

DocVQAHumanEvalMMLUMATHMMLU-ProMMMU

Benchmark scores

BenchmarkScore
DocVQA0.94
HumanEval0.88
MMLU0.88
MATH0.76
MMLU-Pro0.76
MMMU0.66
GPQA0.56

Pricing

  • No provider pricing.

AA metrics

No Artificial Analysis link yet.

Arena Elo

  • No Arena snapshot linked.