all the models — AI benchmark observatory
← Models

Phi 4 Reasoning

Microsoft · open weight · phi-4-reasoning

Phi-4-reasoning is a state-of-the-art open-weight reasoning model finetuned from Phi-4 using supervised fine-tuning on a dataset of chain-of-thought traces and reinforcement learning. It focuses on math, science, and coding skills.

FlenQAHumanEval+IFEvalAIME 2024MMLU-ProArena Hard

Benchmark scores

BenchmarkScore
FlenQA0.98
HumanEval+0.93
IFEval0.83
AIME 20240.75
MMLU-Pro0.74
Arena Hard0.73
GPQA0.66
AIME 20250.63
LiveCodeBench0.54

Pricing

  • No provider pricing.

AA metrics

No Artificial Analysis link yet.

Arena Elo

  • No Arena snapshot linked.
Phi 4 Reasoning Benchmarks · all the models