all the models — AI benchmark observatory
← Models

Phi-4-multimodal-instruct

Microsoft · open weight · phi-4-multimodal-instruct

Phi-4-multimodal-instruct is a lightweight (5.57B parameters) open multimodal foundation model that leverages research and datasets from Phi-3.5 and 4.0. It processes text, image, and audio inputs to generate text outputs, supporting a 128K token context length. Enhanced via SFT, DPO, and RLHF for instruction following and safety.

ScienceQA ViDocVQAMMBenchPOPEMMMUMMMU-Pro

Benchmark scores

BenchmarkScore
ScienceQA Visual0.97
DocVQA0.93
MMBench0.87
POPE0.86
MMMU0.55
MMMU-Pro0.39

Pricing

  • No provider pricing.

AA metrics

No Artificial Analysis link yet.

Arena Elo

  • No Arena snapshot linked.