all the models — AI benchmark observatory
← Benchmarks

FRAMES

Factuality, Retrieval, And reasoning MEasurement Set - a unified evaluation dataset of 824 challenging multi-hop questions for testing retrieval-augmented generation systems across factuality, retrieval accuracy, and reasoning capabilities, requiring integration of 2-15 Wikipedia articles per question

id frames · max 1 · 3 models reported

#ModelScore

No scores for this benchmark yet.

FRAMES Leaderboard · all the models