all the models — AI benchmark observatory
← Benchmarks

OpenAI-MRCR: 2 needle 128k

Multi-round Co-reference Resolution (MRCR) benchmark for evaluating an LLM's ability to distinguish between multiple needles hidden in long context. Models are given a long, multi-turn synthetic conversation and must retrieve a specific instance of a repeated request, requiring reasoning and disambiguation skills beyond simple retrieval.

id openai-mrcr:-2-needle-128k · max 1 · 9 models reported

#ModelScore
1GPT-5
OpenAI
0.95