← Benchmarks
OpenAI-MRCR: 2 needle 128k
Multi-round Co-reference Resolution (MRCR) benchmark for evaluating an LLM's ability to distinguish between multiple needles hidden in long context. Models are given a long, multi-turn synthetic conversation and must retrieve a specific instance of a repeated request, requiring reasoning and disambiguation skills beyond simple retrieval.
id openai-mrcr:-2-needle-128k · max 1 · 9 models reported
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 OpenAI | 0.95 |
