Benchmarks
Sorted by newest scored model first — benches stuck on old models sink.
Terminal-Bench 2.1
28 scored · text · newest 2026-09-22
agentscodereasoning
SWE-bench Multilingual
23 scored · text · newest 2026-09-22
codereasoning
OSWorld-Verified
19 scored · multimodal · newest 2026-09-22
agentsgeneralmultimodal
CyberGym
17 scored · text · newest 2026-09-22
agentscodesafety
DeepSWE 1.1
8 scored · text · newest 2026-09-22
agentscode
BenchCAD (with Python tool)
5 scored · multimodal · newest 2026-09-22
codemultimodalreasoning
OSWorld 2.0
4 scored · multimodal · newest 2026-09-22
agentsgeneralmultimodal
SWE-Bench Pro
3 scored · text · newest 2026-09-22
agentscodereasoning
Toolathlon-Verified
3 scored · text · newest 2026-09-22
agentsreasoningtool_calling
AA-Briefcase v1.1
2 scored · text · newest 2026-09-22
agentsproductivityreasoning
GDPval-AA 2.1
2 scored · text · newest 2026-09-22
agentsgeneralreasoning
MiMo Cyber Bench
2 scored · text · newest 2026-09-22
agentscodesafety
Program Bench
2 scored · text · newest 2026-09-22
agentscode
ArXivMath
1 scored · text · newest 2026-09-22
mathreasoning
BenchCAD
1 scored · multimodal · newest 2026-09-22
codemultimodalreasoning
Chartography
1 scored · multimodal · newest 2026-09-22
multimodalreasoningvision
Global-MMLU
1 scored · text · newest 2026-09-22
generallanguagereasoning
MILU
1 scored · text · newest 2026-09-22
generallanguagereasoning
OfficeQA
1 scored · text · newest 2026-09-22
agentsgeneralreasoning
GDPval (Elo)
1 scored · text · newest 2026-09-21
agentsfinancegeneral
BrowseComp
32 scored · text · newest 2026-09-11
agentsreasoningsearch
GDPval-AA
12 scored · text · newest 2026-09-11
agentsfinancegeneral
DeepSearchQA
11 scored · text · newest 2026-09-11
agentsreasoningsearch
WideSearch
9 scored · text · newest 2026-09-11
agentsreasoningsearch
BFCL-V4
6 scored · text · newest 2026-09-11
agentstool_calling
MLE-Bench Lite
1 scored · text · newest 2026-09-11
agentscode
GPQA
250 scored · text · newest 2026-09-10
biologychemistrygeneral
Humanity's Last Exam
104 scored · multimodal · newest 2026-09-10
mathreasoningvision
CodeForces
7 scored · text · newest 2026-09-10
mathreasoning
BabyVision
3 scored · multimodal · newest 2026-09-10
multimodalreasoningvision
ARC-AGI
6 scored · image · newest 2026-09-04
reasoningspatial_reasoningvision
ExploitBench
3 scored · text · newest 2026-09-04
agentscodesafety
ScreenSpot Pro
3 scored · multimodal · newest 2026-09-04
groundingmultimodalspatial_reasoning
ARC-AGI v2
2 scored · multimodal · newest 2026-09-04
reasoningspatial_reasoningvision
SEC-bench Pro
2 scored · text · newest 2026-09-04
agentscodesafety
ARC-AGI-3
1 scored · multimodal · newest 2026-09-04
generalreasoning
FrontierMath Tier 4 (v2)
1 scored · text · newest 2026-09-04
mathreasoning
SpreadSheetBench-v1
4 scored · text · newest 2026-09-03
agentsproductivitytool_calling
CharXiv-R
17 scored · multimodal · newest 2026-09-02
multimodalreasoningvision
MRCR v2 (8-needle)
3 scored · text · newest 2026-09-02
generallong_contextreasoning
LABBench2
2 scored · text · newest 2026-09-02
agentsbiologyreasoning
LVBench
2 scored · multimodal · newest 2026-09-02
long_contextmultimodalvision
Google Real-world Vulnerability Discovery
1 scored · text · newest 2026-09-02
agentscodesafety
MRCR v2 (8-needle, 512K-1M)
1 scored · text · newest 2026-09-02
generallong_contextreasoning
CursorBench v3.2
1 scored · text · newest 2026-09-01
agentscode
MCP Atlas
21 scored · text · newest 2026-08-28
agentscodereasoning
Toolathlon
10 scored · text · newest 2026-08-28
agentsreasoningtool_calling
BankerToolBench
2 scored · text · newest 2026-08-28
agentsfinancetool_calling
DRACO
2 scored · text · newest 2026-08-28
agentsreasoningsearch
MathVision
12 scored · multimodal · newest 2026-08-26
mathmultimodalvision
RealWorldQA
10 scored · multimodal · newest 2026-08-26
spatial_reasoningvision
AndroidWorld
7 scored · multimodal · newest 2026-08-26
agentsvision
CoWorkBench
4 scored · text · newest 2026-08-26
agentsproductivityreasoning
MMLU-Pro
142 scored · text · newest 2026-08-25
financegeneralhealthcare
AIME 2025
122 scored · text · newest 2026-08-25
mathreasoning
SWE-Bench Verified
116 scored · text · newest 2026-08-25
codefrontend_developmentreasoning
HMMT25
10 scored · text · newest 2026-08-25
math
OmniDocBench 1.5
12 scored · multimodal · newest 2026-08-14
multimodalreasoningstructured_output
FrontierSWE
7 scored · text · newest 2026-08-14
agentscode
QwenSWEBench
2 scored · text · newest 2026-08-14
agentscode
DSBench-FullStack
1 scored · text · newest 2026-08-13
agentscode
Harvey LAB-AA
1 scored · text · newest 2026-08-13
agentsknowledge
WebDev Arena
1 scored · text · newest 2026-08-13
codefrontend_developmentreasoning
MMLU
103 scored · text · newest 2026-08-12
financegeneralhealthcare
MMMU-Pro
72 scored · multimodal · newest 2026-08-12
generalmultimodalreasoning
IFEval
70 scored · text · newest 2026-08-12
chatgeneralinstruction_following
DocVQA
27 scored · multimodal · newest 2026-08-12
image_to_textmultimodalvision
RefCOCO-avg
8 scored · image · newest 2026-08-12
groundingspatial_reasoningvision
AA-Briefcase
3 scored · text · newest 2026-08-12
agentsproductivityreasoning
POPE
3 scored · multimodal · newest 2026-08-12
multimodalsafetyvision
PinchBench
5 scored · text · newest 2026-08-11
agentscode
AIME 2026
19 scored · text · newest 2026-08-10
mathreasoning
Siren AgentDojo Utility
1 scored · text · newest 2026-08-10
agentssafetytool_calling
LiveCodeBench
75 scored · text · newest 2026-08-06
codegeneralreasoning
Meta Internal Coding Bench
1 scored · text · newest 2026-08-05
agentscode
Artifacts Bench
1 scored · text · newest 2026-08-04
codefrontend_development
VideoMME w sub.
8 scored · multimodal · newest 2026-08-02
multimodalvideovision
MobileWorld
2 scored · multimodal · newest 2026-08-02
agentsmultimodalvision
QwenSVG
2 scored · multimodal · newest 2026-08-02
agentscodemultimodal
AndroidBench
1 scored · multimodal · newest 2026-08-02
agentscodetool_calling
PaperBench
1 scored · text · newest 2026-08-02
agentscodereasoning
QwenReactBench
1 scored · multimodal · newest 2026-08-02
agentscodemultimodal
SkillsBench
1 scored · text · newest 2026-08-02
agentscode
AA-Omniscience Index
2 scored · text · newest 2026-07-21
knowledgereasoningscience
OmniDocBench
2 scored · multimodal · newest 2026-07-16
document_understandingmultimodalvision
DECK-Bench
1 scored · text · newest 2026-07-16
agentsproductivityreasoning
Kimi Code Bench v2
1 scored · text · newest 2026-07-16
agentscode
Capture-the-Flag Challenges (Internal)
3 scored · text · newest 2026-07-09
agentscodesafety
Connectors
3 scored · text · newest 2026-07-09
agentstool_calling
Search and Function-Calling
3 scored · text · newest 2026-07-09
agentstool_calling
DeepSWE
1 scored · text · newest 2026-07-09
agentscode
FrontierMath
1 scored · text · newest 2026-07-09
mathreasoning
IMO-AnswerBench
5 scored · text · newest 2026-07-06
mathreasoning
USAMO 2026
3 scored · text · newest 2026-07-06
mathreasoning
Terminal-Bench 2.0
8 scored · text · newest 2026-06-30
agentscodereasoning
ChartMuseum
1 scored · multimodal · newest 2026-06-30
multimodalreasoningvision
CharXiv-D
13 scored · multimodal · newest 2026-06-24
multimodalreasoningstructured_output
Video-MME
6 scored · multimodal · newest 2026-06-24
multimodalreasoningvision
MathVista
4 scored · multimodal · newest 2026-06-24
mathmultimodalvision
OSWorld
4 scored · multimodal · newest 2026-06-24
agentsgeneralmultimodal
GDPval
2 scored · text · newest 2026-06-24
agentsfinancegeneral
MathVerse
2 scored · multimodal · newest 2026-06-24
mathmultimodalreasoning
OfficeQA Pro
2 scored · text · newest 2026-06-24
agentsgeneralreasoning
Web Bench
2 scored · text · newest 2026-06-24
agentscoding
HMMT 2025
19 scored · text · newest 2026-06-16
math
HMMT Feb 26
7 scored · text · newest 2026-06-16
mathreasoning
MCP-Mark
1 scored · text · newest 2026-06-12
agentstool_calling
RULER
1 scored · text · newest 2026-06-04
long_contextreasoning
BFCL-v3
11 scored · text · newest 2026-06-02
agentsfinancegeneral
Claw-Eval
3 scored · text · newest 2026-06-01
agentscode
GDPval-Rubrics
1 scored · text · newest 2026-06-01
agentsfinancegeneral
IMO 2025
1 scored · text · newest 2026-06-01
mathreasoning
YC-Bench
1 scored · text · newest 2026-06-01
agentsfinance
MMLU-Redux
30 scored · text · newest 2026-05-31
generallanguagemath
MMMLU
16 scored · text · newest 2026-05-31
generallanguagemath
MLVU
7 scored · multimodal · newest 2026-05-31
long_contextmultimodalvideo
VideoMMMU
5 scored · multimodal · newest 2026-05-31
healthcaremultimodalreasoning
MMMU
66 scored · multimodal · newest 2026-05-20
generalhealthcaremultimodal
QwenWebBench
2 scored · multimodal · newest 2026-05-19
agentscodemultimodal
Kernel Bench L3
1 scored · text · newest 2026-05-19
agentscodesystems
