all the models — AI benchmark observatory
← Benchmarks

BFCL

The Berkeley Function Calling Leaderboard (BFCL) is the first comprehensive and executable function call evaluation dedicated to assessing Large Language Models' ability to invoke functions. It evaluates serial and parallel function calls across multiple programming languages (Python, Java, JavaScript, REST API) using a novel Abstract Syntax Tree (AST) evaluation method. The benchmark consists of over 2,000 question-function-answer pairs covering diverse application domains and complex use cases including multiple function calls, parallel function calls, and multi-turn interactions.

id bfcl · max 1 · 11 models reported

#ModelScore
1Llama 3.1 405B Instruct
Meta · open
0.89
2Llama 3.1 70B Instruct
Meta · open
0.85
3Llama 3.1 8B Instruct
Meta · open
0.76
4Nova 2 Sonic
Amazon
0.74
5Qwen3 235B A22B
Alibaba Cloud / Qwen Team · open
0.71
6Qwen3 32B
Alibaba Cloud / Qwen Team · open
0.70
7Qwen3 30B A3B
Alibaba Cloud / Qwen Team · open
0.69
8Nova Pro
Amazon
0.68
9Nova Lite
Amazon
0.67
10QwQ-32B
Alibaba Cloud / Qwen Team · open
0.66
11Nova Micro
Amazon
0.56