Benchmark
BFCL-v3
Berkeley Function Calling Leaderboard v3 (BFCL-v3) is an advanced benchmark that evaluates large language models' function calling capabilities through…
- Modality
- text
- Categories
- reasoning, structured_output, finance, general, agents, tool_calling
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 19
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| GLM-4.5 | Z.ai | 0.778 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.764 | 2025-07-28 | evidence |
| LongCat-Flash-Thinking | Meituan | 0.744 | 2025-09-22 | evidence |
| MAI-Thinking-1 | Microsoft | 0.72 | 2026-06-02 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.677 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.719 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.663 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.686 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.702 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.717 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.633 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.673 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.663 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.63 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.709 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.719 | 2025-07-25 | evidence |
| Qwen3-Coder 480B A35B Instruct | Qwen | 0.687 | 2025-01-31 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.703 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.72 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.