Benchmark

BFCL-v3

Berkeley Function Calling Leaderboard v3 (BFCL-v3) is an advanced benchmark that evaluates large language models' function calling capabilities through…

Modality
text
Categories
reasoning, structured_output, finance, general, agents, tool_calling
Openness
unknown
Source
llm_stats
Reported scores
19

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
GLM-4.5Z.ai0.7782025-07-28evidence
GLM-4.5-AirZ.ai0.7642025-07-28evidence
LongCat-Flash-ThinkingMeituan0.7442025-09-22evidence
MAI-Thinking-1Microsoft0.722026-06-02evidence
Qwen3 VL 235B A22B InstructQwen0.6772025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.7192025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6632025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.6862025-09-22evidence
Qwen3 VL 32B InstructQwen0.7022025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.7172025-09-22evidence
Qwen3 VL 4B InstructQwen0.6332025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.6732025-09-22evidence
Qwen3 VL 8B InstructQwen0.6632025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.632025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.7092025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.7192025-07-25evidence
Qwen3-Coder 480B A35B InstructQwen0.6872025-01-31evidence
Qwen3-Next-80B-A3B-InstructQwen0.7032025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.722025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.