Benchmark

AgentJudgeBench

What is AgentJudgeBench?

LLM judges are widely used to evaluate agentic tool-calling systems, yet their reliability on structured, dependency-driven workflows remains largely…

Released
2026-08-27
Evaluates
General AI, Language & Knowledge, cs.AI
Openness
unknown
Importer
Claire Radar
Review status
rule-auto-admitted
Reported scores
0

Source provenance

AgentJudgeBench paper

No reported scores are on record for this benchmark yet.

Which sources cite AgentJudgeBench?

Related General AI, Language & Knowledge, cs.AI benchmarks