Benchmark
AgentJudgeBench
What is AgentJudgeBench?
LLM judges are widely used to evaluate agentic tool-calling systems, yet their reliability on structured, dependency-driven workflows remains largely…
- Released
- 2026-08-27
- Evaluates
- General AI, Language & Knowledge, cs.AI
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- rule-auto-admitted
- Reported scores
- 0
Source provenance
- Original evidence https://arxiv.org/abs/2608.26623
AgentJudgeBench paper
No reported scores are on record for this benchmark yet.