Benchmark

RuVerBench

What is RuVerBench?

RuVerBench evaluates LLM-as-a-judge reliability for rubric verification in agentic scenarios. It includes 2,458 instances across deep research and agentic…

Released
2026-06-29
Evaluates
General AI, Language & Knowledge, cs.CL
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

RuVerBench paper and code

No reported scores are on record for this benchmark yet.

Which sources cite RuVerBench?

Related General AI, Language & Knowledge, cs.CL benchmarks