Benchmark

RUT-Bench

What is RUT-Bench?

RUT-Bench evaluates LLM tool-use in realistic user interactions with 1,638 test samples across 59 executable environments, measuring success rate…

Released
2026-06-02
Evaluates
General AI, Language & Knowledge, cs.CL
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

RUT-Bench paper and code

No reported scores are on record for this benchmark yet.

Which sources cite RUT-Bench?

Related General AI, Language & Knowledge, cs.CL benchmarks