Benchmark

AARRI-Bench

What is AARRI-Bench?

AARRI-Bench evaluates LLM agents on entry-level research intern tasks, measuring success rate in containerized environments with fixed tasks and scoring.

Released
2026-06-05
Evaluates
General AI, Language & Knowledge, cs.AI
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

AARRI-Bench paper and code

No reported scores are on record for this benchmark yet.

Which sources cite AARRI-Bench?

Related General AI, Language & Knowledge, cs.AI benchmarks