Benchmark

TUA-Bench

What is TUA-Bench?

Evaluates terminal-use agents on 120 real-world tasks across five families (document editing, email, web info, scientific/engineering workflows) using…

Released
2026-06-26
Evaluates
Code & Software, General AI, cs.SE
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

TUA-Bench paper and code

No reported scores are on record for this benchmark yet.

Which sources cite TUA-Bench?

Related Code & Software, General AI, cs.SE benchmarks