Benchmark

TrajErrBench

What is TrajErrBench?

Evaluates critical error detection in long-horizon agent trajectories using 486 annotated failed trajectories with error lifecycle labels.

Released
2026-08-06
Evaluates
Agents, General AI, Language & Knowledge
Openness
unknown
Importer
Claire Radar
Review status
ai-reviewed
Reported scores
0

Source provenance

TrajErrBench paper

No reported scores are on record for this benchmark yet.

Which sources cite TrajErrBench?

Related Agents, General AI, Language & Knowledge benchmarks