Benchmark
TrajErrBench
What is TrajErrBench?
Evaluates critical error detection in long-horizon agent trajectories using 486 annotated failed trajectories with error lifecycle labels.
- Released
- 2026-08-06
- Evaluates
- Agents, General AI, Language & Knowledge
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- ai-reviewed
- Reported scores
- 0
Source provenance
- Original evidence https://arxiv.org/abs/2608.06346
TrajErrBench paper
No reported scores are on record for this benchmark yet.