Benchmark
ExtremeWhenBench
What is ExtremeWhenBench?
ExtremeWhenBench evaluates natural-language temporal grounding in hour-long videos, with 2,273 open-form queries over 194 videos. Metrics include mIoU and R@k…
- Released
- 2026-06-10
- Evaluates
- General AI, Vision & 3D, cs.CV
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- unreviewed
- Reported scores
- 0
Source provenance
- Original evidence https://arxiv.org/abs/2606.12300
ExtremeWhenBench paper and code
No reported scores are on record for this benchmark yet.