Benchmark

CordisBench

What is CordisBench?

Evaluates language models on reasoning about component lifecycle changes in dynamic agent harnesses via 1,200 questions covering localization, prediction…

Released
2026-09-01
Evaluates
Agents, General AI, Language & Knowledge, Reasoning
Openness
unknown
Importer
Claire Radar
Review status
ai-reviewed
Reported scores
0

Source provenance

CordisBench paper, code and dataset

No reported scores are on record for this benchmark yet.

Which sources cite CordisBench?

Related Agents, General AI, Language & Knowledge, Reasoning benchmarks