Benchmark

SIMMER Benchmark

What is SIMMER?

SIMMER evaluates latent failures in LLM-generated plans for kitchen-domain tasks using a curated symbolic world model with 77 actions and 262 objects, scoring…

Released
2026-06-12
Evaluates
General AI, Language & Knowledge, Planning, cs.CL
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

SIMMER paper

No reported scores are on record for this benchmark yet.

Which sources cite SIMMER?

Related General AI, Language & Knowledge, Planning, cs.CL benchmarks