Benchmark

HOLMES Benchmark

What is HOLMES?

HOLMES evaluates higher-order symbolic reasoning in language models using 1,379 natural-language problems paired with formalizations, answers, and verifiable…

Released
2026-06-22
Evaluates
Finance, Language & Knowledge, Reasoning
Openness
unknown
Importer
Claire Radar
Review status
ai-reviewed
Reported scores
0

Source provenance

HOLMES paper and code

No reported scores are on record for this benchmark yet.

Which sources cite HOLMES?

Related Finance, Language & Knowledge, Reasoning benchmarks