Benchmark
CausalDS Benchmark
What is CausalDS?
Evaluates causal reasoning in data-science workflows using synthetic scenes with hidden structural causal models, covering Pearl's three rungs and abstention…
- Released
- 2026-07-09
- Evaluates
- General AI, Language & Knowledge, Reasoning
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- unreviewed
- Reported scores
- 0
Source provenance
- Original evidence https://arxiv.org/abs/2607.08093
CausalDS paper and code
No reported scores are on record for this benchmark yet.