Benchmark

TrustDABench

What is TrustDABench?

Evaluates LLM reliability and robustness for structured data analysis using 2,340 human-verified perturbed instances derived from evidence-path perturbations…

Released
2026-08-25
Evaluates
General AI, Robustness, Safety & Trustworthiness, cs.CL
Openness
unknown
Importer
Claire Radar
Review status
rule-auto-admitted
Reported scores
0

Source provenance

TrustDABench paper and code

No reported scores are on record for this benchmark yet.

Which sources cite TrustDABench?

Related General AI, Robustness, Safety & Trustworthiness, cs.CL benchmarks