Benchmark

ToxScreen Benchmark

What is ToxScreen?

A benchmark of roughly 800 backdoored LLMs across attack objectives, trigger mechanisms, poisoning rates, model scales, and training mechanisms. Evaluates…

Released
2026-07-29
Evaluates
General AI, Language & Knowledge, cs.CR
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

ToxScreen paper

No reported scores are on record for this benchmark yet.

Which sources cite ToxScreen?

Related General AI, Language & Knowledge, cs.CR benchmarks