Benchmark
Peony Benchmark
What is Peony?
Evaluates poetic logic in modern Chinese poetry through four tasks across stanza, line, and imagery levels using six mainstream LLMs.
- Released
- 2026-08-22
- Evaluates
- General AI, Language & Knowledge, cs.CL
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- ai-name-audit-deferred
- Reported scores
- 0
Source provenance
- Original evidence http://arxiv.org/abs/2608.21827v1
Peony paper
No reported scores are on record for this benchmark yet.