Benchmark

WritingBench

A comprehensive benchmark for evaluating large language models' generative writing capabilities across 6 core writing domains (Academic & Engineering…

Modality
text
Categories
legal, finance, communication, creativity, writing
Openness
unknown
Source
llm_stats
Reported scores
15

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Kimi K2-Thinking-0905Moonshot AI0.7382025-09-05evidence
Qwen3 VL 235B A22B InstructQwen0.8552025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8672025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.8262025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8522025-09-22evidence
Qwen3 VL 32B InstructQwen0.8292025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8622025-09-22evidence
Qwen3 VL 4B InstructQwen0.8252025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.842025-09-22evidence
Qwen3 VL 8B InstructQwen0.8312025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8552025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.8522025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.8832025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.8732025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.8462025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.