Benchmark

OCRBench-V2 (zh)

OCRBench v2 Chinese subset: Enhanced benchmark for evaluating Large Multimodal Models on visual text localization and reasoning with Chinese text content

Modality
multimodal
Categories
image_to_text, vision
Openness
unknown
Source
llm_stats
Reported scores
11

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Qwen2.5 VL 32B InstructQwen0.5912025-02-28evidence
Qwen3 VL 235B A22B InstructQwen0.6182025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6352025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.5782025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.6042025-09-22evidence
Qwen3 VL 32B InstructQwen0.5922025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.6212025-09-22evidence
Qwen3 VL 4B InstructQwen0.5762025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.5582025-09-22evidence
Qwen3 VL 8B InstructQwen0.6122025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.5922025-09-22evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.