Benchmark

OCRBench-V2 (en)

OCRBench v2 English subset: Enhanced benchmark for evaluating Large Multimodal Models on visual text localization and reasoning with English text content

Modality
multimodal
Categories
image_to_text, vision
Openness
unknown
Source
llm_stats
Reported scores
14

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
LFM2.5-VL-3BLiquid AI0.4752026-08-12evidence
North Micro Vision InstructCohere0.3672026-08-12evidence
Qwen2.5 VL 32B InstructQwen0.5722025-02-28evidence
Qwen2.5 VL 72B InstructQwen0.6152025-01-26evidence
Qwen3 VL 235B A22B InstructQwen0.6712025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6682025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6322025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.6262025-09-22evidence
Qwen3 VL 32B InstructQwen0.6742025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.6842025-09-22evidence
Qwen3 VL 4B InstructQwen0.6372025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.6182025-09-22evidence
Qwen3 VL 8B InstructQwen0.6542025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.6392025-09-22evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.