Benchmark
DocVQA
A dataset for Visual Question Answering on document images containing 50,000 questions defined on 12,000+ document images. The benchmark tests AI's…
- Modality
- multimodal
- Categories
- multimodal, image_to_text, vision
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 28
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.5 Sonnet | Anthropic | 0.952 | 2024-10-22 | evidence |
| DeepSeek VL2 | DeepSeek | 0.933 | 2024-12-13 | evidence |
| DeepSeek VL2 Small | DeepSeek | 0.923 | 2024-12-13 | evidence |
| DeepSeek VL2 Tiny | DeepSeek | 0.889 | 2024-12-13 | evidence |
| Gemma 3 12B | 0.871 | 2025-03-12 | evidence | |
| Gemma 3 27B | 0.866 | 2025-03-12 | evidence | |
| Gemma 3 4B | 0.758 | 2025-03-12 | evidence | |
| GPT-4o | OpenAI | 0.928 | 2024-08-06 | evidence |
| Grok-1.5 | xAI | 0.856 | 2024-03-28 | evidence |
| Grok-1.5V | xAI | 0.856 | 2024-04-12 | evidence |
| Grok-2 | xAI | 0.936 | 2024-08-13 | evidence |
| Grok-2 mini | xAI | 0.932 | 2024-08-13 | evidence |
| LFM2.5-VL-3B | Liquid AI | 0.911 | 2026-08-12 | evidence |
| Llama 3.2 11B Instruct | Meta | 0.884 | 2024-09-25 | evidence |
| Llama 3.2 90B Instruct | Meta | 0.901 | 2024-09-25 | evidence |
| Llama 4 Maverick | Meta | 0.944 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.944 | 2025-04-05 | evidence |
| Mistral Small 3.2 24B Instruct | Mistral | 0.9486 | 2025-06-20 | evidence |
| North Micro Vision Instruct | Cohere | 0.921 | 2026-08-12 | evidence |
| Nova Lite | Amazon | 0.924 | 2024-11-20 | evidence |
| Nova Pro | Amazon | 0.935 | 2024-11-20 | evidence |
| Phi-4-multimodal-instruct | Microsoft | 0.932 | 2025-02-01 | evidence |
| Pixtral Large | Mistral | 0.933 | 2024-11-18 | evidence |
| Pixtral-12B | Mistral | 0.907 | 2024-09-17 | evidence |
| Qwen2.5 VL 32B Instruct | Qwen | 0.948 | 2025-02-28 | evidence |
| Qwen2.5 VL 72B Instruct | Qwen | 0.964 | 2025-01-26 | evidence |
| Qwen2.5 VL 7B Instruct | Qwen | 0.957 | 2025-01-26 | evidence |
| Qwen2.5-Omni-7B | Qwen | 0.952 | 2025-03-27 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.