Benchmark

MathVista

MathVista evaluates mathematical reasoning of foundation models in visual contexts. It consists of 6,141 examples derived from 28 existing multimodal…

Released
2023-10-03
Modality
multimodal
Categories
math, multimodal, vision
Openness
open
Source
llm_stats
Reported scores
39

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.5 SonnetAnthropic0.6772024-10-22evidence
Command A+Cohere0.8062026-05-20evidence
DeepSeek VL2DeepSeek0.6282024-12-13evidence
DeepSeek VL2 SmallDeepSeek0.6072024-12-13evidence
DeepSeek VL2 TinyDeepSeek0.5362024-12-13evidence
Gemini 1.0 ProGoogle0.4662024-02-15evidence
Gemini 1.5 FlashGoogle0.6582024-05-01evidence
Gemini 1.5 Flash 8BGoogle0.5472024-03-15evidence
Gemini 1.5 ProGoogle0.6812024-05-01evidence
GPT-3.5 TurboOpenAI0.02023-03-21evidence
GPT-4.1OpenAI0.7222025-04-14evidence
GPT-4.1 miniOpenAI0.7312025-04-14evidence
GPT-4.1 nanoOpenAI0.5622025-04-14evidence
GPT-4.5OpenAI0.7232025-02-27evidence
GPT-4oOpenAI0.6382024-05-13evidence
GPT-4oOpenAI0.6142024-08-06evidence
GPT-4o miniOpenAI0.5672024-07-18evidence
Grok-1.5xAI0.5282024-03-28evidence
Grok-1.5VxAI0.5282024-04-12evidence
Grok-2xAI0.692024-08-13evidence
Grok-2 minixAI0.6812024-08-13evidence
Kimi-k1.5Moonshot AI0.7492025-01-20evidence
Llama 3.2 11B InstructMeta0.5152024-09-25evidence
Llama 3.2 90B InstructMeta0.5732024-09-25evidence
Llama 4 MaverickMeta0.7372025-04-05evidence
Llama 4 ScoutMeta0.7072025-04-05evidence
Mistral Small 3.2 24B InstructMistral0.67092025-06-20evidence
o1OpenAI0.7182024-12-17evidence
o3OpenAI0.8682025-04-16evidence
o4-miniOpenAI0.8432025-04-16evidence
Phi-3.5-vision-instructMicrosoft0.4392024-08-23evidence
Phi-4-multimodal-instructMicrosoft0.6242025-02-01evidence
Pixtral LargeMistral0.6942024-11-18evidence
Pixtral-12BMistral0.582024-09-17evidence
QvQ-72B-PreviewQwen0.7142024-12-25evidence
Qwen2.5-Omni-7BQwen0.6792025-03-27evidence
Seed 2.1 ProByteDance0.9072026-06-24evidence
Seed 2.1 TurboByteDance0.9052026-06-24evidence
Step3-VL-10BStepFun0.842026-01-15evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.