Benchmark

ERQA

Embodied Reasoning Question Answering benchmark consisting of 400 multiple-choice visual questions across spatial reasoning, trajectory reasoning, action…

Modality
multimodal
Categories
reasoning, spatial_reasoning, vision
Openness
unknown
Source
llm_stats
Reported scores
24

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
GPT-4oOpenAI0.3522024-08-06evidence
GPT-5OpenAI0.6572025-08-07evidence
Muse SparkMeta0.6472026-04-08evidence
o3OpenAI0.642025-04-16evidence
Qwen3 VL 235B A22B InstructQwen0.5132025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.5252025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.432025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.4532025-09-22evidence
Qwen3 VL 32B InstructQwen0.4882025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.5232025-09-22evidence
Qwen3 VL 4B InstructQwen0.4132025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.4732025-09-22evidence
Qwen3 VL 8B InstructQwen0.4582025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.4682025-09-22evidence
Qwen3.5-122B-A10BQwen0.622026-02-24evidence
Qwen3.5-27BQwen0.6052026-02-24evidence
Qwen3.5-35B-A3BQwen0.6482026-02-24evidence
Qwen3.6 PlusQwen0.6572026-04-02evidence
Qwen3.6-27BQwen0.6252026-04-21evidence
Qwen3.7-PlusQwen0.6982026-05-31evidence
Qwen3.8 MaxQwen0.7782026-08-02evidence
Qwen3.8-27BQwen0.6552026-08-14evidence
Seed 2.1 ProByteDance0.722026-06-24evidence
Seed 2.1 TurboByteDance0.7132026-06-24evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.