Benchmark

ODinW

Object Detection in the Wild (ODinW) benchmark for evaluating object detection models' task-level transfer ability across diverse real-world datasets in…

Modality
image
Categories
vision
Openness
unknown
Source
llm_stats
Reported scores
16

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Qwen2.5-Omni-7BQwen0.4242025-03-27evidence
Qwen3 VL 235B A22B InstructQwen0.4862025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.4322025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.4752025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.4232025-09-22evidence
Qwen3 VL 32B InstructQwen0.4662025-09-22evidence
Qwen3 VL 4B InstructQwen0.4822025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.3942025-09-22evidence
Qwen3 VL 8B InstructQwen0.4472025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.3982025-09-22evidence
Qwen3.5-122B-A10BQwen0.4452026-02-24evidence
Qwen3.5-27BQwen0.4112026-02-24evidence
Qwen3.5-35B-A3BQwen0.4262026-02-24evidence
Qwen3.6 PlusQwen0.5182026-04-02evidence
Qwen3.6-35B-A3BQwen0.5082026-04-16evidence
Qwen3.7-PlusQwen0.5112026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.