Benchmark

Global PIQA

Global PIQA is a multilingual commonsense reasoning benchmark that evaluates physical interaction knowledge across 100 languages and cultures. It tests AI…

Modality
text
Categories
physics, reasoning, general
Openness
unknown
Source
llm_stats
Reported scores
13

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemini 3 FlashGoogle0.9282025-12-17evidence
Gemini 3 ProGoogle0.9342025-11-18evidence
Qwen3.5-0.8BQwen0.5942026-03-02evidence
Qwen3.5-122B-A10BQwen0.8842026-02-24evidence
Qwen3.5-27BQwen0.8752026-02-24evidence
Qwen3.5-2BQwen0.6932026-03-02evidence
Qwen3.5-35B-A3BQwen0.8662026-02-24evidence
Qwen3.5-397B-A17BQwen0.8982026-02-16evidence
Qwen3.5-4BQwen0.7892026-03-02evidence
Qwen3.5-9BQwen0.8322026-03-02evidence
Qwen3.6 PlusQwen0.8982026-04-02evidence
Qwen3.7 MaxQwen0.9142026-05-19evidence
Qwen3.7-PlusQwen0.9032026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.