Benchmark

SuperGPQA

SuperGPQA is a comprehensive benchmark that evaluates large language models across 285 graduate-level academic disciplines. The benchmark contains 25,957…

Released
2025-02-20
Modality
text
Categories
legal, math, physics, reasoning, finance, general, healthcare, chemistry, economics
Openness
restricted
Source
llm_stats
Reported scores
34

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Kimi K2 BaseMoonshot AI0.4472025-07-11evidence
Kimi K2 InstructMoonshot AI0.5722025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.5722025-09-05evidence
Qwen3 235B A22BQwen0.44062025-04-29evidence
Qwen3 MaxQwen0.6512025-12-15evidence
Qwen3 VL 235B A22B InstructQwen0.6042025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6432025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.5312025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.5642025-09-22evidence
Qwen3 VL 32B InstructQwen0.5462025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.592025-09-22evidence
Qwen3 VL 4B InstructQwen0.4032025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.4682025-09-22evidence
Qwen3 VL 8B InstructQwen0.4452025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.5122025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.6262025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.6492025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.5882025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.6082025-09-10evidence
Qwen3.5-0.8BQwen0.2132026-03-02evidence
Qwen3.5-122B-A10BQwen0.6712026-02-24evidence
Qwen3.5-27BQwen0.6562026-02-24evidence
Qwen3.5-2BQwen0.3752026-03-02evidence
Qwen3.5-35B-A3BQwen0.6342026-02-24evidence
Qwen3.5-397B-A17BQwen0.7042026-02-16evidence
Qwen3.5-4BQwen0.5292026-03-02evidence
Qwen3.5-9BQwen0.5822026-03-02evidence
Qwen3.6 PlusQwen0.7162026-04-02evidence
Qwen3.6-27BQwen0.662026-04-21evidence
Qwen3.6-35B-A3BQwen0.6472026-04-16evidence
Qwen3.7 MaxQwen0.7362026-05-19evidence
Qwen3.7-PlusQwen0.7142026-05-31evidence
Seed 2.1 ProByteDance0.7082026-06-24evidence
Seed 2.1 TurboByteDance0.6742026-06-24evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.