Benchmark
SuperGPQA
SuperGPQA is a comprehensive benchmark that evaluates large language models across 285 graduate-level academic disciplines. The benchmark contains 25,957…
- Released
- 2025-02-20
- Modality
- text
- Categories
- legal, math, physics, reasoning, finance, general, healthcare, chemistry, economics
- Openness
- restricted
- Source
- llm_stats
- Reported scores
- 34
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Kimi K2 Base | Moonshot AI | 0.447 | 2025-07-11 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.572 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.572 | 2025-09-05 | evidence |
| Qwen3 235B A22B | Qwen | 0.4406 | 2025-04-29 | evidence |
| Qwen3 Max | Qwen | 0.651 | 2025-12-15 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.604 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.643 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.531 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.564 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.546 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.59 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.403 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.468 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.445 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.512 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.626 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.649 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.588 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.608 | 2025-09-10 | evidence |
| Qwen3.5-0.8B | Qwen | 0.213 | 2026-03-02 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.671 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.656 | 2026-02-24 | evidence |
| Qwen3.5-2B | Qwen | 0.375 | 2026-03-02 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.634 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.704 | 2026-02-16 | evidence |
| Qwen3.5-4B | Qwen | 0.529 | 2026-03-02 | evidence |
| Qwen3.5-9B | Qwen | 0.582 | 2026-03-02 | evidence |
| Qwen3.6 Plus | Qwen | 0.716 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.66 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.647 | 2026-04-16 | evidence |
| Qwen3.7 Max | Qwen | 0.736 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.714 | 2026-05-31 | evidence |
| Seed 2.1 Pro | ByteDance | 0.708 | 2026-06-24 | evidence |
| Seed 2.1 Turbo | ByteDance | 0.674 | 2026-06-24 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.