Benchmark
GPQA Diamond
198 questions in the Diamond split, so run-to-run variance is wide and a single reported number hides it. Approaching saturation at the 2026 frontier…
- Released
- 2023-11-20
- Categories
- science
- Openness
- unknown
- Source
- model_reports
- Reported scores
- 21
Reported scores
model_reports
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4 Opus | Anthropic | 79.6 | 2025-06-17 | evidence |
| Claude 4 Sonnet | Anthropic | 75.4 | 2025-06-17 | evidence |
| Claude Opus 4 | Anthropic | 79.6 | 2025-05-22 | evidence |
| Claude Sonnet 4 | Anthropic | 75.4 | 2025-05-22 | evidence |
| DeepSeek-R1 | DeepSeek | 71.5 | 2025-01-22 | evidence |
| DeepSeek-V3 | DeepSeek | 59.1 | 2024-12-27 | evidence |
| DeepSeek-V4-Flash | DeepSeek | 88.1 | 2026-06-25 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 72.9 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 89.1 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 90.1 | 2026-04-22 | evidence |
| Gemini 2.5 Pro | 86.4 | 2025-06-17 | evidence | |
| Gemini 3.1 Pro | 94.3 | 2026-02-19 | evidence | |
| Gemma 4 (31B) | 84.3 | 2026-03-11 | evidence | |
| GLM-5 | Z.ai | 86.0 | 2026-02-11 | evidence |
| GLM-5.1 | Z.ai | 86.2 | 2026-04-03 | evidence |
| GLM-5.2 | Z.ai | 91.2 | 2026-06-16 | evidence |
| Grok 3 Beta Extended Thinking | xAI | 80.2 | 2025-06-17 | evidence |
| Hy4 preview | Tencent | 92.3 | 2026-08-28 | evidence |
| Kimi K3 | Moonshot AI | 93.5 | 2026-06-13 | evidence |
| o3 high | OpenAI | 83.3 | 2025-06-17 | evidence |
| Qwen3-235B-A22B (Thinking) | Qwen | 71.1 | 2025-05-14 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.