Benchmark
OJBench
OJBench is a competition-level code benchmark designed to assess the competitive-level code reasoning abilities of large language models. It comprises 232…
- Modality
- text
- Categories
- reasoning
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 9
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Kimi K2 Instruct | Moonshot AI | 0.271 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.271 | 2025-09-05 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.487 | 2025-09-05 | evidence |
| Kimi K2.6 | Moonshot AI | 0.606 | 2026-04-20 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.325 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.297 | 2025-09-10 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.395 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.401 | 2026-02-24 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.36 | 2026-02-24 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.