Benchmark
MultiPL-E
MultiPL-E is a scalable and extensible system for translating unit test-driven code generation benchmarks to multiple programming languages. It extends…
- Modality
- text
- Categories
- language, general
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 13
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Kimi K2 Instruct | Moonshot AI | 0.857 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.857 | 2025-09-05 | evidence |
| Qwen2 72B Instruct | Qwen | 0.692 | 2024-07-23 | evidence |
| Qwen2 7B Instruct | Qwen | 0.591 | 2024-07-23 | evidence |
| Qwen2.5 14B Instruct | Qwen | 0.728 | 2024-09-19 | evidence |
| Qwen2.5 32B Instruct | Qwen | 0.754 | 2024-09-19 | evidence |
| Qwen2.5 72B Instruct | Qwen | 0.751 | 2024-09-19 | evidence |
| Qwen2.5 7B Instruct | Qwen | 0.704 | 2024-09-19 | evidence |
| Qwen2.5-Omni-7B | Qwen | 0.658 | 2025-03-27 | evidence |
| Qwen3 235B A22B | Qwen | 0.6594 | 2025-04-29 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.861 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.879 | 2025-07-22 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.878 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.