Benchmark

MultiPL-E

MultiPL-E is a scalable and extensible system for translating unit test-driven code generation benchmarks to multiple programming languages. It extends…

Modality
text
Categories
language, general
Openness
unknown
Source
llm_stats
Reported scores
13

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Kimi K2 InstructMoonshot AI0.8572025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.8572025-09-05evidence
Qwen2 72B InstructQwen0.6922024-07-23evidence
Qwen2 7B InstructQwen0.5912024-07-23evidence
Qwen2.5 14B InstructQwen0.7282024-09-19evidence
Qwen2.5 32B InstructQwen0.7542024-09-19evidence
Qwen2.5 72B InstructQwen0.7512024-09-19evidence
Qwen2.5 7B InstructQwen0.7042024-09-19evidence
Qwen2.5-Omni-7BQwen0.6582025-03-27evidence
Qwen3 235B A22BQwen0.65942025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.8612025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.8792025-07-22evidence
Qwen3-Next-80B-A3B-InstructQwen0.8782025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.