Benchmark

Aider-Polyglot Edit

A challenging multi-language coding benchmark that evaluates models' code editing abilities across C++, Go, Java, JavaScript, Python, and Rust. Contains…

Modality
text
Categories
general, code
Openness
unknown
Source
llm_stats
Reported scores
10

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
DeepSeek-V3DeepSeek0.7972024-12-25evidence
Gemini 2.5 FlashGoogle0.5672025-05-20evidence
Gemini 2.5 ProGoogle0.7272025-05-20evidence
GPT-4.1OpenAI0.5292025-04-14evidence
GPT-4.1 miniOpenAI0.3162025-04-14evidence
GPT-4.1 nanoOpenAI0.0622025-04-14evidence
GPT-4.5OpenAI0.4492025-02-27evidence
GPT-4oOpenAI0.1822024-08-06evidence
o3-miniOpenAI0.6042025-01-30evidence
o4-miniOpenAI0.5822025-04-16evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.