Benchmark
Aider-Polyglot Edit
A challenging multi-language coding benchmark that evaluates models' code editing abilities across C++, Go, Java, JavaScript, Python, and Rust. Contains…
- Modality
- text
- Categories
- general, code
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 10
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | 0.797 | 2024-12-25 | evidence |
| Gemini 2.5 Flash | 0.567 | 2025-05-20 | evidence | |
| Gemini 2.5 Pro | 0.727 | 2025-05-20 | evidence | |
| GPT-4.1 | OpenAI | 0.529 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.316 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.062 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.449 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.182 | 2024-08-06 | evidence |
| o3-mini | OpenAI | 0.604 | 2025-01-30 | evidence |
| o4-mini | OpenAI | 0.582 | 2025-04-16 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.