Benchmark
SkillsBench
SkillsBench evaluates coding agents on self-contained programming tasks, measuring practical engineering skills across diverse software development…
- Modality
- text
- Categories
- agents, code
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 8
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Hy3 | Tencent | 0.553 | 2026-07-06 | evidence |
| Muse Glimmer-30B | Meta | 0.443 | 2026-08-10 | evidence |
| Qwen3.6 Plus | Qwen | 0.457 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.482 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.287 | 2026-04-16 | evidence |
| Qwen3.7 Max | Qwen | 0.592 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.549 | 2026-05-31 | evidence |
| Qwen3.8 Max | Qwen | 0.702 | 2026-08-02 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.