Benchmark
Claw-Eval
Claw-Eval tests real-world agentic task completion across complex multi-step scenarios, evaluating a model's ability to use tools, navigate environments…
- Modality
- text
- Categories
- agents, code
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 14
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| GLM-5V-Turbo | Z.ai | 0.75 | 2026-04-02 | evidence |
| Hy3 | Tencent | 0.685 | 2026-07-06 | evidence |
| Kimi K2.6 | Moonshot AI | 0.809 | 2026-04-20 | evidence |
| LFM2.5-2.6B | Liquid AI | 0.6285 | 2026-08-04 | evidence |
| MiMo-V2-Omni | Xiaomi | 0.548 | 2026-03-18 | evidence |
| MiMo-V2-Pro | Xiaomi | 0.615 | 2026-03-18 | evidence |
| MiMo-V2.5 | Xiaomi | 0.632 | 2026-04-22 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.64 | 2026-04-27 | evidence |
| MiniMax M3 | MiniMax | 0.745 | 2026-06-01 | evidence |
| Qwen3.6 Plus | Qwen | 0.587 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.606 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.5 | 2026-04-16 | evidence |
| Qwen3.7 Max | Qwen | 0.652 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.627 | 2026-05-31 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.