Benchmark
Arena-Hard v2
Arena-Hard-Auto v2 is a challenging benchmark consisting of 500 carefully curated prompts sourced from Chatbot Arena and WildChat-1M, designed to evaluate…
- Modality
- text
- Categories
- reasoning, general, creativity, writing
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 16
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| MiMo-V2-Flash | Xiaomi | 0.862 | 2025-12-16 | evidence |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.677 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.7388 | 2026-03-11 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.774 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.585 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.567 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.647 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.605 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.368 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.511 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.792 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.797 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.827 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.623 | 2025-09-10 | evidence |
| Sarvam-105B | Sarvam AI | 0.71 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.49 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.