Benchmark
Multi-IF
Multi-IF benchmarks LLMs on multi-turn and multilingual instruction following. It expands upon IFEval by incorporating multi-turn sequences and…
- Modality
- text
- Categories
- reasoning, structured_output, instruction_following, language, communication
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 23
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| GPT-4.1 | OpenAI | 0.708 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.67 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.572 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.708 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.609 | 2024-08-06 | evidence |
| LFM2.5-2.6B | Liquid AI | 0.8007 | 2026-08-04 | evidence |
| LFM2.5-VL-3B | Liquid AI | 0.594 | 2026-08-12 | evidence |
| North Micro Vision Instruct | Cohere | 0.373 | 2026-08-12 | evidence |
| o3-mini | OpenAI | 0.795 | 2025-01-30 | evidence |
| Qwen3 30B A3B | Qwen | 0.722 | 2025-04-29 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.763 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.791 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.661 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.73 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.72 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.78 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.736 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.751 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.751 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.775 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.806 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.758 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.778 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.