Benchmark
IFEval
Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and…
- Released
- 2023-11-14
- Modality
- text
- Categories
- structured_output, instruction_following, general
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 67
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.7 Sonnet | Anthropic | 0.932 | 2025-02-24 | evidence |
| DeepSeek-V3 | DeepSeek | 0.861 | 2024-12-25 | evidence |
| Gemma 3 12B | 0.889 | 2025-03-12 | evidence | |
| Gemma 3 1B | 0.802 | 2025-03-12 | evidence | |
| Gemma 3 27B | 0.904 | 2025-03-12 | evidence | |
| Gemma 3 4B | 0.902 | 2025-03-12 | evidence | |
| GPT-4.1 | OpenAI | 0.874 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.841 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.745 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.882 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.81 | 2024-08-06 | evidence |
| Granite 3.3 8B Base | IBM | 0.7482 | 2025-04-16 | evidence |
| Granite 3.3 8B Instruct | IBM | 0.7482 | 2025-04-16 | evidence |
| IBM Granite 4.0 Tiny Preview | IBM | 0.63 | 2025-05-02 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.898 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.898 | 2025-09-05 | evidence |
| Kimi-k1.5 | Moonshot AI | 0.872 | 2025-01-20 | evidence |
| LFM2.5-VL-3B | Liquid AI | 0.823 | 2026-08-12 | evidence |
| Llama 3.1 405B Instruct | Meta | 0.886 | 2024-07-23 | evidence |
| Llama 3.1 70B Instruct | Meta | 0.875 | 2024-07-23 | evidence |
| Llama 3.1 8B Instruct | Meta | 0.804 | 2024-07-23 | evidence |
| Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 0.793 | 2025-03-18 | evidence |
| Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 0.8945 | 2025-04-07 | evidence |
| Llama 3.2 3B Instruct | Meta | 0.774 | 2024-09-25 | evidence |
| Llama 3.3 70B Instruct | Meta | 0.921 | 2024-12-06 | evidence |
| LongCat-Flash-Chat | Meituan | 0.8965 | 2025-08-29 | evidence |
| MiniCPM-SALA | OpenBMB | 0.7634 | 2026-02-11 | evidence |
| Mistral Small 3 24B Instruct | Mistral | 0.829 | 2025-01-30 | evidence |
| Nemotron Nano 9B v2 | NVIDIA | 0.903 | 2025-08-18 | evidence |
| North Micro Vision Instruct | Cohere | 0.749 | 2026-08-12 | evidence |
| Nova Lite | Amazon | 0.897 | 2024-11-20 | evidence |
| Nova Micro | Amazon | 0.872 | 2024-11-20 | evidence |
| Nova Pro | Amazon | 0.921 | 2024-11-20 | evidence |
| o3-mini | OpenAI | 0.939 | 2025-01-30 | evidence |
| Phi 4 | Microsoft | 0.63 | 2024-12-12 | evidence |
| Phi 4 Reasoning | Microsoft | 0.834 | 2025-04-30 | evidence |
| Phi 4 Reasoning Plus | Microsoft | 0.849 | 2025-04-30 | evidence |
| Pixtral-12B | Mistral | 0.613 | 2024-09-17 | evidence |
| Qwen2.5 72B Instruct | Qwen | 0.841 | 2024-09-19 | evidence |
| Qwen2.5 7B Instruct | Qwen | 0.712 | 2024-09-19 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.878 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.882 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.858 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.817 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.847 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.878 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.823 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.826 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.837 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.832 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.887 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.878 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.876 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.889 | 2025-09-10 | evidence |
| Qwen3.5-0.8B | Qwen | 0.44 | 2026-03-02 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.934 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.95 | 2026-02-24 | evidence |
| Qwen3.5-2B | Qwen | 0.786 | 2026-03-02 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.919 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.926 | 2026-02-16 | evidence |
| Qwen3.5-4B | Qwen | 0.898 | 2026-03-02 | evidence |
| Qwen3.5-9B | Qwen | 0.915 | 2026-03-02 | evidence |
| Qwen3.6 Plus | Qwen | 0.943 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 0.943 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.946 | 2026-05-31 | evidence |
| QwQ-32B | Qwen | 0.839 | 2025-03-05 | evidence |
| Sarvam-105B | Sarvam AI | 0.848 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.