Benchmark

IFEval

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and…

Released
2023-11-14
Modality
text
Categories
structured_output, instruction_following, general
Openness
unknown
Source
llm_stats
Reported scores
67

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.7 SonnetAnthropic0.9322025-02-24evidence
DeepSeek-V3DeepSeek0.8612024-12-25evidence
Gemma 3 12BGoogle0.8892025-03-12evidence
Gemma 3 1BGoogle0.8022025-03-12evidence
Gemma 3 27BGoogle0.9042025-03-12evidence
Gemma 3 4BGoogle0.9022025-03-12evidence
GPT-4.1OpenAI0.8742025-04-14evidence
GPT-4.1 miniOpenAI0.8412025-04-14evidence
GPT-4.1 nanoOpenAI0.7452025-04-14evidence
GPT-4.5OpenAI0.8822025-02-27evidence
GPT-4oOpenAI0.812024-08-06evidence
Granite 3.3 8B BaseIBM0.74822025-04-16evidence
Granite 3.3 8B InstructIBM0.74822025-04-16evidence
IBM Granite 4.0 Tiny PreviewIBM0.632025-05-02evidence
Kimi K2 InstructMoonshot AI0.8982025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.8982025-09-05evidence
Kimi-k1.5Moonshot AI0.8722025-01-20evidence
LFM2.5-VL-3BLiquid AI0.8232026-08-12evidence
Llama 3.1 405B InstructMeta0.8862024-07-23evidence
Llama 3.1 70B InstructMeta0.8752024-07-23evidence
Llama 3.1 8B InstructMeta0.8042024-07-23evidence
Llama 3.1 Nemotron Nano 8B V1NVIDIA0.7932025-03-18evidence
Llama 3.1 Nemotron Ultra 253B v1NVIDIA0.89452025-04-07evidence
Llama 3.2 3B InstructMeta0.7742024-09-25evidence
Llama 3.3 70B InstructMeta0.9212024-12-06evidence
LongCat-Flash-ChatMeituan0.89652025-08-29evidence
MiniCPM-SALAOpenBMB0.76342026-02-11evidence
Mistral Small 3 24B InstructMistral0.8292025-01-30evidence
Nemotron Nano 9B v2NVIDIA0.9032025-08-18evidence
North Micro Vision InstructCohere0.7492026-08-12evidence
Nova LiteAmazon0.8972024-11-20evidence
Nova MicroAmazon0.8722024-11-20evidence
Nova ProAmazon0.9212024-11-20evidence
o3-miniOpenAI0.9392025-01-30evidence
Phi 4Microsoft0.632024-12-12evidence
Phi 4 ReasoningMicrosoft0.8342025-04-30evidence
Phi 4 Reasoning PlusMicrosoft0.8492025-04-30evidence
Pixtral-12BMistral0.6132024-09-17evidence
Qwen2.5 72B InstructQwen0.8412024-09-19evidence
Qwen2.5 7B InstructQwen0.7122024-09-19evidence
Qwen3 VL 235B A22B InstructQwen0.8782025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8822025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.8582025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8172025-09-22evidence
Qwen3 VL 32B InstructQwen0.8472025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8782025-09-22evidence
Qwen3 VL 4B InstructQwen0.8232025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.8262025-09-22evidence
Qwen3 VL 8B InstructQwen0.8372025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8322025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.8872025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.8782025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.8762025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.8892025-09-10evidence
Qwen3.5-0.8BQwen0.442026-03-02evidence
Qwen3.5-122B-A10BQwen0.9342026-02-24evidence
Qwen3.5-27BQwen0.952026-02-24evidence
Qwen3.5-2BQwen0.7862026-03-02evidence
Qwen3.5-35B-A3BQwen0.9192026-02-24evidence
Qwen3.5-397B-A17BQwen0.9262026-02-16evidence
Qwen3.5-4BQwen0.8982026-03-02evidence
Qwen3.5-9BQwen0.9152026-03-02evidence
Qwen3.6 PlusQwen0.9432026-04-02evidence
Qwen3.7 MaxQwen0.9432026-05-19evidence
Qwen3.7-PlusQwen0.9462026-05-31evidence
QwQ-32BQwen0.8392025-03-05evidence
Sarvam-105BSarvam AI0.8482026-03-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.