Benchmark

Multi-IF

Multi-IF benchmarks LLMs on multi-turn and multilingual instruction following. It expands upon IFEval by incorporating multi-turn sequences and…

Modality
text
Categories
reasoning, structured_output, instruction_following, language, communication
Openness
unknown
Source
llm_stats
Reported scores
23

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
GPT-4.1OpenAI0.7082025-04-14evidence
GPT-4.1 miniOpenAI0.672025-04-14evidence
GPT-4.1 nanoOpenAI0.5722025-04-14evidence
GPT-4.5OpenAI0.7082025-02-27evidence
GPT-4oOpenAI0.6092024-08-06evidence
LFM2.5-2.6BLiquid AI0.80072026-08-04evidence
LFM2.5-VL-3BLiquid AI0.5942026-08-12evidence
North Micro Vision InstructCohere0.3732026-08-12evidence
o3-miniOpenAI0.7952025-01-30evidence
Qwen3 30B A3BQwen0.7222025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.7632025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.7912025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6612025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.732025-09-22evidence
Qwen3 VL 32B InstructQwen0.722025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.782025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.7362025-09-22evidence
Qwen3 VL 8B InstructQwen0.7512025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.7512025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.7752025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.8062025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.7582025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.7782025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.