Benchmark

LiveBench

LiveBench is a challenging, contamination-limited LLM benchmark that addresses test set contamination by releasing new questions monthly based on…

Modality
text
Categories
math, reasoning, general
Openness
restricted
Source
llm_stats
Reported scores
38

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Fable 5Anthropic0.78312026-06-09evidence
Claude Opus 4.5Anthropic0.75962025-11-24evidence
Claude Opus 4.6Anthropic0.76332026-02-05evidence
Claude Opus 4.7Anthropic0.76912026-04-16evidence
Claude Opus 4.8Anthropic0.77222026-05-28evidence
Claude Sonnet 4.6Anthropic0.75472026-02-17evidence
DeepSeek-V4-Pro-MaxDeepSeek0.73582026-04-23evidence
Gemini 3 FlashGoogle0.7242025-12-17evidence
Gemini 3 ProGoogle0.73392025-11-18evidence
Gemini 3.1 ProGoogle0.79932026-02-19evidence
Gemini 3.5 FlashGoogle0.75022026-05-19evidence
GLM-5.1Z.ai0.70182026-04-07evidence
GPT-5.1 HighOpenAI0.72042025-11-12evidence
GPT-5.2OpenAI0.74842025-12-11evidence
GPT-5.2 CodexOpenAI0.7432026-01-14evidence
GPT-5.3 CodexOpenAI0.72762026-02-05evidence
GPT-5.4OpenAI0.80282026-03-05evidence
GPT-5.4 nanoOpenAI0.70132026-03-17evidence
GPT-5.5OpenAI0.80712026-04-23evidence
Kimi K2 InstructMoonshot AI0.7642025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.7642025-09-05evidence
Kimi K2.5Moonshot AI0.69072026-01-27evidence
Kimi K2.6Moonshot AI0.72172026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.71892026-06-12evidence
MiniMax M3MiniMax0.70022026-06-01evidence
o1OpenAI0.672024-12-17evidence
o1-previewOpenAI0.5232024-09-12evidence
o3-miniOpenAI0.8462025-01-30evidence
Phi 4Microsoft0.4762024-12-12evidence
Qwen2.5 72B InstructQwen0.5232024-09-19evidence
Qwen2.5 7B InstructQwen0.3592024-09-19evidence
Qwen2.5-Omni-7BQwen0.2962025-03-27evidence
Qwen3 235B A22BQwen0.7712025-04-29evidence
Qwen3 30B A3BQwen0.7432025-04-29evidence
Qwen3 32BQwen0.7492025-04-29evidence
Qwen3.6 PlusQwen0.70852026-04-02evidence
Qwen3.7 MaxQwen0.74292026-05-19evidence
QwQ-32BQwen0.7312025-03-05evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.