Benchmark

LiveCodeBench v6

LiveCodeBench is a holistic and contamination-free evaluation benchmark for large language models for code. It continuously collects new problems from…

Modality
text
Categories
reasoning, general
Openness
unknown
Source
llm_stats
Reported scores
56

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
DiffusionGemma 26B-A4BGoogle0.6912026-06-10evidence
Gemma 4 12BGoogle0.722026-05-23evidence
Gemma 4 26B-A4BGoogle0.7712026-04-02evidence
Gemma 4 31BGoogle0.82026-04-02evidence
Gemma 4 E2BGoogle0.442026-04-02evidence
Gemma 4 E4BGoogle0.522026-04-02evidence
GLM-4.6Z.ai0.8282025-09-30evidence
GLM-4.7Z.ai0.8492025-12-22evidence
GPT OSS 120B HighOpenAI0.8192025-08-05evidence
K-EXAONE-236B-A23BLG AI Research0.8072025-12-31evidence
Kimi K2 BaseMoonshot AI0.2632025-07-11evidence
Kimi K2 InstructMoonshot AI0.5372025-07-11evidence
Kimi K2-Thinking-0905Moonshot AI0.8312025-09-05evidence
Kimi K2.5Moonshot AI0.852026-01-27evidence
Kimi K2.6Moonshot AI0.8962026-04-20evidence
LFM2.5-2.6BLiquid AI0.59412026-08-04evidence
MAI-Thinking-1Microsoft0.8772026-06-02evidence
MiMo-V2-FlashXiaomi0.8062025-12-16evidence
MiMo-V2.5-ProXiaomi0.3962026-04-27evidence
MiniCPM-SALAOpenBMB0.522026-02-11evidence
Nemotron 3 Nano (30B A3B)NVIDIA0.6832025-12-15evidence
Nemotron 3 Ultra (550B A55B)NVIDIA0.892026-06-04evidence
North Mini Code 1.0Cohere0.7032026-06-09evidence
Qwen3 MaxQwen0.692025-12-15evidence
Qwen3 VL 235B A22B InstructQwen0.5432025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.7012025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.4262025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.6422025-09-22evidence
Qwen3 VL 32B InstructQwen0.4382025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.6562025-09-22evidence
Qwen3 VL 4B InstructQwen0.3792025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.5132025-09-22evidence
Qwen3 VL 8B InstructQwen0.3932025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.5862025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.5182025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.7412025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.5662025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.6872025-09-10evidence
Qwen3.5-122B-A10BQwen0.7892026-02-24evidence
Qwen3.5-27BQwen0.8072026-02-24evidence
Qwen3.5-35B-A3BQwen0.7462026-02-24evidence
Qwen3.5-397B-A17BQwen0.8362026-02-16evidence
Qwen3.5-4BQwen0.5582026-03-02evidence
Qwen3.5-9BQwen0.6562026-03-02evidence
Qwen3.6 PlusQwen0.8712026-04-02evidence
Qwen3.6-27BQwen0.8392026-04-21evidence
Qwen3.6-35B-A3BQwen0.8042026-04-16evidence
Qwen3.7 MaxQwen0.9162026-05-19evidence
Qwen3.7-PlusQwen0.8962026-05-31evidence
Qwen3.8-27BQwen0.9032026-08-14evidence
Sakana NamazuSakana AI0.90332026-08-03evidence
Sarvam-105BSarvam AI0.7172026-03-06evidence
Sarvam-30BSarvam AI0.72026-03-06evidence
Seed 2.0 LiteByteDance0.8172026-02-14evidence
Seed 2.0 ProByteDance0.8782026-02-14evidence
Step-3.5-FlashStepFun0.8642026-02-02evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.