Benchmark

HumanEval

A benchmark that measures functional correctness for synthesizing programs from docstrings, consisting of 164 original programming problems assessing…

Released
2021-07-08
Modality
text
Categories
reasoning, code
Openness
unknown
Source
llm_stats
Reported scores
66

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.7592024-03-13evidence
Claude 3 OpusAnthropic0.8492024-02-29evidence
Claude 3 SonnetAnthropic0.732024-02-29evidence
Claude 3.5 HaikuAnthropic0.8812024-10-22evidence
Claude 3.5 SonnetAnthropic0.922024-06-21evidence
Claude 3.5 SonnetAnthropic0.9372024-10-22evidence
Codestral-22BMistral0.8112024-05-29evidence
DeepSeek-V2.5DeepSeek0.892024-05-08evidence
Gemini 1.5 FlashGoogle0.7432024-05-01evidence
Gemini 1.5 ProGoogle0.8412024-05-01evidence
Gemini DiffusionGoogle0.8962025-05-20evidence
Gemma 2 27BGoogle0.5182024-06-27evidence
Gemma 2 9BGoogle0.4022024-06-27evidence
Gemma 3 12BGoogle0.8542025-03-12evidence
Gemma 3 1BGoogle0.4152025-03-12evidence
Gemma 3 27BGoogle0.8782025-03-12evidence
Gemma 3 4BGoogle0.7132025-03-12evidence
Gemma 3n E2B InstructedGoogle0.6652025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.6652025-05-20evidence
Gemma 3n E4B InstructedGoogle0.752025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.752025-05-20evidence
GPT-3.5 TurboOpenAI0.682023-03-21evidence
GPT-4OpenAI0.672023-06-13evidence
GPT-4 TurboOpenAI0.8712024-04-09evidence
GPT-4.5OpenAI0.882025-02-27evidence
GPT-4oOpenAI0.9022024-05-13evidence
GPT-4o miniOpenAI0.8722024-07-18evidence
GPT-5OpenAI0.9342025-08-07evidence
Granite 3.3 8B BaseIBM0.89732025-04-16evidence
Granite 3.3 8B InstructIBM0.89732025-04-16evidence
Grok-1.5xAI0.7412024-03-28evidence
Grok-2xAI0.8842024-08-13evidence
Grok-2 minixAI0.8572024-08-13evidence
IBM Granite 4.0 Tiny PreviewIBM0.8242025-05-02evidence
Kimi K2 0905Moonshot AI0.9452025-09-05evidence
Kimi K2 InstructMoonshot AI0.9332025-07-11evidence
Llama 3.1 405B InstructMeta0.892024-07-23evidence
Llama 3.1 70B InstructMeta0.8052024-07-23evidence
Llama 3.1 8B InstructMeta0.7262024-07-23evidence
Llama 3.3 70B InstructMeta0.8842024-12-06evidence
LongCat-Flash-ChatMeituan0.88412025-08-29evidence
MiniCPM-SALAOpenBMB0.95122026-02-11evidence
Ministral 8B InstructMistral0.3482024-10-16evidence
Mistral Large 2Mistral0.922024-07-24evidence
Mistral Small 3 24B InstructMistral0.8482025-01-30evidence
Mistral Small 3.1 24B InstructMistral0.88412025-03-17evidence
Nova LiteAmazon0.8542024-11-20evidence
Nova MicroAmazon0.8112024-11-20evidence
Nova ProAmazon0.892024-11-20evidence
o1OpenAI0.8812024-12-17evidence
o1-miniOpenAI0.9242024-09-12evidence
Phi 4Microsoft0.8262024-12-12evidence
Phi-3.5-mini-instructMicrosoft0.6282024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.7072024-08-23evidence
Pixtral-12BMistral0.722024-09-17evidence
Qwen2 72B InstructQwen0.862024-07-23evidence
Qwen2 7B InstructQwen0.7992024-07-23evidence
Qwen2.5 14B InstructQwen0.8352024-09-19evidence
Qwen2.5 32B InstructQwen0.8842024-09-19evidence
Qwen2.5 72B InstructQwen0.8662024-09-19evidence
Qwen2.5 7B InstructQwen0.8482024-09-19evidence
Qwen2.5 VL 32B InstructQwen0.9152025-02-28evidence
Qwen2.5-Coder 32B InstructQwen0.9272024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.8842024-09-19evidence
Qwen2.5-Omni-7BQwen0.7872025-03-27evidence
Sarvam-30BSarvam AI0.9212026-03-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.