Benchmark

BIG-Bench Hard

BIG-Bench Hard (BBH) is a subset of 23 challenging BIG-Bench tasks selected because prior language model evaluations did not outperform average…

Modality
text
Categories
math, reasoning, language
Openness
unknown
Source
llm_stats
Reported scores
21

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.7372024-03-13evidence
Claude 3 OpusAnthropic0.8682024-02-29evidence
Claude 3 SonnetAnthropic0.8292024-02-29evidence
Claude 3.5 SonnetAnthropic0.9312024-06-21evidence
Claude 3.5 SonnetAnthropic0.9312024-10-22evidence
Gemini 1.5 FlashGoogle0.8552024-05-01evidence
Gemini 1.5 ProGoogle0.8922024-05-01evidence
Gemma 3 12BGoogle0.8572025-03-12evidence
Gemma 3 1BGoogle0.3912025-03-12evidence
Gemma 3 27BGoogle0.8762025-03-12evidence
Gemma 3 4BGoogle0.7222025-03-12evidence
Gemma 3n E2BGoogle0.4432025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.4432025-05-20evidence
Gemma 3n E4BGoogle0.5292025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.5292025-05-20evidence
Granite 3.3 8B BaseIBM0.69132025-04-16evidence
Granite 3.3 8B InstructIBM0.69132025-04-16evidence
IBM Granite 4.0 Tiny PreviewIBM0.5572025-05-02evidence
Phi 4 MiniMicrosoft0.7042025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.692024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.7912024-08-23evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.