Benchmark

Winogrande

WinoGrande: An Adversarial Winograd Schema Challenge at Scale. A large-scale dataset of 44,000 pronoun resolution problems designed to test machine…

Released
2019-11-21
Modality
text
Categories
reasoning, language
Openness
unknown
Source
llm_stats
Reported scores
22

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Command R+Cohere0.8542024-08-30evidence
ERNIE 4.5Baidu0.5132025-06-25evidence
Gemma 2 27BGoogle0.8372024-06-27evidence
Gemma 2 9BGoogle0.8062024-06-27evidence
Gemma 3n E2BGoogle0.6682025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.6682025-05-20evidence
Gemma 3n E4BGoogle0.7172025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.7172025-05-20evidence
GPT-4OpenAI0.8752023-06-13evidence
Granite 3.3 8B BaseIBM0.7442025-04-16evidence
Hermes 3 70BNous Research0.83192024-08-15evidence
Llama 3.1 Nemotron 70B InstructNVIDIA0.84532024-10-01evidence
MiMo-V2.5-ProXiaomi0.8562026-04-27evidence
Ministral 8B InstructMistral0.7532024-10-16evidence
Mistral NeMo InstructMistral0.7682024-07-18evidence
Phi 4 MiniMicrosoft0.672025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.6852024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.8132024-08-23evidence
Qwen2 72B InstructQwen0.8512024-07-23evidence
Qwen2.5 32B InstructQwen0.822024-09-19evidence
Qwen2.5-Coder 32B InstructQwen0.8082024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.7292024-09-19evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.