Benchmark

ARC-C

The AI2 Reasoning Challenge (ARC) Challenge Set is a multiple-choice question-answering benchmark containing grade-school level science questions that…

Modality
text
Categories
reasoning, general
Openness
unknown
Source
llm_stats
Reported scores
34

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.8922024-03-13evidence
Claude 3 OpusAnthropic0.9642024-02-29evidence
Claude 3 SonnetAnthropic0.9322024-02-29evidence
Command R+Cohere0.70992024-08-30evidence
ERNIE 4.5Baidu0.4062025-06-25evidence
Gemma 2 27BGoogle0.7142024-06-27evidence
Gemma 2 9BGoogle0.6842024-06-27evidence
Gemma 3n E2BGoogle0.5172025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.5172025-05-20evidence
Gemma 3n E4BGoogle0.6162025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.6162025-05-20evidence
Granite 3.3 8B BaseIBM0.50842025-04-16evidence
Hermes 3 70BNous Research0.65532024-08-15evidence
Jamba 1.5 LargeAI21 Labs0.932024-08-22evidence
Jamba 1.5 MiniAI21 Labs0.8572024-08-22evidence
Llama 3.1 405B InstructMeta0.9692024-07-23evidence
Llama 3.1 70B InstructMeta0.9482024-07-23evidence
Llama 3.1 8B InstructMeta0.8342024-07-23evidence
Llama 3.1 Nemotron 70B InstructNVIDIA0.6922024-10-01evidence
Llama 3.2 3B InstructMeta0.7862024-09-25evidence
MiMo-V2.5-ProXiaomi0.9722026-04-27evidence
Ministral 8B InstructMistral0.7192024-10-16evidence
Mistral Small 3 24B BaseMistral0.91292025-01-30evidence
Nova LiteAmazon0.9242024-11-20evidence
Nova MicroAmazon0.9022024-11-20evidence
Nova ProAmazon0.9482024-11-20evidence
Phi 4 MiniMicrosoft0.8372025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.8462024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.912024-08-23evidence
Qwen2 72B InstructQwen0.6892024-07-23evidence
Qwen2.5 14B InstructQwen0.6732024-09-19evidence
Qwen2.5 32B InstructQwen0.7042024-09-19evidence
Qwen2.5-Coder 32B InstructQwen0.7052024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.6092024-09-19evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.