Benchmark

TriviaQA

A large-scale reading comprehension dataset containing over 650K question-answer-evidence triples. TriviaQA includes 95K question-answer pairs authored by…

Modality
text
Categories
reasoning, general
Openness
unknown
Source
llm_stats
Reported scores
18

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemma 2 27BGoogle0.8372024-06-27evidence
Gemma 2 9BGoogle0.7662024-06-27evidence
Gemma 3n E2BGoogle0.6082025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.6082025-05-20evidence
Gemma 3n E4BGoogle0.7022025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.7022025-05-20evidence
Granite 3.3 8B BaseIBM0.78182025-04-16evidence
Kimi K2 BaseMoonshot AI0.8512025-07-11evidence
MiMo-V2.5-ProXiaomi0.8132026-04-27evidence
Ministral 3 (14B Base 2512)Mistral0.7492025-12-04evidence
Ministral 3 (3B Base 2512)Mistral0.5922025-12-04evidence
Ministral 3 (8B Base 2512)Mistral0.6812025-12-04evidence
Ministral 8B InstructMistral0.6552024-10-16evidence
Mistral Large 3Mistral0.7492025-09-01evidence
Mistral NeMo InstructMistral0.7382024-07-18evidence
Mistral Small 3 24B BaseMistral0.80322025-01-30evidence
Mistral Small 3.1 24B BaseMistral0.8052025-03-17evidence
Mistral Small 3.1 24B InstructMistral0.8052025-03-17evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.