Benchmark

Global-MMLU-Lite

A lightweight version of Global MMLU benchmark that evaluates language models across multiple languages while addressing cultural and linguistic biases in…

Modality
text
Categories
reasoning, language, general
Openness
unknown
Source
llm_stats
Reported scores
15

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemini 2.0 Flash-LiteGoogle0.7822025-02-05evidence
Gemini 2.5 FlashGoogle0.8842025-05-20evidence
Gemini 2.5 Flash-LiteGoogle0.8112025-06-17evidence
Gemini 2.5 ProGoogle0.8862025-05-20evidence
Gemini 2.5 Pro Preview 06-05Google0.8922025-06-05evidence
Gemini DiffusionGoogle0.6912025-05-20evidence
Gemma 3 12BGoogle0.6952025-03-12evidence
Gemma 3 1BGoogle0.3422025-03-12evidence
Gemma 3 27BGoogle0.7512025-03-12evidence
Gemma 3 4BGoogle0.5452025-03-12evidence
Gemma 3n E2B InstructedGoogle0.592025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.592025-05-20evidence
Gemma 3n E4B InstructedGoogle0.6452025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.6452025-05-20evidence
Inkling-SmallThinking Machines Lab0.8672026-07-30evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.