Benchmark

Include

Include benchmark - specific documentation not found in official sources

Modality
text
Categories
general
Openness
unknown
Source
llm_stats
Reported scores
31

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Opus 4.8Anthropic0.8762026-05-28evidence
Gemma 3n E2B InstructedGoogle0.3862025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.3862025-05-20evidence
Gemma 3n E4B InstructedGoogle0.5722025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.5722025-05-20evidence
Qwen3 235B A22BQwen0.73462025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.82025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.82025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.7162025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.7452025-09-22evidence
Qwen3 VL 32B InstructQwen0.742025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.7632025-09-22evidence
Qwen3 VL 4B InstructQwen0.6142025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.6462025-09-22evidence
Qwen3 VL 8B InstructQwen0.672025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.6952025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.7952025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.812025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.7892025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.7892025-09-10evidence
Qwen3.5-0.8BQwen0.4062026-03-02evidence
Qwen3.5-122B-A10BQwen0.8282026-02-24evidence
Qwen3.5-27BQwen0.8162026-02-24evidence
Qwen3.5-2BQwen0.5542026-03-02evidence
Qwen3.5-35B-A3BQwen0.7972026-02-24evidence
Qwen3.5-397B-A17BQwen0.8562026-02-16evidence
Qwen3.5-4BQwen0.712026-03-02evidence
Qwen3.5-9BQwen0.7562026-03-02evidence
Qwen3.6 PlusQwen0.8512026-04-02evidence
Qwen3.7 MaxQwen0.8622026-05-19evidence
Qwen3.7-PlusQwen0.832026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.