Benchmark

MLCR-AA

MLCR-AA overall score

Categories
reasoning
Openness
unknown
Source
artificial_analysis
Reported scores
71

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Non-reasoning)Anthropic0.04444444444444442025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.6444444444444442026-06-09evidence
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic0.2888888888888892026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.4555555555555562026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic0.5944444444444442026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic0.5388888888888892026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.5555555555555562026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic0.5611111111111112026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.5833333333333332026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.2444444444444442026-02-17evidence
Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic0.22026-02-17evidence
Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic0.2055555555555562026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.552026-06-30evidence
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek0.06666666666666672026-04-24evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.152026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek0.1333333333333332026-07-31evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.2111111111111112026-04-24evidence
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek0.1777777777777782026-08-13evidence
Gemini 2.5 Flash (Non-reasoning)Google0.08333333333333332025-05-20evidence
Gemini 2.5 Flash (Reasoning)Google0.08888888888888892025-05-20evidence
Gemini 2.5 Flash-Lite (Reasoning)Google0.02222222222222222025-06-17evidence
Gemini 3 Flash Preview (Non-reasoning)Google0.1166666666666672025-12-17evidence
Gemini 3 Flash Preview (Reasoning)Google0.1111111111111112025-12-17evidence
Gemini 3.1 Flash-LiteGoogle0.06111111111111112026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.1555555555555562026-02-19evidence
Gemini 3.5 Flash (high)Google0.1833333333333332026-05-19evidence
Gemini 3.6 Flash (high)Google0.1444444444444442026-07-21evidence
Gemini 3.7 Flash (high)Google0.152026-08-13evidence
GLM-5.2 (max)Z.ai0.07222222222222222026-06-16evidence
GLM-5.3 (max)Z.ai0.4833333333333332026-08-18evidence
GPT-4o miniOpenAI02024-07-18evidence
GPT-5.4 mini (xhigh)OpenAI0.03888888888888892026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.052026-03-17evidence
GPT-5.5 (low)OpenAI0.1111111111111112026-04-23evidence
GPT-5.5 (Non-reasoning)OpenAI0.152026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.1777777777777782026-04-23evidence
GPT-5.6 Luna (high)OpenAI0.1222222222222222026-07-09evidence
GPT-5.6 Luna (low)OpenAI0.06111111111111112026-07-09evidence
GPT-5.6 Luna (max)OpenAI0.1944444444444442026-07-09evidence
GPT-5.6 Luna (medium)OpenAI0.08333333333333332026-07-09evidence
GPT-5.6 Luna (xhigh)OpenAI0.1611111111111112026-07-09evidence
GPT-5.6 Sol (high)OpenAI0.1722222222222222026-07-09evidence
GPT-5.6 Sol (low)OpenAI0.1277777777777782026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.2611111111111112026-07-09evidence
GPT-5.6 Sol (medium)OpenAI0.152026-07-09evidence
GPT-5.6 Sol (xhigh)OpenAI0.1833333333333332026-07-09evidence
GPT-5.6 Terra (high)OpenAI0.1222222222222222026-07-09evidence
GPT-5.6 Terra (low)OpenAI0.08888888888888892026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.3166666666666672026-07-09evidence
GPT-5.6 Terra (medium)OpenAI0.1222222222222222026-07-09evidence
GPT-5.6 Terra (xhigh)OpenAI0.2166666666666672026-07-09evidence
gpt-oss-120b (high)OpenAI0.01111111111111112025-08-05evidence
gpt-oss-20b (high)OpenAI0.005555555555555562025-08-05evidence
Grok 4.3 (high)xAI0.12026-04-30evidence
Grok 4.5 (high)xAI0.152026-07-08evidence
Grok 4.6 (high)xAI0.1222222222222222026-08-12evidence
Inkling (xhigh)Thinking Machines0.1222222222222222026-07-15evidence
Kimi K2.7 CodeMoonshot AI0.1611111111111112026-06-12evidence
Kimi K3 (max)Moonshot AI0.3833333333333332026-07-16evidence
Llama 4 MaverickMeta0.02222222222222222025-04-05evidence
MiMo-V2.5-ProXiaomi0.09444444444444442026-04-22evidence
MiniMax-M2.7MiniMax0.03333333333333332026-03-18evidence
MiniMax-M3MiniMax0.1722222222222222026-06-01evidence
Mistral Medium 3.5Mistral0.01666666666666672026-04-29evidence
Muse Spark 1.2 (xhigh)Meta0.3111111111111112026-08-05evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.1111111111111112026-06-04evidence
Nova 2.0 Pro Preview (medium)Amazon0.03888888888888892025-11-27evidence
Nova LiteAmazon02024-12-03evidence
Qwen3.7 PlusQwen0.09444444444444442026-06-01evidence
Qwen3.8 MaxQwen0.1944444444444442026-08-03evidence
Solar Pro 3Upstage0.005555555555555562026-04-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.