Benchmark
MLCR-AA
MLCR-AA overall score
- Categories
- reasoning
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 71
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4.5 Haiku (Non-reasoning) | Anthropic | 0.0444444444444444 | 2025-10-15 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 0.644444444444444 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 0.288888888888889 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 0.455555555555556 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 0.594444444444444 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 0.538888888888889 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.555555555555556 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 0.561111111111111 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.583333333333333 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.244444444444444 | 2026-02-17 | evidence |
| Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 0.2 | 2026-02-17 | evidence |
| Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 0.205555555555556 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.55 | 2026-06-30 | evidence |
| DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 0.0666666666666667 | 2026-04-24 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.15 | 2026-04-24 | evidence |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 0.133333333333333 | 2026-07-31 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.211111111111111 | 2026-04-24 | evidence |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 0.177777777777778 | 2026-08-13 | evidence |
| Gemini 2.5 Flash (Non-reasoning) | 0.0833333333333333 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash (Reasoning) | 0.0888888888888889 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash-Lite (Reasoning) | 0.0222222222222222 | 2025-06-17 | evidence | |
| Gemini 3 Flash Preview (Non-reasoning) | 0.116666666666667 | 2025-12-17 | evidence | |
| Gemini 3 Flash Preview (Reasoning) | 0.111111111111111 | 2025-12-17 | evidence | |
| Gemini 3.1 Flash-Lite | 0.0611111111111111 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.155555555555556 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.183333333333333 | 2026-05-19 | evidence | |
| Gemini 3.6 Flash (high) | 0.144444444444444 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 0.15 | 2026-08-13 | evidence | |
| GLM-5.2 (max) | Z.ai | 0.0722222222222222 | 2026-06-16 | evidence |
| GLM-5.3 (max) | Z.ai | 0.483333333333333 | 2026-08-18 | evidence |
| GPT-4o mini | OpenAI | 0 | 2024-07-18 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.0388888888888889 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.05 | 2026-03-17 | evidence |
| GPT-5.5 (low) | OpenAI | 0.111111111111111 | 2026-04-23 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 0.15 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.177777777777778 | 2026-04-23 | evidence |
| GPT-5.6 Luna (high) | OpenAI | 0.122222222222222 | 2026-07-09 | evidence |
| GPT-5.6 Luna (low) | OpenAI | 0.0611111111111111 | 2026-07-09 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.194444444444444 | 2026-07-09 | evidence |
| GPT-5.6 Luna (medium) | OpenAI | 0.0833333333333333 | 2026-07-09 | evidence |
| GPT-5.6 Luna (xhigh) | OpenAI | 0.161111111111111 | 2026-07-09 | evidence |
| GPT-5.6 Sol (high) | OpenAI | 0.172222222222222 | 2026-07-09 | evidence |
| GPT-5.6 Sol (low) | OpenAI | 0.127777777777778 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.261111111111111 | 2026-07-09 | evidence |
| GPT-5.6 Sol (medium) | OpenAI | 0.15 | 2026-07-09 | evidence |
| GPT-5.6 Sol (xhigh) | OpenAI | 0.183333333333333 | 2026-07-09 | evidence |
| GPT-5.6 Terra (high) | OpenAI | 0.122222222222222 | 2026-07-09 | evidence |
| GPT-5.6 Terra (low) | OpenAI | 0.0888888888888889 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.316666666666667 | 2026-07-09 | evidence |
| GPT-5.6 Terra (medium) | OpenAI | 0.122222222222222 | 2026-07-09 | evidence |
| GPT-5.6 Terra (xhigh) | OpenAI | 0.216666666666667 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.0111111111111111 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.00555555555555556 | 2025-08-05 | evidence |
| Grok 4.3 (high) | xAI | 0.1 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.15 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 0.122222222222222 | 2026-08-12 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.122222222222222 | 2026-07-15 | evidence |
| Kimi K2.7 Code | Moonshot AI | 0.161111111111111 | 2026-06-12 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.383333333333333 | 2026-07-16 | evidence |
| Llama 4 Maverick | Meta | 0.0222222222222222 | 2025-04-05 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.0944444444444444 | 2026-04-22 | evidence |
| MiniMax-M2.7 | MiniMax | 0.0333333333333333 | 2026-03-18 | evidence |
| MiniMax-M3 | MiniMax | 0.172222222222222 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.0166666666666667 | 2026-04-29 | evidence |
| Muse Spark 1.2 (xhigh) | Meta | 0.311111111111111 | 2026-08-05 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.111111111111111 | 2026-06-04 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.0388888888888889 | 2025-11-27 | evidence |
| Nova Lite | Amazon | 0 | 2024-12-03 | evidence |
| Qwen3.7 Plus | Qwen | 0.0944444444444444 | 2026-06-01 | evidence |
| Qwen3.8 Max | Qwen | 0.194444444444444 | 2026-08-03 | evidence |
| Solar Pro 3 | Upstage | 0.00555555555555556 | 2026-04-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.