Benchmark
MMMU-Pro
Visual reasoning
- Categories
- multimodal, reasoning
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 245
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Apriel-v1.5-15B-Thinker | ServiceNow | 0.570520231213873 | 2025-09-30 | evidence |
| Claude 3 Haiku | Anthropic | 0.308092485549133 | 2024-03-04 | evidence |
| Claude 3.5 Haiku | Anthropic | 0.45606936416185 | 2024-10-22 | evidence |
| Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 0.600578034682081 | 2025-02-24 | evidence |
| Claude 4 Sonnet (Non-reasoning) | Anthropic | 0.623699421965318 | 2025-05-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 0.617919075144509 | 2025-05-22 | evidence |
| Claude 4.1 Opus (Reasoning) | Anthropic | 0.679190751445087 | 2025-08-05 | evidence |
| Claude 4.5 Haiku (Non-reasoning) | Anthropic | 0.551445086705202 | 2025-10-15 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.585549132947977 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 0.652023121387283 | 2025-09-29 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 0.68728323699422 | 2025-09-29 | evidence |
| Claude Opus 4.5 (Non-reasoning) | Anthropic | 0.712138728323699 | 2025-11-24 | evidence |
| Claude Opus 4.5 (Reasoning) | Anthropic | 0.740462427745665 | 2025-11-24 | evidence |
| Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.754335260115607 | 2026-02-05 | evidence |
| Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 0.725433526011561 | 2026-02-05 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 0.788439306358382 | 2026-04-16 | evidence |
| Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 0.763583815028902 | 2026-04-16 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 0.824277456647399 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 0.798265895953757 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.847398843930636 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 0.816184971098266 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.839884393063584 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.732947976878613 | 2026-02-17 | evidence |
| Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 0.705780346820809 | 2026-02-17 | evidence |
| Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 0.691907514450867 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.772832369942197 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 0.71907514450867 | 2026-06-30 | evidence |
| Command A+ | Cohere | 0.632369942196532 | 2026-05-20 | evidence |
| DeepSeek V4 Flash Vision (Reasoning, Max Effort) | DeepSeek | 0.747976878612717 | 2026-08-21 | evidence |
| Devstral Small 2 | Mistral | 0.446242774566474 | 2025-12-09 | evidence |
| DiffusionGemma 26B A4B | 0.665317919075144 | 2026-06-10 | evidence | |
| Doubao Seed Code | ByteDance Seed | 0.68092485549133 | 2025-11-11 | evidence |
| ERNIE 5.0 Thinking Preview | Baidu | 0.645664739884393 | 2025-11-13 | evidence |
| EXAONE 4.5 33B | LG AI Research | 0.673410404624277 | 2026-04-09 | evidence |
| Gemini 1.5 Flash (Sep '24) | 0.483815028901734 | 2024-09-24 | evidence | |
| Gemini 1.5 Flash-8B | 0.365317919075144 | 2024-10-03 | evidence | |
| Gemini 1.5 Pro (Sep '24) | 0.55028901734104 | 2024-09-24 | evidence | |
| Gemini 2.5 Flash (Non-reasoning) | 0.654913294797688 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash (Reasoning) | 0.690751445086705 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash Preview (Non-reasoning) | 0.619653179190751 | 2025-04-17 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 0.702312138728324 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 0.73121387283237 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite (Non-reasoning) | 0.539884393063584 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite (Reasoning) | 0.582080924855491 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 0.634104046242775 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 0.64971098265896 | 2025-09-08 | evidence | |
| Gemini 2.5 Pro | 0.749132947976879 | 2025-06-05 | evidence | |
| Gemini 3 Flash Preview (Non-reasoning) | 0.785549132947977 | 2025-12-17 | evidence | |
| Gemini 3 Flash Preview (Reasoning) | 0.799421965317919 | 2025-12-17 | evidence | |
| Gemini 3 Pro Preview (high) | 0.801734104046243 | 2025-11-18 | evidence | |
| Gemini 3.1 Flash-Lite | 0.755491329479769 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.824277456647399 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.842774566473988 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash (medium) | 0.838728323699422 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash (minimal) | 0.801156069364162 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash-Lite | 0.790173410404624 | 2026-07-21 | evidence | |
| Gemini 3.6 Flash (high) | 0.832369942196532 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 0.854913294797688 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (low) | 0.848554913294798 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (medium) | 0.847398843930636 | 2026-08-13 | evidence | |
| Gemma 3 12B Instruct | 0.37514450867052 | 2025-03-12 | evidence | |
| Gemma 3 27B Instruct | 0.480346820809249 | 2025-03-12 | evidence | |
| Gemma 3 4B Instruct | 0.299421965317919 | 2025-03-12 | evidence | |
| Gemma 3n E4B Instruct | 0.26242774566474 | 2025-06-26 | evidence | |
| Gemma 4 12B (Non-reasoning) | 0.619653179190751 | 2026-06-03 | evidence | |
| Gemma 4 12B (Reasoning) | 0.696531791907514 | 2026-06-03 | evidence | |
| Gemma 4 26B A4B (Non-reasoning) | 0.667052023121387 | 2026-04-02 | evidence | |
| Gemma 4 26B A4B (Reasoning) | 0.692485549132948 | 2026-04-02 | evidence | |
| Gemma 4 31B (Non-reasoning) | 0.703468208092486 | 2026-04-02 | evidence | |
| Gemma 4 31B (Reasoning) | 0.734104046242775 | 2026-04-02 | evidence | |
| Gemma 4 E2B (Non-reasoning) | 0.417919075144509 | 2026-04-02 | evidence | |
| Gemma 4 E2B (Reasoning) | 0.445664739884393 | 2026-04-02 | evidence | |
| Gemma 4 E4B (Non-reasoning) | 0.512138728323699 | 2026-04-03 | evidence | |
| Gemma 4 E4B (Reasoning) | 0.513872832369942 | 2026-04-03 | evidence | |
| GLM 5V Turbo (Reasoning) | Z.ai | 0.727745664739884 | 2026-04-01 | evidence |
| GLM-4.5V (Non-reasoning) | Z.ai | 0.427745664739884 | 2025-08-11 | evidence |
| GLM-4.5V (Reasoning) | Z.ai | 0.504624277456647 | 2025-08-11 | evidence |
| GLM-4.6V (Non-reasoning) | Z.ai | 0.421965317919075 | 2025-12-08 | evidence |
| GLM-4.6V (Reasoning) | Z.ai | 0.485549132947977 | 2025-12-08 | evidence |
| GPT-4.1 | OpenAI | 0.612138728323699 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.58728323699422 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.401156069364162 | 2025-04-14 | evidence |
| GPT-4o (Aug '24) | OpenAI | 0.563005780346821 | 2024-08-06 | evidence |
| GPT-4o mini | OpenAI | 0.415028901734104 | 2024-07-18 | evidence |
| GPT-5 (high) | OpenAI | 0.742196531791907 | 2025-08-07 | evidence |
| GPT-5 (low) | OpenAI | 0.73757225433526 | 2025-08-07 | evidence |
| GPT-5 (medium) | OpenAI | 0.743352601156069 | 2025-08-07 | evidence |
| GPT-5 (minimal) | OpenAI | 0.620809248554913 | 2025-08-07 | evidence |
| GPT-5 Codex (high) | OpenAI | 0.738150289017341 | 2025-09-23 | evidence |
| GPT-5 mini (high) | OpenAI | 0.700578034682081 | 2025-08-07 | evidence |
| GPT-5 mini (medium) | OpenAI | 0.688439306358381 | 2025-08-07 | evidence |
| GPT-5 mini (minimal) | OpenAI | 0.583815028901734 | 2025-08-07 | evidence |
| GPT-5 nano (high) | OpenAI | 0.609826589595376 | 2025-08-07 | evidence |
| GPT-5 nano (medium) | OpenAI | 0.582080924855491 | 2025-08-07 | evidence |
| GPT-5 nano (minimal) | OpenAI | 0.317919075144509 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 0.754913294797688 | 2025-11-13 | evidence |
| GPT-5.1 (Non-reasoning) | OpenAI | 0.623699421965318 | 2025-11-13 | evidence |
| GPT-5.1 Codex (high) | OpenAI | 0.72485549132948 | 2025-11-13 | evidence |
| GPT-5.1 Codex mini (high) | OpenAI | 0.690173410404624 | 2025-11-13 | evidence |
| GPT-5.2 (medium) | OpenAI | 0.745664739884393 | 2025-12-11 | evidence |
| GPT-5.2 (Non-reasoning) | OpenAI | 0.658381502890173 | 2025-12-11 | evidence |
| GPT-5.2 Codex (xhigh) | OpenAI | 0.763005780346821 | 2025-12-11 | evidence |
| GPT-5.3 Codex (xhigh) | OpenAI | 0.784971098265896 | 2026-02-05 | evidence |
| GPT-5.4 (low) | OpenAI | 0.779768786127168 | 2026-03-05 | evidence |
| GPT-5.4 (Non-reasoning) | OpenAI | 0.705780346820809 | 2026-03-05 | evidence |
| GPT-5.4 (xhigh) | OpenAI | 0.784393063583815 | 2026-03-05 | evidence |
| GPT-5.4 mini (medium) | OpenAI | 0.711560693641618 | 2026-03-17 | evidence |
| GPT-5.4 mini (Non-Reasoning) | OpenAI | 0.604624277456647 | 2026-03-17 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.732947976878613 | 2026-03-17 | evidence |
| GPT-5.4 nano (medium) | OpenAI | 0.595375722543353 | 2026-03-17 | evidence |
| GPT-5.4 nano (Non-Reasoning) | OpenAI | 0.43757225433526 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.653757225433526 | 2026-03-17 | evidence |
| GPT-5.5 (high) | OpenAI | 0.810982658959538 | 2026-04-23 | evidence |
| GPT-5.5 (low) | OpenAI | 0.790173410404624 | 2026-04-23 | evidence |
| GPT-5.5 (medium) | OpenAI | 0.811560693641619 | 2026-04-23 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 0.713872832369942 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.798843930635838 | 2026-04-23 | evidence |
| GPT-5.6 Luna (high) | OpenAI | 0.775722543352601 | 2026-07-09 | evidence |
| GPT-5.6 Luna (low) | OpenAI | 0.739884393063584 | 2026-07-09 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.785549132947977 | 2026-07-09 | evidence |
| GPT-5.6 Luna (medium) | OpenAI | 0.758381502890173 | 2026-07-09 | evidence |
| GPT-5.6 Luna (Non-reasoning) | OpenAI | 0.603468208092486 | 2026-07-09 | evidence |
| GPT-5.6 Luna (xhigh) | OpenAI | 0.785549132947977 | 2026-07-09 | evidence |
| GPT-5.6 Sol (high) | OpenAI | 0.81849710982659 | 2026-07-09 | evidence |
| GPT-5.6 Sol (low) | OpenAI | 0.809826589595376 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.834104046242775 | 2026-07-09 | evidence |
| GPT-5.6 Sol (medium) | OpenAI | 0.813872832369942 | 2026-07-09 | evidence |
| GPT-5.6 Sol (Non-reasoning) | OpenAI | 0.71907514450867 | 2026-07-09 | evidence |
| GPT-5.6 Sol (xhigh) | OpenAI | 0.826589595375723 | 2026-07-09 | evidence |
| GPT-5.6 Terra (high) | OpenAI | 0.790751445086705 | 2026-07-09 | evidence |
| GPT-5.6 Terra (low) | OpenAI | 0.761271676300578 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.806936416184971 | 2026-07-09 | evidence |
| GPT-5.6 Terra (medium) | OpenAI | 0.767630057803468 | 2026-07-09 | evidence |
| GPT-5.6 Terra (Non-reasoning) | OpenAI | 0.667052023121387 | 2026-07-09 | evidence |
| GPT-5.6 Terra (xhigh) | OpenAI | 0.794797687861272 | 2026-07-09 | evidence |
| Grok 4 | xAI | 0.688439306358381 | 2025-07-10 | evidence |
| Grok 4 Fast (Non-reasoning) | xAI | 0.480924855491329 | 2025-09-19 | evidence |
| Grok 4 Fast (Reasoning) | xAI | 0.617919075144509 | 2025-09-19 | evidence |
| Grok 4.1 Fast (Non-reasoning) | xAI | 0.484393063583815 | 2025-11-19 | evidence |
| Grok 4.1 Fast (Reasoning) | xAI | 0.632947976878613 | 2025-11-19 | evidence |
| Grok 4.20 0309 (Non-reasoning) | xAI | 0.640462427745665 | 2026-03-10 | evidence |
| Grok 4.20 0309 (Reasoning) | xAI | 0.731791907514451 | 2026-03-10 | evidence |
| Grok 4.20 0309 v2 (Non-reasoning) | xAI | 0.649132947976879 | 2026-04-07 | evidence |
| Grok 4.20 0309 v2 (Reasoning) | xAI | 0.745664739884393 | 2026-04-07 | evidence |
| Grok 4.3 (high) | xAI | 0.78092485549133 | 2026-04-30 | evidence |
| Grok 4.3 (low) | xAI | 0.727745664739884 | 2026-04-30 | evidence |
| Grok 4.3 (medium) | xAI | 0.758381502890173 | 2026-04-30 | evidence |
| Grok 4.3 (Non-reasoning) | xAI | 0.647976878612717 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.804046242774566 | 2026-07-08 | evidence |
| Grok Build 0.1 0616 | xAI | 0.765317919075144 | 2026-06-16 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.734682080924856 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 0.740462427745665 | 2026-07-30 | evidence |
| JT-4.1 Flash 236B A21B | China Mobile | 0.641040462427746 | 2026-07-09 | evidence |
| Kimi K2.5 (Non-reasoning) | Moonshot AI | 0.730635838150289 | 2026-01-27 | evidence |
| Kimi K2.5 (Reasoning) | Moonshot AI | 0.753757225433526 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.79364161849711 | 2026-04-20 | evidence |
| Kimi K3 (low) | Moonshot AI | 0.784971098265896 | 2026-07-16 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.805202312138728 | 2026-07-16 | evidence |
| LFM2.5-VL-1.6B | Liquid AI | 0.265317919075145 | 2026-01-05 | evidence |
| Llama 3.2 Instruct 11B (Vision) | Meta | 0.293063583815029 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 90B (Vision) | Meta | 0.394797687861272 | 2024-09-25 | evidence |
| Llama 4 Maverick | Meta | 0.621387283236994 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.529479768786127 | 2025-04-05 | evidence |
| Magistral Medium 1.2 | Mistral | 0.596531791907514 | 2025-09-18 | evidence |
| Magistral Small 1.2 | Mistral | 0.554913294797688 | 2025-09-17 | evidence |
| MiMo-V2-Omni | Xiaomi | 0.698843930635838 | 2026-03-19 | evidence |
| MiMo-V2-Omni-0327 | Xiaomi | 0.739306358381503 | 2026-03-27 | evidence |
| MiMo-V2.5 | Xiaomi | 0.754335260115607 | 2026-04-22 | evidence |
| MiniCPM-V 4.6 1.3B | OpenBMB | 0.379190751445087 | 2026-05-11 | evidence |
| MiniMax-M3 | MiniMax | 0.785549132947977 | 2026-06-01 | evidence |
| Ministral 3 14B | Mistral | 0.498265895953757 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 0.380924855491329 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 0.459537572254335 | 2025-12-02 | evidence |
| Mistral Large 3 | Mistral | 0.556647398843931 | 2025-12-02 | evidence |
| Mistral Medium 3 | Mistral | 0.530057803468208 | 2025-05-07 | evidence |
| Mistral Medium 3.1 | Mistral | 0.541618497109827 | 2025-08-12 | evidence |
| Mistral Medium 3.5 | Mistral | 0.648554913294798 | 2026-04-29 | evidence |
| Mistral Small 3.2 | Mistral | 0.479768786127168 | 2025-06-20 | evidence |
| Mistral Small 4 (Non-reasoning) | Mistral | 0.464739884393064 | 2026-03-16 | evidence |
| Mistral Small 4 (Reasoning) | Mistral | 0.568208092485549 | 2026-03-16 | evidence |
| Molmo 7B-D | Allen Institute for AI | 0.245086705202312 | 2024-09-25 | evidence |
| Molmo2-8B | Allen Institute for AI | 0.374566473988439 | 2025-12-11 | evidence |
| Muse Glimmer (high) | Meta | 0.743352601156069 | 2026-08-10 | evidence |
| Muse Spark | Meta | 0.805202312138728 | 2026-04-08 | evidence |
| Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 0.531791907514451 | 2026-04-29 | evidence |
| Nova 2.0 Lite (high) | Amazon | 0.63757225433526 | 2025-10-29 | evidence |
| Nova 2.0 Lite (low) | Amazon | 0.579768786127168 | 2025-10-29 | evidence |
| Nova 2.0 Lite (medium) | Amazon | 0.625433526011561 | 2025-10-29 | evidence |
| Nova 2.0 Lite (Non-reasoning) | Amazon | 0.490173410404624 | 2025-10-29 | evidence |
| Nova 2.0 Omni (low) | Amazon | 0.598265895953757 | 2025-11-26 | evidence |
| Nova 2.0 Omni (medium) | Amazon | 0.619075144508671 | 2025-11-26 | evidence |
| Nova 2.0 Omni (Non-reasoning) | Amazon | 0.498843930635838 | 2025-11-26 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 0.627167630057804 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.645086705202312 | 2025-11-27 | evidence |
| Nova Lite | Amazon | 0.378034682080925 | 2024-12-03 | evidence |
| Nova Pro | Amazon | 0.443352601156069 | 2024-12-03 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 0.445086705202312 | 2025-10-28 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 0.528901734104046 | 2025-10-28 | evidence |
| o3 | OpenAI | 0.700578034682081 | 2025-04-16 | evidence |
| o4-mini (high) | OpenAI | 0.692485549132948 | 2025-04-16 | evidence |
| Phi-4 Multimodal Instruct | Microsoft | 0.145086705202312 | 2025-02-26 | evidence |
| Pixtral Large | Mistral | 0.505780346820809 | 2024-11-18 | evidence |
| Qwen3 Omni 30B A3B (Reasoning) | Qwen | 0.602312138728324 | 2025-09-22 | evidence |
| Qwen3 Omni 30B A3B Instruct | Qwen | 0.554913294797688 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B (Reasoning) | Qwen | 0.68728323699422 | 2025-09-23 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.675722543352601 | 2025-09-23 | evidence |
| Qwen3 VL 30B A3B (Reasoning) | Qwen | 0.61849710982659 | 2025-10-03 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.621387283236994 | 2025-10-03 | evidence |
| Qwen3 VL 32B (Reasoning) | Qwen | 0.634104046242775 | 2025-10-21 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.642774566473988 | 2025-10-21 | evidence |
| Qwen3 VL 4B (Reasoning) | Qwen | 0.520231213872832 | 2025-10-14 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.438728323699422 | 2025-10-14 | evidence |
| Qwen3 VL 8B (Reasoning) | Qwen | 0.566473988439306 | 2025-10-14 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.473410404624277 | 2025-10-14 | evidence |
| Qwen3.5 0.8B (Non-reasoning) | Qwen | 0.256647398843931 | 2026-03-02 | evidence |
| Qwen3.5 0.8B (Reasoning) | Qwen | 0.258381502890173 | 2026-03-02 | evidence |
| Qwen3.5 122B A10B (Non-reasoning) | Qwen | 0.702890173410405 | 2026-02-24 | evidence |
| Qwen3.5 122B A10B (Reasoning) | Qwen | 0.74971098265896 | 2026-02-24 | evidence |
| Qwen3.5 27B (Non-reasoning) | Qwen | 0.7 | 2026-02-24 | evidence |
| Qwen3.5 27B (Reasoning) | Qwen | 0.75028901734104 | 2026-02-24 | evidence |
| Qwen3.5 2B (Non-reasoning) | Qwen | 0.426589595375723 | 2026-03-02 | evidence |
| Qwen3.5 2B (Reasoning) | Qwen | 0.430057803468208 | 2026-03-02 | evidence |
| Qwen3.5 35B A3B (Non-reasoning) | Qwen | 0.691907514450867 | 2026-02-24 | evidence |
| Qwen3.5 35B A3B (Reasoning) | Qwen | 0.726589595375723 | 2026-02-24 | evidence |
| Qwen3.5 397B A17B (Non-reasoning) | Qwen | 0.526589595375723 | 2026-02-16 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.772832369942197 | 2026-02-16 | evidence |
| Qwen3.5 4B (Non-reasoning) | Qwen | 0.620809248554913 | 2026-03-02 | evidence |
| Qwen3.5 4B (Reasoning) | Qwen | 0.653757225433526 | 2026-03-02 | evidence |
| Qwen3.5 9B (Non-reasoning) | Qwen | 0.667630057803468 | 2026-03-02 | evidence |
| Qwen3.5 9B (Reasoning) | Qwen | 0.692485549132948 | 2026-03-02 | evidence |
| Qwen3.5 Omni Flash | Qwen | 0.647398843930636 | 2026-03-30 | evidence |
| Qwen3.5 Omni Plus | Qwen | 0.705202312138728 | 2026-03-30 | evidence |
| Qwen3.6 27B (Non-reasoning) | Qwen | 0.717341040462428 | 2026-04-22 | evidence |
| Qwen3.6 27B (Reasoning) | Qwen | 0.746242774566474 | 2026-04-22 | evidence |
| Qwen3.6 35B A3B (Non-reasoning) | Qwen | 0.710404624277457 | 2026-04-16 | evidence |
| Qwen3.6 35B A3B (Reasoning) | Qwen | 0.75028901734104 | 2026-04-16 | evidence |
| Qwen3.6 Plus | Qwen | 0.779768786127168 | 2026-04-02 | evidence |
| Qwen3.7 Plus | Qwen | 0.804624277456647 | 2026-06-01 | evidence |
| Qwen3.8 27B (low) | Qwen | 0.73757225433526 | 2026-08-14 | evidence |
| Qwen3.8 27B (medium) | Qwen | 0.741618497109827 | 2026-08-14 | evidence |
| Qwen3.8 27B (Non-reasoning) | Qwen | 0.699421965317919 | 2026-08-14 | evidence |
| Qwen3.8 27B (xhigh) | Qwen | 0.763005780346821 | 2026-08-14 | evidence |
| Qwen3.8 Max | Qwen | 0.823121387283237 | 2026-08-03 | evidence |
| Step 3.7 Flash | StepFun | 0.753179190751445 | 2026-05-29 | evidence |
| Step3 VL 10B | StepFun | 0.639884393063584 | 2026-01-20 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.