Benchmark
AIME 2025
Mathematical reasoning
- Categories
- reasoning, math
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 270
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Apriel-v1.5-15B-Thinker | ServiceNow | 0.875 | 2025-09-30 | evidence |
| Apriel-v1.6-15B-Thinker | ServiceNow | 0.88 | 2025-11-25 | evidence |
| Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 0.21 | 2025-02-24 | evidence |
| Claude 3.7 Sonnet (Reasoning) | Anthropic | 0.563333333333333 | 2025-02-24 | evidence |
| Claude 4 Opus (Non-reasoning) | Anthropic | 0.363333333333333 | 2025-05-22 | evidence |
| Claude 4 Opus (Reasoning) | Anthropic | 0.733333333333333 | 2025-05-22 | evidence |
| Claude 4 Sonnet (Non-reasoning) | Anthropic | 0.38 | 2025-05-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 0.743333333333333 | 2025-05-22 | evidence |
| Claude 4.1 Opus (Reasoning) | Anthropic | 0.803333333333333 | 2025-08-05 | evidence |
| Claude 4.5 Haiku (Non-reasoning) | Anthropic | 0.39 | 2025-10-15 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.836666666666667 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 0.37 | 2025-09-29 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 0.88 | 2025-09-29 | evidence |
| Claude Opus 4.5 (Non-reasoning) | Anthropic | 0.626666666666667 | 2025-11-24 | evidence |
| Claude Opus 4.5 (Reasoning) | Anthropic | 0.913333333333333 | 2025-11-24 | evidence |
| Cogito v2.1 (Reasoning) | Deep Cogito | 0.726666666666667 | 2025-11-18 | evidence |
| Command A | Cohere | 0.13 | 2025-03-13 | evidence |
| DeepSeek R1 (Jan '25) | DeepSeek | 0.68 | 2025-01-20 | evidence |
| DeepSeek R1 0528 (May '25) | DeepSeek | 0.76 | 2025-05-28 | evidence |
| DeepSeek R1 0528 Qwen3 8B | DeepSeek | 0.636666666666667 | 2025-05-29 | evidence |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 0.536666666666667 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Llama 8B | DeepSeek | 0.413333333333333 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 0.22 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 0.556666666666667 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 0.63 | 2025-01-20 | evidence |
| DeepSeek V3 (Dec '24) | DeepSeek | 0.26 | 2024-12-26 | evidence |
| DeepSeek V3 0324 | DeepSeek | 0.41 | 2025-03-25 | evidence |
| DeepSeek V3.1 (Non-reasoning) | DeepSeek | 0.496666666666667 | 2025-08-21 | evidence |
| DeepSeek V3.1 (Reasoning) | DeepSeek | 0.896666666666667 | 2025-08-21 | evidence |
| DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 0.536666666666667 | 2025-09-22 | evidence |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 0.896666666666667 | 2025-09-22 | evidence |
| DeepSeek V3.2 (Non-reasoning) | DeepSeek | 0.59 | 2025-12-01 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 0.92 | 2025-12-01 | evidence |
| DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 0.576666666666667 | 2025-09-29 | evidence |
| DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 0.876666666666667 | 2025-09-29 | evidence |
| DeepSeek V3.2 Speciale | DeepSeek | 0.966666666666667 | 2025-12-01 | evidence |
| Devstral 2 | Mistral | 0.366666666666667 | 2025-12-09 | evidence |
| Devstral Medium | Mistral | 0.0466666666666667 | 2025-07-10 | evidence |
| Devstral Small (Jul '25) | Mistral | 0.293333333333333 | 2025-07-10 | evidence |
| Devstral Small 2 | Mistral | 0.343333333333333 | 2025-12-09 | evidence |
| Doubao Seed Code | ByteDance Seed | 0.793333333333333 | 2025-11-11 | evidence |
| ERNIE 4.5 300B A47B | Baidu | 0.413333333333333 | 2025-06-30 | evidence |
| ERNIE 5.0 Thinking Preview | Baidu | 0.85 | 2025-11-13 | evidence |
| Exaone 4.0 1.2B (Non-reasoning) | LG AI Research | 0.24 | 2025-07-15 | evidence |
| Exaone 4.0 1.2B (Reasoning) | LG AI Research | 0.503333333333333 | 2025-07-15 | evidence |
| EXAONE 4.0 32B (Non-reasoning) | LG AI Research | 0.393333333333333 | 2025-07-15 | evidence |
| EXAONE 4.0 32B (Reasoning) | LG AI Research | 0.8 | 2025-07-15 | evidence |
| Falcon-H1R-7B | TII UAE | 0.8 | 2026-01-04 | evidence |
| Gemini 2.0 Flash (Feb '25) | 0.216666666666667 | 2025-02-05 | evidence | |
| Gemini 2.5 Flash (Non-reasoning) | 0.603333333333333 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash (Reasoning) | 0.733333333333333 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 0.566666666666667 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 0.783333333333333 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite (Non-reasoning) | 0.353333333333333 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite (Reasoning) | 0.533333333333333 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 0.466666666666667 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 0.686666666666667 | 2025-09-08 | evidence | |
| Gemini 2.5 Pro | 0.876666666666667 | 2025-06-05 | evidence | |
| Gemini 3 Flash Preview (Non-reasoning) | 0.556666666666667 | 2025-12-17 | evidence | |
| Gemini 3 Flash Preview (Reasoning) | 0.97 | 2025-12-17 | evidence | |
| Gemini 3 Pro Preview (high) | 0.956666666666667 | 2025-11-18 | evidence | |
| Gemini 3 Pro Preview (low) | 0.866666666666667 | 2025-11-18 | evidence | |
| Gemma 3 12B Instruct | 0.183333333333333 | 2025-03-12 | evidence | |
| Gemma 3 1B Instruct | 0.0333333333333333 | 2025-03-13 | evidence | |
| Gemma 3 270M | 0.0233333333333333 | 2025-08-14 | evidence | |
| Gemma 3 27B Instruct | 0.206666666666667 | 2025-03-12 | evidence | |
| Gemma 3 4B Instruct | 0.126666666666667 | 2025-03-12 | evidence | |
| Gemma 3n E2B Instruct | 0.103333333333333 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instruct | 0.143333333333333 | 2025-06-26 | evidence | |
| GLM-4.5 (Reasoning) | Z.ai | 0.736666666666667 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.806666666666667 | 2025-07-28 | evidence |
| GLM-4.5V (Non-reasoning) | Z.ai | 0.153333333333333 | 2025-08-11 | evidence |
| GLM-4.5V (Reasoning) | Z.ai | 0.73 | 2025-08-11 | evidence |
| GLM-4.6 (Non-reasoning) | Z.ai | 0.443333333333333 | 2025-09-30 | evidence |
| GLM-4.6 (Reasoning) | Z.ai | 0.86 | 2025-09-30 | evidence |
| GLM-4.6V (Non-reasoning) | Z.ai | 0.263333333333333 | 2025-12-08 | evidence |
| GLM-4.6V (Reasoning) | Z.ai | 0.853333333333333 | 2025-12-08 | evidence |
| GLM-4.7 (Non-reasoning) | Z.ai | 0.48 | 2025-12-22 | evidence |
| GLM-4.7 (Reasoning) | Z.ai | 0.95 | 2025-12-22 | evidence |
| GPT-4.1 | OpenAI | 0.346666666666667 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.463333333333333 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.24 | 2025-04-14 | evidence |
| GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 0.256666666666667 | 2025-03-27 | evidence |
| GPT-4o (Nov '24) | OpenAI | 0.06 | 2024-11-20 | evidence |
| GPT-4o mini | OpenAI | 0.146666666666667 | 2024-07-18 | evidence |
| GPT-5 (ChatGPT) | OpenAI | 0.483333333333333 | 2025-08-07 | evidence |
| GPT-5 (high) | OpenAI | 0.943333333333333 | 2025-08-07 | evidence |
| GPT-5 (low) | OpenAI | 0.83 | 2025-08-07 | evidence |
| GPT-5 (medium) | OpenAI | 0.916666666666667 | 2025-08-07 | evidence |
| GPT-5 (minimal) | OpenAI | 0.316666666666667 | 2025-08-07 | evidence |
| GPT-5 Codex (high) | OpenAI | 0.986666666666667 | 2025-09-23 | evidence |
| GPT-5 mini (high) | OpenAI | 0.906666666666667 | 2025-08-07 | evidence |
| GPT-5 mini (medium) | OpenAI | 0.85 | 2025-08-07 | evidence |
| GPT-5 mini (minimal) | OpenAI | 0.466666666666667 | 2025-08-07 | evidence |
| GPT-5 nano (high) | OpenAI | 0.836666666666667 | 2025-08-07 | evidence |
| GPT-5 nano (medium) | OpenAI | 0.783333333333333 | 2025-08-07 | evidence |
| GPT-5 nano (minimal) | OpenAI | 0.273333333333333 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 0.94 | 2025-11-13 | evidence |
| GPT-5.1 (Non-reasoning) | OpenAI | 0.38 | 2025-11-13 | evidence |
| GPT-5.1 Codex (high) | OpenAI | 0.956666666666667 | 2025-11-13 | evidence |
| GPT-5.1 Codex mini (high) | OpenAI | 0.916666666666667 | 2025-11-13 | evidence |
| GPT-5.2 (medium) | OpenAI | 0.966666666666667 | 2025-12-11 | evidence |
| GPT-5.2 (Non-reasoning) | OpenAI | 0.51 | 2025-12-11 | evidence |
| GPT-5.2 (xhigh) | OpenAI | 0.99 | 2025-12-11 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.934416666666667 | 2025-08-05 | evidence |
| gpt-oss-120b (low) | OpenAI | 0.666666666666667 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.893333333333333 | 2025-08-05 | evidence |
| gpt-oss-20b (low) | OpenAI | 0.623333333333333 | 2025-08-05 | evidence |
| Granite 3.3 8B (Non-reasoning) | IBM | 0.0666666666666667 | 2025-04-16 | evidence |
| Granite 4.0 1B | IBM | 0.0633333333333333 | 2025-10-28 | evidence |
| Granite 4.0 350M | IBM | 0 | 2025-10-28 | evidence |
| Granite 4.0 H 1B | IBM | 0.0633333333333333 | 2025-10-28 | evidence |
| Granite 4.0 H 350M | IBM | 0.0133333333333333 | 2025-10-28 | evidence |
| Granite 4.0 H Small | IBM | 0.136666666666667 | 2025-09-22 | evidence |
| Granite 4.0 Micro | IBM | 0.06 | 2025-09-22 | evidence |
| Grok 3 | xAI | 0.58 | 2025-02-19 | evidence |
| Grok 3 mini Reasoning (high) | xAI | 0.846666666666667 | 2025-02-19 | evidence |
| Grok 4 | xAI | 0.926666666666667 | 2025-07-10 | evidence |
| Grok 4 Fast (Non-reasoning) | xAI | 0.413333333333333 | 2025-09-19 | evidence |
| Grok 4 Fast (Reasoning) | xAI | 0.896666666666667 | 2025-09-19 | evidence |
| Grok 4.1 Fast (Non-reasoning) | xAI | 0.343333333333333 | 2025-11-19 | evidence |
| Grok 4.1 Fast (Reasoning) | xAI | 0.893333333333333 | 2025-11-19 | evidence |
| Grok Code Fast 1 | xAI | 0.433333333333333 | 2025-08-28 | evidence |
| Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 0.153333333333333 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 0.696666666666667 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 0.113333333333333 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 0.686666666666667 | 2025-08-27 | evidence |
| HyperCLOVA X SEED Think (32B) | Naver | 0.59 | 2025-12-26 | evidence |
| INTELLECT-3 | Prime Intellect | 0.88 | 2025-11-27 | evidence |
| Jamba 1.7 Large | AI21 Labs | 0.0233333333333333 | 2025-07-07 | evidence |
| Jamba 1.7 Mini | AI21 Labs | 0.00333333333333333 | 2025-07-07 | evidence |
| Jamba Reasoning 3B | AI21 Labs | 0.106666666666667 | 2025-10-08 | evidence |
| K-EXAONE (Non-reasoning) | LG AI Research | 0.44 | 2025-12-31 | evidence |
| K-EXAONE (Reasoning) | LG AI Research | 0.903333333333334 | 2025-12-31 | evidence |
| K2-V2 (high) | MBZUAI Institute of Foundation Models | 0.783333333333333 | 2025-12-05 | evidence |
| K2-V2 (low) | MBZUAI Institute of Foundation Models | 0.353333333333333 | 2025-12-05 | evidence |
| K2-V2 (medium) | MBZUAI Institute of Foundation Models | 0.646666666666667 | 2025-12-05 | evidence |
| KAT-Coder-Pro V1 | KwaiKAT | 0.946666666666667 | 2025-11-11 | evidence |
| Kimi K2 | Moonshot AI | 0.57 | 2025-07-11 | evidence |
| Kimi K2 0905 | Moonshot AI | 0.573333333333333 | 2025-09-05 | evidence |
| Kimi K2 Thinking | Moonshot AI | 0.946666666666667 | 2025-11-06 | evidence |
| Kimi Linear 48B A3B Instruct | Moonshot AI | 0.363333333333333 | 2025-10-30 | evidence |
| LFM2 1.2B | Liquid AI | 0.0333333333333333 | 2025-07-10 | evidence |
| LFM2 2.6B | Liquid AI | 0.0833333333333333 | 2025-09-23 | evidence |
| LFM2 8B A1B | Liquid AI | 0.253333333333333 | 2025-10-07 | evidence |
| Ling-1T | InclusionAI | 0.713333333333333 | 2025-10-08 | evidence |
| Ling-flash-2.0 | InclusionAI | 0.653333333333333 | 2025-09-17 | evidence |
| Ling-mini-2.0 | InclusionAI | 0.493333333333333 | 2025-09-09 | evidence |
| Llama 3.1 Instruct 405B | Meta | 0.03 | 2024-07-23 | evidence |
| Llama 3.1 Instruct 70B | Meta | 0.04 | 2024-07-23 | evidence |
| Llama 3.1 Instruct 8B | Meta | 0.0433333333333333 | 2024-07-23 | evidence |
| Llama 3.1 Nemotron Instruct 70B | NVIDIA | 0.11 | 2024-10-15 | evidence |
| Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | NVIDIA | 0.5 | 2025-05-20 | evidence |
| Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 0.636666666666667 | 2025-04-07 | evidence |
| Llama 3.2 Instruct 11B (Vision) | Meta | 0.0166666666666667 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 1B | Meta | 0 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 3B | Meta | 0.0333333333333333 | 2024-09-25 | evidence |
| Llama 3.3 Instruct 70B | Meta | 0.0766666666666667 | 2024-12-06 | evidence |
| Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | NVIDIA | 0.0766666666666667 | 2025-03-18 | evidence |
| Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 0.546666666666667 | 2025-03-18 | evidence |
| Llama 4 Maverick | Meta | 0.193333333333333 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.14 | 2025-04-05 | evidence |
| Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 0.08 | 2025-07-25 | evidence |
| Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 0.766666666666667 | 2025-07-25 | evidence |
| Magistral Medium 1 | Mistral | 0.403333333333333 | 2025-06-10 | evidence |
| Magistral Medium 1.2 | Mistral | 0.82 | 2025-09-18 | evidence |
| Magistral Small 1 | Mistral | 0.413333333333333 | 2025-06-10 | evidence |
| Magistral Small 1.2 | Mistral | 0.803333333333333 | 2025-09-17 | evidence |
| Mi:dm K 2.5 Pro | Korea Telecom | 0.766666666666667 | 2025-12-11 | evidence |
| Mi:dm K 2.5 Pro Preview | Korea Telecom | 0.786666666666667 | 2025-12-11 | evidence |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 0.676666666666667 | 2025-12-16 | evidence |
| MiMo-V2-Flash (Reasoning) | Xiaomi | 0.963333333333333 | 2025-12-16 | evidence |
| MiniMax M1 40k | MiniMax | 0.136666666666667 | 2025-06-17 | evidence |
| MiniMax M1 80k | MiniMax | 0.61 | 2025-06-17 | evidence |
| MiniMax-M2 | MiniMax | 0.783333333333333 | 2025-10-26 | evidence |
| MiniMax-M2.1 | MiniMax | 0.826666666666667 | 2025-12-23 | evidence |
| Ministral 3 14B | Mistral | 0.3 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 0.22 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 0.316666666666667 | 2025-12-02 | evidence |
| Mistral Large 2 (Jul '24) | Mistral | 0 | 2024-07-24 | evidence |
| Mistral Large 2 (Nov '24) | Mistral | 0.14 | 2024-11-18 | evidence |
| Mistral Large 3 | Mistral | 0.38 | 2025-12-02 | evidence |
| Mistral Medium 3 | Mistral | 0.303333333333333 | 2025-05-07 | evidence |
| Mistral Medium 3.1 | Mistral | 0.383333333333333 | 2025-08-12 | evidence |
| Mistral Small 3 | Mistral | 0.0433333333333333 | 2025-01-30 | evidence |
| Mistral Small 3.1 | Mistral | 0.0366666666666667 | 2025-03-17 | evidence |
| Mistral Small 3.2 | Mistral | 0.27 | 2025-06-20 | evidence |
| Molmo 7B-D | Allen Institute for AI | 0 | 2024-09-25 | evidence |
| Motif-2-12.7B-Reasoning | Motif Technologies | 0.803333333333333 | 2025-12-04 | evidence |
| Nova 2.0 Lite (high) | Amazon | 0.943333333333333 | 2025-10-29 | evidence |
| Nova 2.0 Lite (low) | Amazon | 0.466666666666667 | 2025-10-29 | evidence |
| Nova 2.0 Lite (medium) | Amazon | 0.886666666666667 | 2025-10-29 | evidence |
| Nova 2.0 Lite (Non-reasoning) | Amazon | 0.336666666666667 | 2025-10-29 | evidence |
| Nova 2.0 Omni (low) | Amazon | 0.56 | 2025-11-26 | evidence |
| Nova 2.0 Omni (medium) | Amazon | 0.896666666666667 | 2025-11-26 | evidence |
| Nova 2.0 Omni (Non-reasoning) | Amazon | 0.37 | 2025-11-26 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 0.633333333333333 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.89 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 0.306666666666667 | 2025-11-27 | evidence |
| Nova Lite | Amazon | 0.07 | 2024-12-03 | evidence |
| Nova Micro | Amazon | 0.06 | 2024-12-03 | evidence |
| Nova Premier | Amazon | 0.173333333333333 | 2025-04-30 | evidence |
| Nova Pro | Amazon | 0.07 | 2024-12-03 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 0.133333333333333 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 0.91 | 2025-12-15 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 0.266666666666667 | 2025-10-28 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 0.75 | 2025-10-28 | evidence |
| NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 0.623333333333333 | 2025-08-18 | evidence |
| NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 0.696666666666667 | 2025-08-18 | evidence |
| o1-preview | OpenAI | 0.796666666666667 | 2024-09-12 | evidence |
| o3 | OpenAI | 0.883333333333333 | 2025-04-16 | evidence |
| o4-mini (high) | OpenAI | 0.906666666666667 | 2025-04-16 | evidence |
| OLMo 2 32B | Allen Institute for AI | 0.0333333333333333 | 2025-03-13 | evidence |
| OLMo 2 7B | Allen Institute for AI | 0.00666666666666667 | 2024-11-26 | evidence |
| Olmo 3 32B Think | Allen Institute for AI | 0.736666666666667 | 2025-11-20 | evidence |
| Olmo 3 7B Instruct | Allen Institute for AI | 0.413333333333333 | 2025-11-20 | evidence |
| Olmo 3 7B Think | Allen Institute for AI | 0.706666666666667 | 2025-11-20 | evidence |
| Olmo 3.1 32B Think | Allen Institute for AI | 0.773333333333333 | 2025-12-12 | evidence |
| Phi-3 Mini Instruct 3.8B | Microsoft | 0.00333333333333333 | 2024-04-23 | evidence |
| Phi-4 | Microsoft | 0.18 | 2024-12-12 | evidence |
| Phi-4 Mini Instruct | Microsoft | 0.0666666666666667 | 2024-02-26 | evidence |
| Pixtral Large | Mistral | 0.0233333333333333 | 2024-11-18 | evidence |
| Qwen2.5 Instruct 72B | Qwen | 0.14 | 2024-09-19 | evidence |
| Qwen3 0.6B (Non-reasoning) | Qwen | 0.103333333333333 | 2025-04-28 | evidence |
| Qwen3 0.6B (Reasoning) | Qwen | 0.18 | 2025-04-28 | evidence |
| Qwen3 1.7B (Non-reasoning) | Qwen | 0.0733333333333333 | 2025-04-28 | evidence |
| Qwen3 1.7B (Reasoning) | Qwen | 0.386666666666667 | 2025-04-28 | evidence |
| Qwen3 14B (Non-reasoning) | Qwen | 0.58 | 2025-04-28 | evidence |
| Qwen3 14B (Reasoning) | Qwen | 0.556666666666667 | 2025-04-28 | evidence |
| Qwen3 235B A22B (Non-reasoning) | Qwen | 0.236666666666667 | 2025-04-28 | evidence |
| Qwen3 235B A22B (Reasoning) | Qwen | 0.82 | 2025-04-28 | evidence |
| Qwen3 235B A22B 2507 (Reasoning) | Qwen | 0.91 | 2025-07-25 | evidence |
| Qwen3 235B A22B 2507 Instruct | Qwen | 0.716666666666667 | 2025-07-21 | evidence |
| Qwen3 30B A3B (Non-reasoning) | Qwen | 0.216666666666667 | 2025-04-28 | evidence |
| Qwen3 30B A3B (Reasoning) | Qwen | 0.723333333333333 | 2025-04-28 | evidence |
| Qwen3 30B A3B 2507 (Reasoning) | Qwen | 0.563333333333333 | 2025-07-30 | evidence |
| Qwen3 30B A3B 2507 Instruct | Qwen | 0.663333333333333 | 2025-07-29 | evidence |
| Qwen3 32B (Non-reasoning) | Qwen | 0.196666666666667 | 2025-04-28 | evidence |
| Qwen3 32B (Reasoning) | Qwen | 0.73 | 2025-04-28 | evidence |
| Qwen3 4B (Reasoning) | Qwen | 0.223333333333333 | 2025-04-28 | evidence |
| Qwen3 4B 2507 (Reasoning) | Qwen | 0.826666666666667 | 2025-08-06 | evidence |
| Qwen3 4B 2507 Instruct | Qwen | 0.523333333333333 | 2025-08-06 | evidence |
| Qwen3 8B (Non-reasoning) | Qwen | 0.243333333333333 | 2025-04-28 | evidence |
| Qwen3 8B (Reasoning) | Qwen | 0.19 | 2025-04-28 | evidence |
| Qwen3 Coder 30B A3B Instruct | Qwen | 0.29 | 2025-07-31 | evidence |
| Qwen3 Coder 480B A35B Instruct | Qwen | 0.393333333333333 | 2025-07-22 | evidence |
| Qwen3 Max | Qwen | 0.806666666666667 | 2025-09-23 | evidence |
| Qwen3 Max (Preview) | Qwen | 0.75 | 2025-09-05 | evidence |
| Qwen3 Max Thinking (Preview) | Qwen | 0.823333333333333 | 2025-11-03 | evidence |
| Qwen3 Next 80B A3B (Reasoning) | Qwen | 0.843333333333333 | 2025-09-11 | evidence |
| Qwen3 Next 80B A3B Instruct | Qwen | 0.663333333333333 | 2025-09-11 | evidence |
| Qwen3 Omni 30B A3B (Reasoning) | Qwen | 0.74 | 2025-09-22 | evidence |
| Qwen3 Omni 30B A3B Instruct | Qwen | 0.523333333333333 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B (Reasoning) | Qwen | 0.883333333333333 | 2025-09-23 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.706666666666667 | 2025-09-23 | evidence |
| Qwen3 VL 30B A3B (Reasoning) | Qwen | 0.823333333333333 | 2025-10-03 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.723333333333333 | 2025-10-03 | evidence |
| Qwen3 VL 32B (Reasoning) | Qwen | 0.846666666666667 | 2025-10-21 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.683333333333333 | 2025-10-21 | evidence |
| Qwen3 VL 4B (Reasoning) | Qwen | 0.256666666666667 | 2025-10-14 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.37 | 2025-10-14 | evidence |
| Qwen3 VL 8B (Reasoning) | Qwen | 0.306666666666667 | 2025-10-14 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.273333333333333 | 2025-10-14 | evidence |
| QwQ 32B | Qwen | 0.29 | 2025-03-05 | evidence |
| Reka Flash 3 | Reka AI | 0.336666666666667 | 2025-03-10 | evidence |
| Ring-1T | InclusionAI | 0.893333333333333 | 2025-10-13 | evidence |
| Ring-flash-2.0 | InclusionAI | 0.836666666666667 | 2025-09-19 | evidence |
| Seed-OSS-36B-Instruct | ByteDance Seed | 0.846666666666667 | 2025-08-20 | evidence |
| Solar Pro 2 (Non-reasoning) | Upstage | 0.3 | 2025-07-09 | evidence |
| Solar Pro 2 (Reasoning) | Upstage | 0.613333333333333 | 2025-07-09 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.