Benchmark
LiveCodeBench
Coding
- Categories
- coding
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 343
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Apriel-v1.5-15B-Thinker | ServiceNow | 0.728042328042328 | 2025-09-30 | evidence |
| Apriel-v1.6-15B-Thinker | ServiceNow | 0.807407407407407 | 2025-11-25 | evidence |
| Claude 2.0 | Anthropic | 0.171428571428571 | 2023-07-11 | evidence |
| Claude 2.1 | Anthropic | 0.194708994708995 | 2023-11-21 | evidence |
| Claude 3 Haiku | Anthropic | 0.154497354497354 | 2024-03-04 | evidence |
| Claude 3 Opus | Anthropic | 0.279365079365079 | 2024-03-04 | evidence |
| Claude 3 Sonnet | Anthropic | 0.174603174603175 | 2024-03-04 | evidence |
| Claude 3.5 Haiku | Anthropic | 0.314285714285714 | 2024-10-22 | evidence |
| Claude 3.5 Sonnet (Oct '24) | Anthropic | 0.380952380952381 | 2024-10-22 | evidence |
| Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 0.393650793650794 | 2025-02-24 | evidence |
| Claude 3.7 Sonnet (Reasoning) | Anthropic | 0.473015873015873 | 2025-02-24 | evidence |
| Claude 4 Opus (Non-reasoning) | Anthropic | 0.541798941798942 | 2025-05-22 | evidence |
| Claude 4 Opus (Reasoning) | Anthropic | 0.635978835978836 | 2025-05-22 | evidence |
| Claude 4 Sonnet (Non-reasoning) | Anthropic | 0.448677248677249 | 2025-05-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 0.655026455026455 | 2025-05-22 | evidence |
| Claude 4.1 Opus (Reasoning) | Anthropic | 0.6535448276 | 2025-08-05 | evidence |
| Claude 4.5 Haiku (Non-reasoning) | Anthropic | 0.511111111111111 | 2025-10-15 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.614814814814815 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 0.59047619047619 | 2025-09-29 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 0.714285714285714 | 2025-09-29 | evidence |
| Claude Instant | Anthropic | 0.108994708994709 | 2023-03-14 | evidence |
| Claude Opus 4.5 (Non-reasoning) | Anthropic | 0.737566137566138 | 2025-11-24 | evidence |
| Claude Opus 4.5 (Reasoning) | Anthropic | 0.870899470899471 | 2025-11-24 | evidence |
| Cogito v2.1 (Reasoning) | Deep Cogito | 0.687830687830688 | 2025-11-18 | evidence |
| Command A | Cohere | 0.286772486772487 | 2025-03-13 | evidence |
| Command-R (Mar '24) | Cohere | 0.0476190476190476 | 2024-03-12 | evidence |
| Command-R+ (Apr '24) | Cohere | 0.121693121693122 | 2024-04-04 | evidence |
| DBRX Instruct | Databricks | 0.0931216931216931 | 2024-03-27 | evidence |
| DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) | Nous Research | 0.0846560846560847 | 2025-02-13 | evidence |
| DeepHermes 3 - Mistral 24B Preview (Non-reasoning) | Nous Research | 0.194708994708995 | 2025-03-13 | evidence |
| DeepSeek Coder V2 Lite Instruct | DeepSeek | 0.157671957671958 | 2024-06-17 | evidence |
| DeepSeek R1 (Jan '25) | DeepSeek | 0.616931216931217 | 2025-01-20 | evidence |
| DeepSeek R1 0528 (May '25) | DeepSeek | 0.77037037037037 | 2025-05-28 | evidence |
| DeepSeek R1 0528 Qwen3 8B | DeepSeek | 0.513227513227513 | 2025-05-29 | evidence |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 0.265608465608466 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Llama 8B | DeepSeek | 0.232804232804233 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 0.0698412698412698 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 0.375661375661376 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 0.26984126984127 | 2025-01-20 | evidence |
| DeepSeek V3 (Dec '24) | DeepSeek | 0.358730158730159 | 2024-12-26 | evidence |
| DeepSeek V3 0324 | DeepSeek | 0.405291005291005 | 2025-03-25 | evidence |
| DeepSeek V3.1 (Non-reasoning) | DeepSeek | 0.576719576719577 | 2025-08-21 | evidence |
| DeepSeek V3.1 (Reasoning) | DeepSeek | 0.784126984126984 | 2025-08-21 | evidence |
| DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 0.529100529100529 | 2025-09-22 | evidence |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 0.797883597883598 | 2025-09-22 | evidence |
| DeepSeek V3.2 (Non-reasoning) | DeepSeek | 0.592592592592593 | 2025-12-01 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 0.862433862433862 | 2025-12-01 | evidence |
| DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 0.554497354497354 | 2025-09-29 | evidence |
| DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 0.789417989417989 | 2025-09-29 | evidence |
| DeepSeek V3.2 Speciale | DeepSeek | 0.896296296296296 | 2025-12-01 | evidence |
| Devstral 2 | Mistral | 0.447619047619048 | 2025-12-09 | evidence |
| Devstral Medium | Mistral | 0.336507936507937 | 2025-07-10 | evidence |
| Devstral Small (Jul '25) | Mistral | 0.253968253968254 | 2025-07-10 | evidence |
| Devstral Small (May '25) | Mistral | 0.258201058201058 | 2025-05-21 | evidence |
| Devstral Small 2 | Mistral | 0.348148148148148 | 2025-12-09 | evidence |
| Doubao Seed Code | ByteDance Seed | 0.766137566137566 | 2025-11-11 | evidence |
| ERNIE 4.5 300B A47B | Baidu | 0.466666666666667 | 2025-06-30 | evidence |
| ERNIE 5.0 Thinking Preview | Baidu | 0.811640211640211 | 2025-11-13 | evidence |
| Exaone 4.0 1.2B (Non-reasoning) | LG AI Research | 0.293121693121693 | 2025-07-15 | evidence |
| Exaone 4.0 1.2B (Reasoning) | LG AI Research | 0.516402116402116 | 2025-07-15 | evidence |
| EXAONE 4.0 32B (Non-reasoning) | LG AI Research | 0.471957671957672 | 2025-07-15 | evidence |
| EXAONE 4.0 32B (Reasoning) | LG AI Research | 0.747089947089947 | 2025-07-15 | evidence |
| Falcon-H1R-7B | TII UAE | 0.723809523809524 | 2026-01-04 | evidence |
| Gemini 1.0 Pro | 0.116402116402116 | 2023-12-06 | evidence | |
| Gemini 1.5 Flash (May '24) | 0.195767195767196 | 2024-05-14 | evidence | |
| Gemini 1.5 Flash (Sep '24) | 0.273015873015873 | 2024-09-24 | evidence | |
| Gemini 1.5 Flash-8B | 0.216931216931217 | 2024-10-03 | evidence | |
| Gemini 1.5 Pro (May '24) | 0.244444444444444 | 2024-05-15 | evidence | |
| Gemini 1.5 Pro (Sep '24) | 0.316402116402116 | 2024-09-24 | evidence | |
| Gemini 2.0 Flash (experimental) | 0.20952380952381 | 2024-12-11 | evidence | |
| Gemini 2.0 Flash (Feb '25) | 0.334391534391534 | 2025-02-05 | evidence | |
| Gemini 2.0 Flash Thinking Experimental (Jan '25) | 0.320634920634921 | 2025-01-21 | evidence | |
| Gemini 2.0 Flash-Lite (Feb '25) | 0.185185185185185 | 2025-02-25 | evidence | |
| Gemini 2.0 Flash-Lite (Preview) | 0.178835978835979 | 2025-02-05 | evidence | |
| Gemini 2.0 Pro Experimental (Feb '25) | 0.347089947089947 | 2025-02-05 | evidence | |
| Gemini 2.5 Flash (Non-reasoning) | 0.495238095238095 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash (Reasoning) | 0.695238095238095 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash Preview (Non-reasoning) | 0.406349206349206 | 2025-04-17 | evidence | |
| Gemini 2.5 Flash Preview (Reasoning) | 0.504761904761905 | 2025-04-17 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 0.625396825396825 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 0.713227513227513 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite (Non-reasoning) | 0.4 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite (Reasoning) | 0.592592592592593 | 2025-06-17 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 0.641269841269841 | 2025-09-25 | evidence | |
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 0.687830687830688 | 2025-09-08 | evidence | |
| Gemini 2.5 Pro | 0.801058201058201 | 2025-06-05 | evidence | |
| Gemini 2.5 Pro Preview (Mar' 25) | 0.777777777777778 | 2025-03-25 | evidence | |
| Gemini 2.5 Pro Preview (May' 25) | 0.77037037037037 | 2025-05-06 | evidence | |
| Gemini 3 Flash Preview (Non-reasoning) | 0.796825396825397 | 2025-12-17 | evidence | |
| Gemini 3 Flash Preview (Reasoning) | 0.907936507936508 | 2025-12-17 | evidence | |
| Gemini 3 Pro Preview (high) | 0.917460317460317 | 2025-11-18 | evidence | |
| Gemini 3 Pro Preview (low) | 0.857142857142857 | 2025-11-18 | evidence | |
| Gemma 3 12B Instruct | 0.136507936507936 | 2025-03-12 | evidence | |
| Gemma 3 1B Instruct | 0.0169312169312169 | 2025-03-13 | evidence | |
| Gemma 3 270M | 0.00317460317460317 | 2025-08-14 | evidence | |
| Gemma 3 27B Instruct | 0.136507936507936 | 2025-03-12 | evidence | |
| Gemma 3 4B Instruct | 0.112169312169312 | 2025-03-12 | evidence | |
| Gemma 3n E2B Instruct | 0.0952380952380952 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instruct | 0.146031746031746 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instruct Preview (May '25) | 0.137566137566138 | 2025-05-20 | evidence | |
| GLM-4.5 (Reasoning) | Z.ai | 0.737566137566138 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.683597883597884 | 2025-07-28 | evidence |
| GLM-4.5V (Non-reasoning) | Z.ai | 0.352380952380952 | 2025-08-11 | evidence |
| GLM-4.5V (Reasoning) | Z.ai | 0.604232804232804 | 2025-08-11 | evidence |
| GLM-4.6 (Non-reasoning) | Z.ai | 0.560846560846561 | 2025-09-30 | evidence |
| GLM-4.6 (Reasoning) | Z.ai | 0.695238095238095 | 2025-09-30 | evidence |
| GLM-4.6V (Non-reasoning) | Z.ai | 0.410582010582011 | 2025-12-08 | evidence |
| GLM-4.6V (Reasoning) | Z.ai | 0.15978835978836 | 2025-12-08 | evidence |
| GLM-4.7 (Non-reasoning) | Z.ai | 0.561904761904762 | 2025-12-22 | evidence |
| GLM-4.7 (Reasoning) | Z.ai | 0.894179894179894 | 2025-12-22 | evidence |
| GPT-4 Turbo | OpenAI | 0.291005291005291 | 2023-11-06 | evidence |
| GPT-4.1 | OpenAI | 0.457142857142857 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.482539682539683 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.325925925925926 | 2025-04-14 | evidence |
| GPT-4o (Aug '24) | OpenAI | 0.317460317460317 | 2024-08-06 | evidence |
| GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 0.425396825396825 | 2025-03-27 | evidence |
| GPT-4o (May '24) | OpenAI | 0.334391534391534 | 2024-05-13 | evidence |
| GPT-4o (Nov '24) | OpenAI | 0.308994708994709 | 2024-11-20 | evidence |
| GPT-4o mini | OpenAI | 0.233862433862434 | 2024-07-18 | evidence |
| GPT-5 (ChatGPT) | OpenAI | 0.542857142857143 | 2025-08-07 | evidence |
| GPT-5 (high) | OpenAI | 0.845502645502646 | 2025-08-07 | evidence |
| GPT-5 (low) | OpenAI | 0.762962962962963 | 2025-08-07 | evidence |
| GPT-5 (medium) | OpenAI | 0.702645502645503 | 2025-08-07 | evidence |
| GPT-5 (minimal) | OpenAI | 0.557671957671958 | 2025-08-07 | evidence |
| GPT-5 Codex (high) | OpenAI | 0.84021164021164 | 2025-09-23 | evidence |
| GPT-5 mini (high) | OpenAI | 0.838095238095238 | 2025-08-07 | evidence |
| GPT-5 mini (medium) | OpenAI | 0.692063492063492 | 2025-08-07 | evidence |
| GPT-5 mini (minimal) | OpenAI | 0.544973544973545 | 2025-08-07 | evidence |
| GPT-5 nano (high) | OpenAI | 0.789417989417989 | 2025-08-07 | evidence |
| GPT-5 nano (medium) | OpenAI | 0.762962962962963 | 2025-08-07 | evidence |
| GPT-5 nano (minimal) | OpenAI | 0.46984126984127 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 0.867724867724868 | 2025-11-13 | evidence |
| GPT-5.1 (Non-reasoning) | OpenAI | 0.494179894179894 | 2025-11-13 | evidence |
| GPT-5.1 Codex (high) | OpenAI | 0.848677248677249 | 2025-11-13 | evidence |
| GPT-5.1 Codex mini (high) | OpenAI | 0.835978835978836 | 2025-11-13 | evidence |
| GPT-5.2 (medium) | OpenAI | 0.894179894179894 | 2025-12-11 | evidence |
| GPT-5.2 (Non-reasoning) | OpenAI | 0.668783068783069 | 2025-12-11 | evidence |
| GPT-5.2 (xhigh) | OpenAI | 0.888888888888889 | 2025-12-11 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.878306878306878 | 2025-08-05 | evidence |
| gpt-oss-120b (low) | OpenAI | 0.706878306878307 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.776719576719577 | 2025-08-05 | evidence |
| gpt-oss-20b (low) | OpenAI | 0.651851851851852 | 2025-08-05 | evidence |
| Granite 3.3 8B (Non-reasoning) | IBM | 0.126984126984127 | 2025-04-16 | evidence |
| Granite 4.0 1B | IBM | 0.0465608465608466 | 2025-10-28 | evidence |
| Granite 4.0 350M | IBM | 0.0243386243386243 | 2025-10-28 | evidence |
| Granite 4.0 H 1B | IBM | 0.115343915343915 | 2025-10-28 | evidence |
| Granite 4.0 H 350M | IBM | 0.019047619047619 | 2025-10-28 | evidence |
| Granite 4.0 H Small | IBM | 0.250793650793651 | 2025-09-22 | evidence |
| Granite 4.0 Micro | IBM | 0.17989417989418 | 2025-09-22 | evidence |
| Grok 2 (Dec '24) | xAI | 0.266666666666667 | 2024-12-12 | evidence |
| Grok 3 | xAI | 0.425396825396825 | 2025-02-19 | evidence |
| Grok 3 mini Reasoning (high) | xAI | 0.696296296296296 | 2025-02-19 | evidence |
| Grok 4 | xAI | 0.819047619047619 | 2025-07-10 | evidence |
| Grok 4 Fast (Non-reasoning) | xAI | 0.401058201058201 | 2025-09-19 | evidence |
| Grok 4 Fast (Reasoning) | xAI | 0.831746031746032 | 2025-09-19 | evidence |
| Grok 4.1 Fast (Non-reasoning) | xAI | 0.398941798941799 | 2025-11-19 | evidence |
| Grok 4.1 Fast (Reasoning) | xAI | 0.822222222222222 | 2025-11-19 | evidence |
| Grok Beta | xAI | 0.241269841269841 | 2024-08-13 | evidence |
| Grok Code Fast 1 | xAI | 0.657142857142857 | 2025-08-28 | evidence |
| Hermes 3 - Llama-3.1 70B | Nous Research | 0.188359788359788 | 2024-08-15 | evidence |
| Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 0.546031746031746 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 0.685714285714286 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 0.268783068783069 | 2025-08-27 | evidence |
| Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 0.652910052910053 | 2025-08-27 | evidence |
| HyperCLOVA X SEED Think (32B) | Naver | 0.628571428571429 | 2025-12-26 | evidence |
| INTELLECT-3 | Prime Intellect | 0.776719576719577 | 2025-11-27 | evidence |
| Jamba 1.5 Large | AI21 Labs | 0.142857142857143 | 2024-08-22 | evidence |
| Jamba 1.5 Mini | AI21 Labs | 0.0624338624338624 | 2024-08-22 | evidence |
| Jamba 1.6 Large | AI21 Labs | 0.172486772486772 | 2025-03-06 | evidence |
| Jamba 1.6 Mini | AI21 Labs | 0.0708994708994709 | 2025-03-06 | evidence |
| Jamba 1.7 Large | AI21 Labs | 0.180952380952381 | 2025-07-07 | evidence |
| Jamba 1.7 Mini | AI21 Labs | 0.0613756613756614 | 2025-07-07 | evidence |
| Jamba Reasoning 3B | AI21 Labs | 0.20952380952381 | 2025-10-08 | evidence |
| K-EXAONE (Reasoning) | LG AI Research | 0.768253968253968 | 2025-12-31 | evidence |
| K2-V2 (high) | MBZUAI Institute of Foundation Models | 0.694179894179894 | 2025-12-05 | evidence |
| K2-V2 (low) | MBZUAI Institute of Foundation Models | 0.392592592592593 | 2025-12-05 | evidence |
| K2-V2 (medium) | MBZUAI Institute of Foundation Models | 0.540740740740741 | 2025-12-05 | evidence |
| KAT-Coder-Pro V1 | KwaiKAT | 0.747089947089947 | 2025-11-11 | evidence |
| Kimi K2 | Moonshot AI | 0.555555555555556 | 2025-07-11 | evidence |
| Kimi K2 0905 | Moonshot AI | 0.60952380952381 | 2025-09-05 | evidence |
| Kimi K2 Thinking | Moonshot AI | 0.852910052910053 | 2025-11-06 | evidence |
| Kimi Linear 48B A3B Instruct | Moonshot AI | 0.377777777777778 | 2025-10-30 | evidence |
| LFM 40B | Liquid AI | 0.0962962962962963 | 2024-09-30 | evidence |
| LFM2 1.2B | Liquid AI | 0.0201058201058201 | 2025-07-10 | evidence |
| LFM2 2.6B | Liquid AI | 0.0814814814814815 | 2025-09-23 | evidence |
| LFM2 8B A1B | Liquid AI | 0.151322751322751 | 2025-10-07 | evidence |
| Ling-1T | InclusionAI | 0.677248677248677 | 2025-10-08 | evidence |
| Ling-flash-2.0 | InclusionAI | 0.58941798941799 | 2025-09-17 | evidence |
| Ling-mini-2.0 | InclusionAI | 0.428571428571429 | 2025-09-09 | evidence |
| Llama 2 Chat 13B | Meta | 0.0984126984126984 | 2023-07-18 | evidence |
| Llama 2 Chat 70B | Meta | 0.0984126984126984 | 2023-07-18 | evidence |
| Llama 2 Chat 7B | Meta | 0.00211640211640212 | 2023-07-18 | evidence |
| Llama 3 Instruct 70B | Meta | 0.197883597883598 | 2024-04-18 | evidence |
| Llama 3 Instruct 8B | Meta | 0.0962962962962963 | 2024-04-18 | evidence |
| Llama 3.1 Instruct 405B | Meta | 0.304761904761905 | 2024-07-23 | evidence |
| Llama 3.1 Instruct 70B | Meta | 0.231746031746032 | 2024-07-23 | evidence |
| Llama 3.1 Instruct 8B | Meta | 0.116402116402116 | 2024-07-23 | evidence |
| Llama 3.1 Nemotron Instruct 70B | NVIDIA | 0.169312169312169 | 2024-10-15 | evidence |
| Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | NVIDIA | 0.493121693121693 | 2025-05-20 | evidence |
| Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 0.641269841269841 | 2025-04-07 | evidence |
| Llama 3.1 Tulu3 405B | Allen Institute for AI | 0.291005291005291 | 2025-01-30 | evidence |
| Llama 3.2 Instruct 11B (Vision) | Meta | 0.11005291005291 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 1B | Meta | 0.019047619047619 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 3B | Meta | 0.0825396825396825 | 2024-09-25 | evidence |
| Llama 3.2 Instruct 90B (Vision) | Meta | 0.213756613756614 | 2024-09-25 | evidence |
| Llama 3.3 Instruct 70B | Meta | 0.287830687830688 | 2024-12-06 | evidence |
| Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | NVIDIA | 0.28042328042328 | 2025-03-18 | evidence |
| Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 0.277248677248677 | 2025-03-18 | evidence |
| Llama 4 Maverick | Meta | 0.396825396825397 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.299470899470899 | 2025-04-05 | evidence |
| Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 0.28994708994709 | 2025-07-25 | evidence |
| Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 0.736507936507937 | 2025-07-25 | evidence |
| Magistral Medium 1 | Mistral | 0.526984126984127 | 2025-06-10 | evidence |
| Magistral Medium 1.2 | Mistral | 0.75026455026455 | 2025-09-18 | evidence |
| Magistral Small 1 | Mistral | 0.514285714285714 | 2025-06-10 | evidence |
| Magistral Small 1.2 | Mistral | 0.722751322751323 | 2025-09-17 | evidence |
| Mi:dm K 2.5 Pro | Korea Telecom | 0.656084656084656 | 2025-12-11 | evidence |
| Mi:dm K 2.5 Pro Preview | Korea Telecom | 0.575661375661376 | 2025-12-11 | evidence |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 0.402116402116402 | 2025-12-16 | evidence |
| MiMo-V2-Flash (Reasoning) | Xiaomi | 0.867724867724868 | 2025-12-16 | evidence |
| MiniMax M1 40k | MiniMax | 0.657142857142857 | 2025-06-17 | evidence |
| MiniMax M1 80k | MiniMax | 0.711111111111111 | 2025-06-17 | evidence |
| MiniMax-M2 | MiniMax | 0.826455026455027 | 2025-10-26 | evidence |
| MiniMax-M2.1 | MiniMax | 0.80952380952381 | 2025-12-23 | evidence |
| Ministral 3 14B | Mistral | 0.351322751322751 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 0.246560846560847 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 0.302645502645503 | 2025-12-02 | evidence |
| Mistral 7B Instruct | Mistral | 0.0455026455026455 | 2023-09-27 | evidence |
| Mistral Large (Feb '24) | Mistral | 0.177777777777778 | 2024-02-26 | evidence |
| Mistral Large 2 (Jul '24) | Mistral | 0.266666666666667 | 2024-07-24 | evidence |
| Mistral Large 2 (Nov '24) | Mistral | 0.293121693121693 | 2024-11-18 | evidence |
| Mistral Large 3 | Mistral | 0.464550264550264 | 2025-12-02 | evidence |
| Mistral Medium | Mistral | 0.0994708994708995 | 2023-12-11 | evidence |
| Mistral Medium 3 | Mistral | 0.4 | 2025-05-07 | evidence |
| Mistral Medium 3.1 | Mistral | 0.406349206349206 | 2025-08-12 | evidence |
| Mistral Small (Feb '24) | Mistral | 0.111111111111111 | 2024-02-26 | evidence |
| Mistral Small (Sep '24) | Mistral | 0.140740740740741 | 2024-09-17 | evidence |
| Mistral Small 3 | Mistral | 0.251851851851852 | 2025-01-30 | evidence |
| Mistral Small 3.1 | Mistral | 0.211640211640212 | 2025-03-17 | evidence |
| Mistral Small 3.2 | Mistral | 0.275132275132275 | 2025-06-20 | evidence |
| Mixtral 8x22B Instruct | Mistral | 0.148148148148148 | 2024-04-17 | evidence |
| Mixtral 8x7B Instruct | Mistral | 0.0656084656084656 | 2023-12-11 | evidence |
| Molmo 7B-D | Allen Institute for AI | 0.0391534391534391 | 2024-09-25 | evidence |
| Motif-2-12.7B-Reasoning | Motif Technologies | 0.650793650793651 | 2025-12-04 | evidence |
| Nova 2.0 Lite (high) | Amazon | 0.711111111111111 | 2025-10-29 | evidence |
| Nova 2.0 Lite (low) | Amazon | 0.468783068783069 | 2025-10-29 | evidence |
| Nova 2.0 Lite (medium) | Amazon | 0.663492063492063 | 2025-10-29 | evidence |
| Nova 2.0 Lite (Non-reasoning) | Amazon | 0.346031746031746 | 2025-10-29 | evidence |
| Nova 2.0 Omni (low) | Amazon | 0.591534391534391 | 2025-11-26 | evidence |
| Nova 2.0 Omni (medium) | Amazon | 0.66031746031746 | 2025-11-26 | evidence |
| Nova 2.0 Omni (Non-reasoning) | Amazon | 0.304761904761905 | 2025-11-26 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 0.638095238095238 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.73015873015873 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 0.473015873015873 | 2025-11-27 | evidence |
| Nova Lite | Amazon | 0.167195767195767 | 2024-12-03 | evidence |
| Nova Micro | Amazon | 0.13968253968254 | 2024-12-03 | evidence |
| Nova Premier | Amazon | 0.317460317460317 | 2025-04-30 | evidence |
| Nova Pro | Amazon | 0.232804232804233 | 2024-12-03 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 0.35978835978836 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 0.740740740740741 | 2025-12-15 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 0.344973544973545 | 2025-10-28 | evidence |
| NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 0.694179894179894 | 2025-10-28 | evidence |
| NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 0.700529100529101 | 2025-08-18 | evidence |
| NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 0.723809523809524 | 2025-08-18 | evidence |
| o1 | OpenAI | 0.679365079365079 | 2024-12-05 | evidence |
| o1-mini | OpenAI | 0.575661375661376 | 2024-09-12 | evidence |
| o3 | OpenAI | 0.808465608465608 | 2025-04-16 | evidence |
| o3-mini | OpenAI | 0.717460317460317 | 2025-01-31 | evidence |
| o3-mini (high) | OpenAI | 0.734391534391534 | 2025-01-31 | evidence |
| o4-mini (high) | OpenAI | 0.859259259259259 | 2025-04-16 | evidence |
| OLMo 2 32B | Allen Institute for AI | 0.0677248677248677 | 2025-03-13 | evidence |
| OLMo 2 7B | Allen Institute for AI | 0.0412698412698413 | 2024-11-26 | evidence |
| Olmo 3 32B Think | Allen Institute for AI | 0.671957671957672 | 2025-11-20 | evidence |
| Olmo 3 7B Instruct | Allen Institute for AI | 0.265608465608466 | 2025-11-20 | evidence |
| Olmo 3 7B Think | Allen Institute for AI | 0.616931216931217 | 2025-11-20 | evidence |
| Olmo 3.1 32B Think | Allen Institute for AI | 0.695238095238095 | 2025-12-12 | evidence |
| OpenChat 3.5 (1210) | OpenChat | 0.115343915343915 | 2023-12-18 | evidence |
| Phi-3 Mini Instruct 3.8B | Microsoft | 0.116402116402116 | 2024-04-23 | evidence |
| Phi-4 | Microsoft | 0.230687830687831 | 2024-12-12 | evidence |
| Phi-4 Mini Instruct | Microsoft | 0.125925925925926 | 2024-02-26 | evidence |
| Phi-4 Multimodal Instruct | Microsoft | 0.131216931216931 | 2025-02-26 | evidence |
| Pixtral Large | Mistral | 0.261375661375661 | 2024-11-18 | evidence |
| Qwen2 Instruct 72B | Qwen | 0.158730158730159 | 2024-06-07 | evidence |
| Qwen2.5 Coder Instruct 32B | Qwen | 0.295238095238095 | 2024-11-11 | evidence |
| Qwen2.5 Coder Instruct 7B | Qwen | 0.125925925925926 | 2024-09-19 | evidence |
| Qwen2.5 Instruct 32B | Qwen | 0.247619047619048 | 2024-09-19 | evidence |
| Qwen2.5 Instruct 72B | Qwen | 0.276190476190476 | 2024-09-19 | evidence |
| Qwen2.5 Max | Qwen | 0.358730158730159 | 2025-01-28 | evidence |
| Qwen2.5 Turbo | Qwen | 0.162962962962963 | 2024-11-18 | evidence |
| Qwen3 0.6B (Non-reasoning) | Qwen | 0.073015873015873 | 2025-04-28 | evidence |
| Qwen3 0.6B (Reasoning) | Qwen | 0.120634920634921 | 2025-04-28 | evidence |
| Qwen3 1.7B (Non-reasoning) | Qwen | 0.125925925925926 | 2025-04-28 | evidence |
| Qwen3 1.7B (Reasoning) | Qwen | 0.307936507936508 | 2025-04-28 | evidence |
| Qwen3 14B (Non-reasoning) | Qwen | 0.28042328042328 | 2025-04-28 | evidence |
| Qwen3 14B (Reasoning) | Qwen | 0.522751322751323 | 2025-04-28 | evidence |
| Qwen3 235B A22B (Non-reasoning) | Qwen | 0.342857142857143 | 2025-04-28 | evidence |
| Qwen3 235B A22B (Reasoning) | Qwen | 0.622222222222222 | 2025-04-28 | evidence |
| Qwen3 235B A22B 2507 (Reasoning) | Qwen | 0.788359788359788 | 2025-07-25 | evidence |
| Qwen3 235B A22B 2507 Instruct | Qwen | 0.523809523809524 | 2025-07-21 | evidence |
| Qwen3 30B A3B (Non-reasoning) | Qwen | 0.321693121693122 | 2025-04-28 | evidence |
| Qwen3 30B A3B (Reasoning) | Qwen | 0.505820105820106 | 2025-04-28 | evidence |
| Qwen3 30B A3B 2507 (Reasoning) | Qwen | 0.706878306878307 | 2025-07-30 | evidence |
| Qwen3 30B A3B 2507 Instruct | Qwen | 0.515343915343915 | 2025-07-29 | evidence |
| Qwen3 32B (Non-reasoning) | Qwen | 0.287830687830688 | 2025-04-28 | evidence |
| Qwen3 32B (Reasoning) | Qwen | 0.546031746031746 | 2025-04-28 | evidence |
| Qwen3 4B (Non-reasoning) | Qwen | 0.232804232804233 | 2025-04-28 | evidence |
| Qwen3 4B (Reasoning) | Qwen | 0.464550264550264 | 2025-04-28 | evidence |
| Qwen3 4B 2507 (Reasoning) | Qwen | 0.641269841269841 | 2025-08-06 | evidence |
| Qwen3 4B 2507 Instruct | Qwen | 0.376719576719577 | 2025-08-06 | evidence |
| Qwen3 8B (Non-reasoning) | Qwen | 0.202116402116402 | 2025-04-28 | evidence |
| Qwen3 8B (Reasoning) | Qwen | 0.406349206349206 | 2025-04-28 | evidence |
| Qwen3 Coder 30B A3B Instruct | Qwen | 0.403174603174603 | 2025-07-31 | evidence |
| Qwen3 Coder 480B A35B Instruct | Qwen | 0.585185185185185 | 2025-07-22 | evidence |
| Qwen3 Max | Qwen | 0.767195767195767 | 2025-09-23 | evidence |
| Qwen3 Max (Preview) | Qwen | 0.650793650793651 | 2025-09-05 | evidence |
| Qwen3 Max Thinking (Preview) | Qwen | 0.535449735449735 | 2025-11-03 | evidence |
| Qwen3 Next 80B A3B (Reasoning) | Qwen | 0.784126984126984 | 2025-09-11 | evidence |
| Qwen3 Next 80B A3B Instruct | Qwen | 0.683597883597884 | 2025-09-11 | evidence |
| Qwen3 Omni 30B A3B (Reasoning) | Qwen | 0.679365079365079 | 2025-09-22 | evidence |
| Qwen3 Omni 30B A3B Instruct | Qwen | 0.422222222222222 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B (Reasoning) | Qwen | 0.645502645502645 | 2025-09-23 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.593650793650794 | 2025-09-23 | evidence |
| Qwen3 VL 30B A3B (Reasoning) | Qwen | 0.697354497354497 | 2025-10-03 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.476190476190476 | 2025-10-03 | evidence |
| Qwen3 VL 32B (Reasoning) | Qwen | 0.737566137566138 | 2025-10-21 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.514285714285714 | 2025-10-21 | evidence |
| Qwen3 VL 4B (Reasoning) | Qwen | 0.31957671957672 | 2025-10-14 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.28994708994709 | 2025-10-14 | evidence |
| Qwen3 VL 8B (Reasoning) | Qwen | 0.353439153439153 | 2025-10-14 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.332275132275132 | 2025-10-14 | evidence |
| QwQ 32B | Qwen | 0.630687830687831 | 2025-03-05 | evidence |
| QwQ 32B-Preview | Qwen | 0.336507936507937 | 2024-11-27 | evidence |
| Reka Flash 3 | Reka AI | 0.434920634920635 | 2025-03-10 | evidence |
| Ring-1T | InclusionAI | 0.643386243386243 | 2025-10-13 | evidence |
| Ring-flash-2.0 | InclusionAI | 0.627513227513227 | 2025-09-19 | evidence |
| Sarvam M (Reasoning) | Sarvam | 0.295238095238095 | 2025-05-23 | evidence |
| Seed-OSS-36B-Instruct | ByteDance Seed | 0.765079365079365 | 2025-08-20 | evidence |
| Solar Pro 2 (Non-reasoning) | Upstage | 0.424338624338624 | 2025-07-09 | evidence |
| Solar Pro 2 (Preview) (Non-reasoning) | Upstage | 0.385185185185185 | 2025-05-20 | evidence |
| Solar Pro 2 (Preview) (Reasoning) | Upstage | 0.462433862433862 | 2025-05-20 | evidence |
| Solar Pro 2 (Reasoning) | Upstage | 0.615873015873016 | 2025-07-09 | evidence |
| Sonar | Perplexity | 0.295238095238095 | 2025-01-21 | evidence |
| Sonar Pro | Perplexity | 0.275132275132275 | 2025-01-21 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.