Benchmark
GDPval-AA v2 (Elo)
Agentic real-world work tasks
- Categories
- intelligence-index, agentic
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 213
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| A.X-K2 | SK Telecom | 1113.44 | 2026-08-12 | evidence |
| Agnes 2.5 Pro Alpha | Sapiens AI | 1171.16 | 2026-07-24 | evidence |
| Celeris-1 | Celeris | 535.69 | 2026-07-24 | evidence |
| Claude 3.5 Haiku | Anthropic | 458.09 | 2024-10-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 874.08 | 2025-05-22 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 913.63 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 1055.81 | 2025-09-29 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 1730.83 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 1485.91 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 1581.94 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 1725.71 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 1455.08 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 1834.67 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 1615.81 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 1811.01 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 1373.82 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, High Effort) | Anthropic | 1400.85 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | 1219.17 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 1592.63 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 1300.97 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 1497.07 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 1367.85 | 2026-06-30 | evidence |
| Command A+ | Cohere | 713.76 | 2026-05-20 | evidence |
| DeepSeek R1 (Jan '25) | DeepSeek | 529.99 | 2025-01-20 | evidence |
| DeepSeek V3 (Dec '24) | DeepSeek | 231.74 | 2024-12-26 | evidence |
| DeepSeek V3 0324 | DeepSeek | 324.57 | 2025-03-25 | evidence |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 882.73 | 2025-09-22 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 865.03 | 2025-12-01 | evidence |
| DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 1154.53 | 2026-04-24 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 1189.97 | 2026-04-24 | evidence |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 1558.52 | 2026-07-31 | evidence |
| DeepSeek V4 Flash Vision (Reasoning, Max Effort) | DeepSeek | 1674.88 | 2026-08-21 | evidence |
| DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 1291.45 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 1302.91 | 2026-04-24 | evidence |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 1585.75 | 2026-08-13 | evidence |
| Devstral 2 | Mistral | 741.9 | 2025-12-09 | evidence |
| Devstral Small 2 | Mistral | 733.79 | 2025-12-09 | evidence |
| DiffusionGemma 26B A4B | 553.25 | 2026-06-10 | evidence | |
| EXAONE 4.5 33B | LG AI Research | 681.51 | 2026-04-09 | evidence |
| G9v3-39A5B | AI9Stars | 1265.22 | 2026-08-20 | evidence |
| G9v3-3B | AI9Stars | 863.41 | 2026-07-23 | evidence |
| Gemini 2.5 Pro | 670.45 | 2025-06-05 | evidence | |
| Gemini 3.1 Flash-Lite | 647.33 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 964.55 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 1341.34 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash-Lite | 1140.01 | 2026-07-21 | evidence | |
| Gemini 3.6 Flash (high) | 1419.09 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 1527.11 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (low) | 1452.41 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (medium) | 1496.26 | 2026-08-13 | evidence | |
| Gemma 3 12B Instruct | -121.39 | 2025-03-12 | evidence | |
| Gemma 3 27B Instruct | -122.08 | 2025-03-12 | evidence | |
| Gemma 4 12B (Reasoning) | 643.79 | 2026-06-03 | evidence | |
| Gemma 4 26B A4B (Reasoning) | 767.38 | 2026-04-02 | evidence | |
| Gemma 4 31B (Non-reasoning) | 747.11 | 2026-04-02 | evidence | |
| Gemma 4 31B (Reasoning) | 810.86 | 2026-04-02 | evidence | |
| Gemma 4 E2B (Reasoning) | 85.98 | 2026-04-02 | evidence | |
| Gemma 4 E4B (Reasoning) | 228.91 | 2026-04-03 | evidence | |
| GLM-4.6 (Reasoning) | Z.ai | 934.33 | 2025-09-30 | evidence |
| GLM-4.7 (Reasoning) | Z.ai | 1167.84 | 2025-12-22 | evidence |
| GLM-5.1 (Reasoning) | Z.ai | 1257 | 2026-04-07 | evidence |
| GLM-5.2 (max) | Z.ai | 1505.12 | 2026-06-16 | evidence |
| GLM-5.2 (Non-reasoning) | Z.ai | 1393.47 | 2026-06-16 | evidence |
| GLM-5.3 (max) | Z.ai | 1765.86 | 2026-08-18 | evidence |
| GPT-4 | OpenAI | 239.21 | 2023-03-14 | evidence |
| GPT-4.1 mini | OpenAI | 506.24 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 60.08 | 2025-04-14 | evidence |
| GPT-4o mini | OpenAI | 237.68 | 2024-07-18 | evidence |
| GPT-5 (high) | OpenAI | 1084.99 | 2025-08-07 | evidence |
| GPT-5 mini (high) | OpenAI | 939.88 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 995.58 | 2025-11-13 | evidence |
| GPT-5.4 (xhigh) | OpenAI | 1391.79 | 2026-03-05 | evidence |
| GPT-5.4 mini (Non-Reasoning) | OpenAI | 791 | 2026-03-17 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 1169.72 | 2026-03-17 | evidence |
| GPT-5.4 nano (Non-Reasoning) | OpenAI | 736.92 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 1104.6 | 2026-03-17 | evidence |
| GPT-5.5 (high) | OpenAI | 1464.04 | 2026-04-23 | evidence |
| GPT-5.5 (low) | OpenAI | 1186.39 | 2026-04-23 | evidence |
| GPT-5.5 (medium) | OpenAI | 1373.59 | 2026-04-23 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 1124.79 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 1488.58 | 2026-04-23 | evidence |
| GPT-5.5 Instant (June 2026) | OpenAI | 716.09 | 2026-06-25 | evidence |
| GPT-5.6 Luna (high) | OpenAI | 1465 | 2026-07-09 | evidence |
| GPT-5.6 Luna (low) | OpenAI | 1155 | 2026-07-09 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 1577.39 | 2026-07-09 | evidence |
| GPT-5.6 Luna (medium) | OpenAI | 1272.79 | 2026-07-09 | evidence |
| GPT-5.6 Luna (Non-reasoning) | OpenAI | 1074.06 | 2026-07-09 | evidence |
| GPT-5.6 Luna (xhigh) | OpenAI | 1524.32 | 2026-07-09 | evidence |
| GPT-5.6 Sol (high) | OpenAI | 1617.11 | 2026-07-09 | evidence |
| GPT-5.6 Sol (low) | OpenAI | 1442.67 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 1716 | 2026-07-09 | evidence |
| GPT-5.6 Sol (medium) | OpenAI | 1547.46 | 2026-07-09 | evidence |
| GPT-5.6 Sol (Non-reasoning) | OpenAI | 1380.37 | 2026-07-09 | evidence |
| GPT-5.6 Sol (xhigh) | OpenAI | 1675.09 | 2026-07-09 | evidence |
| GPT-5.6 Terra (high) | OpenAI | 1509.49 | 2026-07-09 | evidence |
| GPT-5.6 Terra (low) | OpenAI | 1256.34 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 1573.13 | 2026-07-09 | evidence |
| GPT-5.6 Terra (medium) | OpenAI | 1406.21 | 2026-07-09 | evidence |
| GPT-5.6 Terra (Non-reasoning) | OpenAI | 1244.21 | 2026-07-09 | evidence |
| GPT-5.6 Terra (xhigh) | OpenAI | 1572.09 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 799.7 | 2025-08-05 | evidence |
| gpt-oss-120b (low) | OpenAI | 411.95 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 565.68 | 2025-08-05 | evidence |
| Granite 4.1 30B | IBM | 429.74 | 2026-04-29 | evidence |
| Granite 4.1 3B | IBM | 122.77 | 2026-04-29 | evidence |
| Grok 4.3 (high) | xAI | 1088.27 | 2026-04-30 | evidence |
| Grok 4.3 (Non-reasoning) | xAI | 1098.41 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 1518.37 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 1741.76 | 2026-08-12 | evidence |
| Grok 4.6 (low) | xAI | 1552.39 | 2026-08-12 | evidence |
| Grok 4.6 (medium) | xAI | 1739.55 | 2026-08-12 | evidence |
| Grok 4.6 (xhigh) | xAI | 1761.27 | 2026-08-12 | evidence |
| Grok Build 0.1 0616 | xAI | 1213.7 | 2026-06-16 | evidence |
| Hy3 | Tencent | 1213.42 | 2026-07-06 | evidence |
| HyperNova 60B 2605 | Multiverse Computing | 657.78 | 2026-05-26 | evidence |
| Inkling (xhigh) | Thinking Machines | 1236.39 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 1268.66 | 2026-07-30 | evidence |
| JT-4.1 Flash 236B A21B | China Mobile | 1264.88 | 2026-07-09 | evidence |
| K-EXAONE (Reasoning) | LG AI Research | 589.58 | 2025-12-31 | evidence |
| K-EXAONE 2.0 0803 | LG AI Research | 979.09 | 2026-08-12 | evidence |
| K2 Think V2 | MBZUAI Institute of Foundation Models | 379.28 | 2025-12-15 | evidence |
| KAT Coder Pro V2 | KwaiKAT | 906.98 | 2026-03-27 | evidence |
| KAT-Coder-Pro V1 | KwaiKAT | 905.7 | 2025-11-11 | evidence |
| Kimi K2.5 (Reasoning) | Moonshot AI | 1007.65 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 1191.42 | 2026-04-20 | evidence |
| Kimi K2.7 Code | Moonshot AI | 1188.52 | 2026-06-12 | evidence |
| Kimi K3 (low) | Moonshot AI | 1272.51 | 2026-07-16 | evidence |
| Kimi K3 (max) | Moonshot AI | 1675.22 | 2026-07-16 | evidence |
| LFM2.5-2.6B | Liquid AI | 251.35 | 2026-08-04 | evidence |
| Ling 2.6 Flash | InclusionAI | 544.89 | 2026-04-21 | evidence |
| Ling 3.0 Flash | InclusionAI | 1105.37 | 2026-08-04 | evidence |
| Ling 3.0 Tiny | InclusionAI | 774.27 | 2026-08-06 | evidence |
| Llama 3.1 Instruct 8B | Meta | -102.28 | 2024-07-23 | evidence |
| Llama 3.3 Instruct 70B | Meta | 96.3 | 2024-12-06 | evidence |
| Llama 4 Maverick | Meta | 3.81 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 108.34 | 2025-04-05 | evidence |
| LongCat 2.0 | LongCat | 1031.12 | 2026-06-29 | evidence |
| Magistral Medium 1.2 | Mistral | 413.41 | 2025-09-18 | evidence |
| Magistral Small 1.2 | Mistral | 263.08 | 2025-09-17 | evidence |
| Mercury 2 | Inception | 698.64 | 2026-02-20 | evidence |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 841.8 | 2025-12-16 | evidence |
| MiMo-V2.5 | Xiaomi | 1150.17 | 2026-04-22 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 1264.09 | 2026-04-22 | evidence |
| MiniCPM-V 4.6 1.3B | OpenBMB | -85.86 | 2026-05-11 | evidence |
| MiniMax-M2.7 | MiniMax | 1159.2 | 2026-03-18 | evidence |
| MiniMax-M3 | MiniMax | 1384.32 | 2026-06-01 | evidence |
| Ministral 3 14B | Mistral | 484.15 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 283.61 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 453.66 | 2025-12-02 | evidence |
| Mistral Large 3 | Mistral | 640.54 | 2025-12-02 | evidence |
| Mistral Medium 3.1 | Mistral | 608.1 | 2025-08-12 | evidence |
| Mistral Medium 3.5 | Mistral | 933.27 | 2026-04-29 | evidence |
| Mistral Small 3.1 | Mistral | 603.1 | 2025-03-17 | evidence |
| Mistral Small 3.2 | Mistral | 78.83 | 2025-06-20 | evidence |
| Mistral Small 4 (Reasoning) | Mistral | 588 | 2026-03-16 | evidence |
| Motif 3 | Motif Technologies | 1272.22 | 2026-08-12 | evidence |
| Motif 3 (Beta) | Motif Technologies | 1254.55 | 2026-07-14 | evidence |
| Muse Glimmer (high) | Meta | 955.94 | 2026-08-10 | evidence |
| Muse Spark | Meta | 1146.99 | 2026-04-08 | evidence |
| Muse Spark 1.1 (xhigh) | Meta | 1374.97 | 2026-07-09 | evidence |
| Muse Spark 1.2 (xhigh) | Meta | 1622.63 | 2026-08-05 | evidence |
| Nanbeige4.1-3B | Nanbeige | -117 | 2026-02-11 | evidence |
| Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 466.42 | 2026-04-29 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 698.64 | 2026-03-11 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 1162.11 | 2026-06-04 | evidence |
| Nemotron 3.5 Lightning | NVIDIA | 826.12 | 2026-08-11 | evidence |
| Nemotron Cascade 2 30B A3B | NVIDIA | 499.77 | 2026-03-19 | evidence |
| Nex-N2-Pro | Nex AGI | 1250.2 | 2026-06-02 | evidence |
| North Mini Code | Cohere | 542.2 | 2026-06-09 | evidence |
| Nova 2.0 Lite (high) | Amazon | 588.64 | 2025-10-29 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 653.95 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 681.86 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 561.79 | 2025-11-27 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | -72.59 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 490.46 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 4B | NVIDIA | 203.8 | 2026-03-16 | evidence |
| o3-mini (high) | OpenAI | 470.92 | 2025-01-31 | evidence |
| Phi-4 Mini Instruct | Microsoft | -122.53 | 2024-02-26 | evidence |
| Qwen3 14B (Reasoning) | Qwen | 236.97 | 2025-04-28 | evidence |
| Qwen3 235B A22B 2507 (Reasoning) | Qwen | 546.83 | 2025-07-25 | evidence |
| Qwen3 30B A3B 2507 (Reasoning) | Qwen | 323.18 | 2025-07-30 | evidence |
| Qwen3 32B (Reasoning) | Qwen | 289.74 | 2025-04-28 | evidence |
| Qwen3 8B (Reasoning) | Qwen | 214.87 | 2025-04-28 | evidence |
| Qwen3 Coder Next | Qwen | 717.56 | 2026-02-03 | evidence |
| Qwen3 Next 80B A3B (Reasoning) | Qwen | 375.69 | 2025-09-11 | evidence |
| Qwen3.5 0.8B (Non-reasoning) | Qwen | -82.62 | 2026-03-02 | evidence |
| Qwen3.5 0.8B (Reasoning) | Qwen | -103.02 | 2026-03-02 | evidence |
| Qwen3.5 122B A10B (Non-reasoning) | Qwen | 893.94 | 2026-02-24 | evidence |
| Qwen3.5 122B A10B (Reasoning) | Qwen | 986.89 | 2026-02-24 | evidence |
| Qwen3.5 2B (Non-reasoning) | Qwen | -81.03 | 2026-03-02 | evidence |
| Qwen3.5 2B (Reasoning) | Qwen | 215.63 | 2026-03-02 | evidence |
| Qwen3.5 35B A3B (Non-reasoning) | Qwen | 799.16 | 2026-02-24 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 965.38 | 2026-02-16 | evidence |
| Qwen3.5 9B (Reasoning) | Qwen | 643.74 | 2026-03-02 | evidence |
| Qwen3.6 27B (Non-reasoning) | Qwen | 1110.07 | 2026-04-22 | evidence |
| Qwen3.6 27B (Reasoning) | Qwen | 1139.86 | 2026-04-22 | evidence |
| Qwen3.6 35B A3B (Non-reasoning) | Qwen | 1019.89 | 2026-04-16 | evidence |
| Qwen3.6 35B A3B (Reasoning) | Qwen | 1056.42 | 2026-04-16 | evidence |
| Qwen3.6 Plus | Qwen | 1139.13 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 1268.16 | 2026-05-19 | evidence |
| Qwen3.7 Plus | Qwen | 946.3 | 2026-06-01 | evidence |
| Qwen3.8 2.4T A95B | Qwen | 1716.91 | 2026-08-12 | evidence |
| Qwen3.8 27B (low) | Qwen | 1489.11 | 2026-08-14 | evidence |
| Qwen3.8 27B (medium) | Qwen | 1518.9 | 2026-08-14 | evidence |
| Qwen3.8 27B (Non-reasoning) | Qwen | 1210.94 | 2026-08-14 | evidence |
| Qwen3.8 27B (xhigh) | Qwen | 1541.23 | 2026-08-14 | evidence |
| Qwen3.8 Max | Qwen | 1730.02 | 2026-08-03 | evidence |
| Ring-2.6-1T | InclusionAI | 922.85 | 2026-05-08 | evidence |
| Solar Open2 250B | Upstage | 1123.74 | 2026-08-12 | evidence |
| Solar Pro 3 | Upstage | 497.74 | 2026-04-06 | evidence |
| Solar Pro 4 | Upstage | 1273.32 | 2026-08-06 | evidence |
| Step 3.7 Flash | StepFun | 1019.57 | 2026-05-29 | evidence |
| Trinity Large Thinking | Arcee AI | 562.51 | 2026-04-01 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.