Benchmark
GDPval-AA v2 (normalized score)
Agentic real-world work tasks
- Categories
- intelligence-index, agentic
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 213
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| A.X-K2 | SK Telecom | 0.30672000000000005 | 2026-08-12 | evidence |
| Agnes 2.5 Pro Alpha | Sapiens AI | 0.33558000000000004 | 2026-07-24 | evidence |
| Celeris-1 | Celeris | 0.017845000000000028 | 2026-07-24 | evidence |
| Claude 3.5 Haiku | Anthropic | 0 | 2024-10-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 0.18704 | 2025-05-22 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.206815 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 0.27790499999999996 | 2025-09-29 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 0.6154149999999999 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 0.49295500000000003 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 0.5409700000000001 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 0.612855 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 0.47753999999999996 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.667335 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 0.557905 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.655505 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.43690999999999997 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, High Effort) | Anthropic | 0.45042499999999996 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | 0.35958500000000004 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.5463150000000001 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 0.40048500000000004 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.49853499999999995 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 0.43392499999999995 | 2026-06-30 | evidence |
| Command A+ | Cohere | 0.10687999999999999 | 2026-05-20 | evidence |
| DeepSeek R1 (Jan '25) | DeepSeek | 0.014995000000000005 | 2025-01-20 | evidence |
| DeepSeek V3 (Dec '24) | DeepSeek | 0 | 2024-12-26 | evidence |
| DeepSeek V3 0324 | DeepSeek | 0 | 2025-03-25 | evidence |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 0.191365 | 2025-09-22 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 0.18251499999999998 | 2025-12-01 | evidence |
| DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 0.327265 | 2026-04-24 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.344985 | 2026-04-24 | evidence |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 0.52926 | 2026-07-31 | evidence |
| DeepSeek V4 Flash Vision (Reasoning, Max Effort) | DeepSeek | 0.5874400000000001 | 2026-08-21 | evidence |
| DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 0.39572500000000005 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.40145500000000006 | 2026-04-24 | evidence |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 0.542875 | 2026-08-13 | evidence |
| Devstral 2 | Mistral | 0.12094999999999999 | 2025-12-09 | evidence |
| Devstral Small 2 | Mistral | 0.11689499999999999 | 2025-12-09 | evidence |
| DiffusionGemma 26B A4B | 0.026625 | 2026-06-10 | evidence | |
| EXAONE 4.5 33B | LG AI Research | 0.090755 | 2026-04-09 | evidence |
| G9v3-39A5B | AI9Stars | 0.38261 | 2026-08-20 | evidence |
| G9v3-3B | AI9Stars | 0.18170499999999998 | 2026-07-23 | evidence |
| Gemini 2.5 Pro | 0.08522500000000002 | 2025-06-05 | evidence | |
| Gemini 3.1 Flash-Lite | 0.07366500000000002 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.23227499999999998 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.42066999999999993 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash-Lite | 0.320005 | 2026-07-21 | evidence | |
| Gemini 3.6 Flash (high) | 0.459545 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 0.513555 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (low) | 0.47620500000000004 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (medium) | 0.49813 | 2026-08-13 | evidence | |
| Gemma 3 12B Instruct | 0 | 2025-03-12 | evidence | |
| Gemma 3 27B Instruct | 0 | 2025-03-12 | evidence | |
| Gemma 4 12B (Reasoning) | 0.07189499999999999 | 2026-06-03 | evidence | |
| Gemma 4 26B A4B (Reasoning) | 0.13369 | 2026-04-02 | evidence | |
| Gemma 4 31B (Non-reasoning) | 0.12355500000000001 | 2026-04-02 | evidence | |
| Gemma 4 31B (Reasoning) | 0.15543 | 2026-04-02 | evidence | |
| Gemma 4 E2B (Reasoning) | 0 | 2026-04-02 | evidence | |
| Gemma 4 E4B (Reasoning) | 0 | 2026-04-03 | evidence | |
| GLM-4.6 (Reasoning) | Z.ai | 0.21716500000000002 | 2025-09-30 | evidence |
| GLM-4.7 (Reasoning) | Z.ai | 0.33391999999999994 | 2025-12-22 | evidence |
| GLM-5.1 (Reasoning) | Z.ai | 0.3785 | 2026-04-07 | evidence |
| GLM-5.2 (max) | Z.ai | 0.5025599999999999 | 2026-06-16 | evidence |
| GLM-5.2 (Non-reasoning) | Z.ai | 0.446735 | 2026-06-16 | evidence |
| GLM-5.3 (max) | Z.ai | 0.63293 | 2026-08-18 | evidence |
| GPT-4 | OpenAI | 0 | 2023-03-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.0031200000000000047 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0 | 2025-04-14 | evidence |
| GPT-4o mini | OpenAI | 0 | 2024-07-18 | evidence |
| GPT-5 (high) | OpenAI | 0.292495 | 2025-08-07 | evidence |
| GPT-5 mini (high) | OpenAI | 0.21994 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 0.24779 | 2025-11-13 | evidence |
| GPT-5.4 (xhigh) | OpenAI | 0.445895 | 2026-03-05 | evidence |
| GPT-5.4 mini (Non-Reasoning) | OpenAI | 0.1455 | 2026-03-17 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.33486 | 2026-03-17 | evidence |
| GPT-5.4 nano (Non-Reasoning) | OpenAI | 0.11845999999999998 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.30229999999999996 | 2026-03-17 | evidence |
| GPT-5.5 (high) | OpenAI | 0.48202 | 2026-04-23 | evidence |
| GPT-5.5 (low) | OpenAI | 0.34319500000000003 | 2026-04-23 | evidence |
| GPT-5.5 (medium) | OpenAI | 0.43679499999999993 | 2026-04-23 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 0.312395 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.49428999999999995 | 2026-04-23 | evidence |
| GPT-5.5 Instant (June 2026) | OpenAI | 0.10804500000000002 | 2026-06-25 | evidence |
| GPT-5.6 Luna (high) | OpenAI | 0.4825 | 2026-07-09 | evidence |
| GPT-5.6 Luna (low) | OpenAI | 0.3275 | 2026-07-09 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.538695 | 2026-07-09 | evidence |
| GPT-5.6 Luna (medium) | OpenAI | 0.386395 | 2026-07-09 | evidence |
| GPT-5.6 Luna (Non-reasoning) | OpenAI | 0.28702999999999995 | 2026-07-09 | evidence |
| GPT-5.6 Luna (xhigh) | OpenAI | 0.51216 | 2026-07-09 | evidence |
| GPT-5.6 Sol (high) | OpenAI | 0.5585549999999999 | 2026-07-09 | evidence |
| GPT-5.6 Sol (low) | OpenAI | 0.47133500000000006 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.608 | 2026-07-09 | evidence |
| GPT-5.6 Sol (medium) | OpenAI | 0.52373 | 2026-07-09 | evidence |
| GPT-5.6 Sol (Non-reasoning) | OpenAI | 0.44018499999999994 | 2026-07-09 | evidence |
| GPT-5.6 Sol (xhigh) | OpenAI | 0.587545 | 2026-07-09 | evidence |
| GPT-5.6 Terra (high) | OpenAI | 0.504745 | 2026-07-09 | evidence |
| GPT-5.6 Terra (low) | OpenAI | 0.37816999999999995 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.5365650000000001 | 2026-07-09 | evidence |
| GPT-5.6 Terra (medium) | OpenAI | 0.45310500000000004 | 2026-07-09 | evidence |
| GPT-5.6 Terra (Non-reasoning) | OpenAI | 0.372105 | 2026-07-09 | evidence |
| GPT-5.6 Terra (xhigh) | OpenAI | 0.536045 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.14985 | 2025-08-05 | evidence |
| gpt-oss-120b (low) | OpenAI | 0 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.03283999999999997 | 2025-08-05 | evidence |
| Granite 4.1 30B | IBM | 0 | 2026-04-29 | evidence |
| Granite 4.1 3B | IBM | 0 | 2026-04-29 | evidence |
| Grok 4.3 (high) | xAI | 0.294135 | 2026-04-30 | evidence |
| Grok 4.3 (Non-reasoning) | xAI | 0.29920500000000005 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.509185 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 0.62088 | 2026-08-12 | evidence |
| Grok 4.6 (low) | xAI | 0.5261950000000001 | 2026-08-12 | evidence |
| Grok 4.6 (medium) | xAI | 0.619775 | 2026-08-12 | evidence |
| Grok 4.6 (xhigh) | xAI | 0.630635 | 2026-08-12 | evidence |
| Grok Build 0.1 0616 | xAI | 0.35685 | 2026-06-16 | evidence |
| Hy3 | Tencent | 0.35671 | 2026-07-06 | evidence |
| HyperNova 60B 2605 | Multiverse Computing | 0.07888999999999999 | 2026-05-26 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.36819500000000005 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 0.38433000000000006 | 2026-07-30 | evidence |
| JT-4.1 Flash 236B A21B | China Mobile | 0.38244000000000006 | 2026-07-09 | evidence |
| K-EXAONE (Reasoning) | LG AI Research | 0.04479000000000002 | 2025-12-31 | evidence |
| K-EXAONE 2.0 0803 | LG AI Research | 0.239545 | 2026-08-12 | evidence |
| K2 Think V2 | MBZUAI Institute of Foundation Models | 0 | 2025-12-15 | evidence |
| KAT Coder Pro V2 | KwaiKAT | 0.20349 | 2026-03-27 | evidence |
| KAT-Coder-Pro V1 | KwaiKAT | 0.20285000000000003 | 2025-11-11 | evidence |
| Kimi K2.5 (Reasoning) | Moonshot AI | 0.25382499999999997 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.34571 | 2026-04-20 | evidence |
| Kimi K2.7 Code | Moonshot AI | 0.34426 | 2026-06-12 | evidence |
| Kimi K3 (low) | Moonshot AI | 0.386255 | 2026-07-16 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.58761 | 2026-07-16 | evidence |
| LFM2.5-2.6B | Liquid AI | 0 | 2026-08-04 | evidence |
| Ling 2.6 Flash | InclusionAI | 0.022444999999999993 | 2026-04-21 | evidence |
| Ling 3.0 Flash | InclusionAI | 0.3026849999999999 | 2026-08-04 | evidence |
| Ling 3.0 Tiny | InclusionAI | 0.13713499999999998 | 2026-08-06 | evidence |
| Llama 3.1 Instruct 8B | Meta | 0 | 2024-07-23 | evidence |
| Llama 3.3 Instruct 70B | Meta | 0 | 2024-12-06 | evidence |
| Llama 4 Maverick | Meta | 0 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0 | 2025-04-05 | evidence |
| LongCat 2.0 | LongCat | 0.26555999999999996 | 2026-06-29 | evidence |
| Magistral Medium 1.2 | Mistral | 0 | 2025-09-18 | evidence |
| Magistral Small 1.2 | Mistral | 0 | 2025-09-17 | evidence |
| Mercury 2 | Inception | 0.09931999999999999 | 2026-02-20 | evidence |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 0.17089999999999997 | 2025-12-16 | evidence |
| MiMo-V2.5 | Xiaomi | 0.325085 | 2026-04-22 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.38204499999999997 | 2026-04-22 | evidence |
| MiniCPM-V 4.6 1.3B | OpenBMB | 0 | 2026-05-11 | evidence |
| MiniMax-M2.7 | MiniMax | 0.3296 | 2026-03-18 | evidence |
| MiniMax-M3 | MiniMax | 0.44215999999999994 | 2026-06-01 | evidence |
| Ministral 3 14B | Mistral | 0 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 0 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 0 | 2025-12-02 | evidence |
| Mistral Large 3 | Mistral | 0.07026999999999999 | 2025-12-02 | evidence |
| Mistral Medium 3.1 | Mistral | 0.054050000000000015 | 2025-08-12 | evidence |
| Mistral Medium 3.5 | Mistral | 0.216635 | 2026-04-29 | evidence |
| Mistral Small 3.1 | Mistral | 0.05155000000000001 | 2025-03-17 | evidence |
| Mistral Small 3.2 | Mistral | 0 | 2025-06-20 | evidence |
| Mistral Small 4 (Reasoning) | Mistral | 0.044 | 2026-03-16 | evidence |
| Motif 3 | Motif Technologies | 0.38611 | 2026-08-12 | evidence |
| Motif 3 (Beta) | Motif Technologies | 0.37727499999999997 | 2026-07-14 | evidence |
| Muse Glimmer (high) | Meta | 0.22797000000000003 | 2026-08-10 | evidence |
| Muse Spark | Meta | 0.323495 | 2026-04-08 | evidence |
| Muse Spark 1.1 (xhigh) | Meta | 0.437485 | 2026-07-09 | evidence |
| Muse Spark 1.2 (xhigh) | Meta | 0.561315 | 2026-08-05 | evidence |
| Nanbeige4.1-3B | Nanbeige | 0 | 2026-02-11 | evidence |
| Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 0 | 2026-04-29 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 0.09931999999999999 | 2026-03-11 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.33105499999999993 | 2026-06-04 | evidence |
| Nemotron 3.5 Lightning | NVIDIA | 0.16306 | 2026-08-11 | evidence |
| Nemotron Cascade 2 30B A3B | NVIDIA | 0 | 2026-03-19 | evidence |
| Nex-N2-Pro | Nex AGI | 0.37510000000000004 | 2026-06-02 | evidence |
| North Mini Code | Cohere | 0.02110000000000002 | 2026-06-09 | evidence |
| Nova 2.0 Lite (high) | Amazon | 0.04431999999999999 | 2025-10-29 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 0.07697500000000003 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.09093000000000001 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 0.03089499999999998 | 2025-11-27 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 0 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 0 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 4B | NVIDIA | 0 | 2026-03-16 | evidence |
| o3-mini (high) | OpenAI | 0 | 2025-01-31 | evidence |
| Phi-4 Mini Instruct | Microsoft | 0 | 2024-02-26 | evidence |
| Qwen3 14B (Reasoning) | Qwen | 0 | 2025-04-28 | evidence |
| Qwen3 235B A22B 2507 (Reasoning) | Qwen | 0.02341500000000002 | 2025-07-25 | evidence |
| Qwen3 30B A3B 2507 (Reasoning) | Qwen | 0 | 2025-07-30 | evidence |
| Qwen3 32B (Reasoning) | Qwen | 0 | 2025-04-28 | evidence |
| Qwen3 8B (Reasoning) | Qwen | 0 | 2025-04-28 | evidence |
| Qwen3 Coder Next | Qwen | 0.10877999999999997 | 2026-02-03 | evidence |
| Qwen3 Next 80B A3B (Reasoning) | Qwen | 0 | 2025-09-11 | evidence |
| Qwen3.5 0.8B (Non-reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 0.8B (Reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 122B A10B (Non-reasoning) | Qwen | 0.19697000000000003 | 2026-02-24 | evidence |
| Qwen3.5 122B A10B (Reasoning) | Qwen | 0.243445 | 2026-02-24 | evidence |
| Qwen3.5 2B (Non-reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 2B (Reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 35B A3B (Non-reasoning) | Qwen | 0.14958 | 2026-02-24 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.23269 | 2026-02-16 | evidence |
| Qwen3.5 9B (Reasoning) | Qwen | 0.07187 | 2026-03-02 | evidence |
| Qwen3.6 27B (Non-reasoning) | Qwen | 0.30503499999999995 | 2026-04-22 | evidence |
| Qwen3.6 27B (Reasoning) | Qwen | 0.31992999999999994 | 2026-04-22 | evidence |
| Qwen3.6 35B A3B (Non-reasoning) | Qwen | 0.259945 | 2026-04-16 | evidence |
| Qwen3.6 35B A3B (Reasoning) | Qwen | 0.27821 | 2026-04-16 | evidence |
| Qwen3.6 Plus | Qwen | 0.31956500000000004 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 0.38408000000000003 | 2026-05-19 | evidence |
| Qwen3.7 Plus | Qwen | 0.22315 | 2026-06-01 | evidence |
| Qwen3.8 2.4T A95B | Qwen | 0.6084550000000001 | 2026-08-12 | evidence |
| Qwen3.8 27B (low) | Qwen | 0.49455499999999997 | 2026-08-14 | evidence |
| Qwen3.8 27B (medium) | Qwen | 0.5094500000000001 | 2026-08-14 | evidence |
| Qwen3.8 27B (Non-reasoning) | Qwen | 0.35547 | 2026-08-14 | evidence |
| Qwen3.8 27B (xhigh) | Qwen | 0.520615 | 2026-08-14 | evidence |
| Qwen3.8 Max | Qwen | 0.61501 | 2026-08-03 | evidence |
| Ring-2.6-1T | InclusionAI | 0.211425 | 2026-05-08 | evidence |
| Solar Open2 250B | Upstage | 0.31187 | 2026-08-12 | evidence |
| Solar Pro 3 | Upstage | 0 | 2026-04-06 | evidence |
| Solar Pro 4 | Upstage | 0.38665999999999995 | 2026-08-06 | evidence |
| Step 3.7 Flash | StepFun | 0.25978500000000004 | 2026-05-29 | evidence |
| Trinity Large Thinking | Arcee AI | 0.031255 | 2026-04-01 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.