Benchmark

GDPval-AA v2 (normalized score)

Agentic real-world work tasks

Categories
intelligence-index, agentic
Openness
unknown
Source
artificial_analysis
Reported scores
213

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
A.X-K2SK Telecom0.306720000000000052026-08-12evidence
Agnes 2.5 Pro AlphaSapiens AI0.335580000000000042026-07-24evidence
Celeris-1Celeris0.0178450000000000282026-07-24evidence
Claude 3.5 HaikuAnthropic02024-10-22evidence
Claude 4 Sonnet (Reasoning)Anthropic0.187042025-05-22evidence
Claude 4.5 Haiku (Reasoning)Anthropic0.2068152025-10-15evidence
Claude 4.5 Sonnet (Reasoning)Anthropic0.277904999999999962025-09-29evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.61541499999999992026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic0.492955000000000032026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.54097000000000012026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic0.6128552026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic0.477539999999999962026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.6673352026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic0.5579052026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.6555052026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.436909999999999972026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic0.450424999999999962026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropic0.359585000000000042026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.54631500000000012026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic0.400485000000000042026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.498534999999999952026-06-30evidence
Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic0.433924999999999952026-06-30evidence
Command A+Cohere0.106879999999999992026-05-20evidence
DeepSeek R1 (Jan '25)DeepSeek0.0149950000000000052025-01-20evidence
DeepSeek V3 (Dec '24)DeepSeek02024-12-26evidence
DeepSeek V3 0324DeepSeek02025-03-25evidence
DeepSeek V3.1 Terminus (Reasoning)DeepSeek0.1913652025-09-22evidence
DeepSeek V3.2 (Reasoning)DeepSeek0.182514999999999982025-12-01evidence
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek0.3272652026-04-24evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.3449852026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek0.529262026-07-31evidence
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek0.58744000000000012026-08-21evidence
DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek0.395725000000000052026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.401455000000000062026-04-24evidence
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek0.5428752026-08-13evidence
Devstral 2Mistral0.120949999999999992025-12-09evidence
Devstral Small 2Mistral0.116894999999999992025-12-09evidence
DiffusionGemma 26B A4BGoogle0.0266252026-06-10evidence
EXAONE 4.5 33BLG AI Research0.0907552026-04-09evidence
G9v3-39A5BAI9Stars0.382612026-08-20evidence
G9v3-3BAI9Stars0.181704999999999982026-07-23evidence
Gemini 2.5 ProGoogle0.085225000000000022025-06-05evidence
Gemini 3.1 Flash-LiteGoogle0.073665000000000022026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.232274999999999982026-02-19evidence
Gemini 3.5 Flash (high)Google0.420669999999999932026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.3200052026-07-21evidence
Gemini 3.6 Flash (high)Google0.4595452026-07-21evidence
Gemini 3.7 Flash (high)Google0.5135552026-08-13evidence
Gemini 3.7 Flash (low)Google0.476205000000000042026-08-13evidence
Gemini 3.7 Flash (medium)Google0.498132026-08-13evidence
Gemma 3 12B InstructGoogle02025-03-12evidence
Gemma 3 27B InstructGoogle02025-03-12evidence
Gemma 4 12B (Reasoning)Google0.071894999999999992026-06-03evidence
Gemma 4 26B A4B (Reasoning)Google0.133692026-04-02evidence
Gemma 4 31B (Non-reasoning)Google0.123555000000000012026-04-02evidence
Gemma 4 31B (Reasoning)Google0.155432026-04-02evidence
Gemma 4 E2B (Reasoning)Google02026-04-02evidence
Gemma 4 E4B (Reasoning)Google02026-04-03evidence
GLM-4.6 (Reasoning)Z.ai0.217165000000000022025-09-30evidence
GLM-4.7 (Reasoning)Z.ai0.333919999999999942025-12-22evidence
GLM-5.1 (Reasoning)Z.ai0.37852026-04-07evidence
GLM-5.2 (max)Z.ai0.50255999999999992026-06-16evidence
GLM-5.2 (Non-reasoning)Z.ai0.4467352026-06-16evidence
GLM-5.3 (max)Z.ai0.632932026-08-18evidence
GPT-4OpenAI02023-03-14evidence
GPT-4.1 miniOpenAI0.00312000000000000472025-04-14evidence
GPT-4.1 nanoOpenAI02025-04-14evidence
GPT-4o miniOpenAI02024-07-18evidence
GPT-5 (high)OpenAI0.2924952025-08-07evidence
GPT-5 mini (high)OpenAI0.219942025-08-07evidence
GPT-5.1 (high)OpenAI0.247792025-11-13evidence
GPT-5.4 (xhigh)OpenAI0.4458952026-03-05evidence
GPT-5.4 mini (Non-Reasoning)OpenAI0.14552026-03-17evidence
GPT-5.4 mini (xhigh)OpenAI0.334862026-03-17evidence
GPT-5.4 nano (Non-Reasoning)OpenAI0.118459999999999982026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.302299999999999962026-03-17evidence
GPT-5.5 (high)OpenAI0.482022026-04-23evidence
GPT-5.5 (low)OpenAI0.343195000000000032026-04-23evidence
GPT-5.5 (medium)OpenAI0.436794999999999932026-04-23evidence
GPT-5.5 (Non-reasoning)OpenAI0.3123952026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.494289999999999952026-04-23evidence
GPT-5.5 Instant (June 2026)OpenAI0.108045000000000022026-06-25evidence
GPT-5.6 Luna (high)OpenAI0.48252026-07-09evidence
GPT-5.6 Luna (low)OpenAI0.32752026-07-09evidence
GPT-5.6 Luna (max)OpenAI0.5386952026-07-09evidence
GPT-5.6 Luna (medium)OpenAI0.3863952026-07-09evidence
GPT-5.6 Luna (Non-reasoning)OpenAI0.287029999999999952026-07-09evidence
GPT-5.6 Luna (xhigh)OpenAI0.512162026-07-09evidence
GPT-5.6 Sol (high)OpenAI0.55855499999999992026-07-09evidence
GPT-5.6 Sol (low)OpenAI0.471335000000000062026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.6082026-07-09evidence
GPT-5.6 Sol (medium)OpenAI0.523732026-07-09evidence
GPT-5.6 Sol (Non-reasoning)OpenAI0.440184999999999942026-07-09evidence
GPT-5.6 Sol (xhigh)OpenAI0.5875452026-07-09evidence
GPT-5.6 Terra (high)OpenAI0.5047452026-07-09evidence
GPT-5.6 Terra (low)OpenAI0.378169999999999952026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.53656500000000012026-07-09evidence
GPT-5.6 Terra (medium)OpenAI0.453105000000000042026-07-09evidence
GPT-5.6 Terra (Non-reasoning)OpenAI0.3721052026-07-09evidence
GPT-5.6 Terra (xhigh)OpenAI0.5360452026-07-09evidence
gpt-oss-120b (high)OpenAI0.149852025-08-05evidence
gpt-oss-120b (low)OpenAI02025-08-05evidence
gpt-oss-20b (high)OpenAI0.032839999999999972025-08-05evidence
Granite 4.1 30BIBM02026-04-29evidence
Granite 4.1 3BIBM02026-04-29evidence
Grok 4.3 (high)xAI0.2941352026-04-30evidence
Grok 4.3 (Non-reasoning)xAI0.299205000000000052026-04-30evidence
Grok 4.5 (high)xAI0.5091852026-07-08evidence
Grok 4.6 (high)xAI0.620882026-08-12evidence
Grok 4.6 (low)xAI0.52619500000000012026-08-12evidence
Grok 4.6 (medium)xAI0.6197752026-08-12evidence
Grok 4.6 (xhigh)xAI0.6306352026-08-12evidence
Grok Build 0.1 0616xAI0.356852026-06-16evidence
Hy3Tencent0.356712026-07-06evidence
HyperNova 60B 2605Multiverse Computing0.078889999999999992026-05-26evidence
Inkling (xhigh)Thinking Machines0.368195000000000052026-07-15evidence
Inkling SmallThinking Machines0.384330000000000062026-07-30evidence
JT-4.1 Flash 236B A21BChina Mobile0.382440000000000062026-07-09evidence
K-EXAONE (Reasoning)LG AI Research0.044790000000000022025-12-31evidence
K-EXAONE 2.0 0803LG AI Research0.2395452026-08-12evidence
K2 Think V2MBZUAI Institute of Foundation Models02025-12-15evidence
KAT Coder Pro V2KwaiKAT0.203492026-03-27evidence
KAT-Coder-Pro V1KwaiKAT0.202850000000000032025-11-11evidence
Kimi K2.5 (Reasoning)Moonshot AI0.253824999999999972026-01-27evidence
Kimi K2.6Moonshot AI0.345712026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.344262026-06-12evidence
Kimi K3 (low)Moonshot AI0.3862552026-07-16evidence
Kimi K3 (max)Moonshot AI0.587612026-07-16evidence
LFM2.5-2.6BLiquid AI02026-08-04evidence
Ling 2.6 FlashInclusionAI0.0224449999999999932026-04-21evidence
Ling 3.0 FlashInclusionAI0.30268499999999992026-08-04evidence
Ling 3.0 TinyInclusionAI0.137134999999999982026-08-06evidence
Llama 3.1 Instruct 8BMeta02024-07-23evidence
Llama 3.3 Instruct 70BMeta02024-12-06evidence
Llama 4 MaverickMeta02025-04-05evidence
Llama 4 ScoutMeta02025-04-05evidence
LongCat 2.0LongCat0.265559999999999962026-06-29evidence
Magistral Medium 1.2Mistral02025-09-18evidence
Magistral Small 1.2Mistral02025-09-17evidence
Mercury 2Inception0.099319999999999992026-02-20evidence
MiMo-V2-Flash (Non-reasoning)Xiaomi0.170899999999999972025-12-16evidence
MiMo-V2.5Xiaomi0.3250852026-04-22evidence
MiMo-V2.5-ProXiaomi0.382044999999999972026-04-22evidence
MiniCPM-V 4.6 1.3BOpenBMB02026-05-11evidence
MiniMax-M2.7MiniMax0.32962026-03-18evidence
MiniMax-M3MiniMax0.442159999999999942026-06-01evidence
Ministral 3 14BMistral02025-12-02evidence
Ministral 3 3BMistral02025-12-02evidence
Ministral 3 8BMistral02025-12-02evidence
Mistral Large 3Mistral0.070269999999999992025-12-02evidence
Mistral Medium 3.1Mistral0.0540500000000000152025-08-12evidence
Mistral Medium 3.5Mistral0.2166352026-04-29evidence
Mistral Small 3.1Mistral0.051550000000000012025-03-17evidence
Mistral Small 3.2Mistral02025-06-20evidence
Mistral Small 4 (Reasoning)Mistral0.0442026-03-16evidence
Motif 3Motif Technologies0.386112026-08-12evidence
Motif 3 (Beta)Motif Technologies0.377274999999999972026-07-14evidence
Muse Glimmer (high)Meta0.227970000000000032026-08-10evidence
Muse SparkMeta0.3234952026-04-08evidence
Muse Spark 1.1 (xhigh)Meta0.4374852026-07-09evidence
Muse Spark 1.2 (xhigh)Meta0.5613152026-08-05evidence
Nanbeige4.1-3BNanbeige02026-02-11evidence
Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA02026-04-29evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA0.099319999999999992026-03-11evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.331054999999999932026-06-04evidence
Nemotron 3.5 LightningNVIDIA0.163062026-08-11evidence
Nemotron Cascade 2 30B A3BNVIDIA02026-03-19evidence
Nex-N2-ProNex AGI0.375100000000000042026-06-02evidence
North Mini CodeCohere0.021100000000000022026-06-09evidence
Nova 2.0 Lite (high)Amazon0.044319999999999992025-10-29evidence
Nova 2.0 Pro Preview (low)Amazon0.076975000000000032025-11-27evidence
Nova 2.0 Pro Preview (medium)Amazon0.090930000000000012025-11-27evidence
Nova 2.0 Pro Preview (Non-reasoning)Amazon0.030894999999999982025-11-27evidence
NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA02025-12-15evidence
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA02025-12-15evidence
NVIDIA Nemotron 3 Nano 4BNVIDIA02026-03-16evidence
o3-mini (high)OpenAI02025-01-31evidence
Phi-4 Mini InstructMicrosoft02024-02-26evidence
Qwen3 14B (Reasoning)Qwen02025-04-28evidence
Qwen3 235B A22B 2507 (Reasoning)Qwen0.023415000000000022025-07-25evidence
Qwen3 30B A3B 2507 (Reasoning)Qwen02025-07-30evidence
Qwen3 32B (Reasoning)Qwen02025-04-28evidence
Qwen3 8B (Reasoning)Qwen02025-04-28evidence
Qwen3 Coder NextQwen0.108779999999999972026-02-03evidence
Qwen3 Next 80B A3B (Reasoning)Qwen02025-09-11evidence
Qwen3.5 0.8B (Non-reasoning)Qwen02026-03-02evidence
Qwen3.5 0.8B (Reasoning)Qwen02026-03-02evidence
Qwen3.5 122B A10B (Non-reasoning)Qwen0.196970000000000032026-02-24evidence
Qwen3.5 122B A10B (Reasoning)Qwen0.2434452026-02-24evidence
Qwen3.5 2B (Non-reasoning)Qwen02026-03-02evidence
Qwen3.5 2B (Reasoning)Qwen02026-03-02evidence
Qwen3.5 35B A3B (Non-reasoning)Qwen0.149582026-02-24evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.232692026-02-16evidence
Qwen3.5 9B (Reasoning)Qwen0.071872026-03-02evidence
Qwen3.6 27B (Non-reasoning)Qwen0.305034999999999952026-04-22evidence
Qwen3.6 27B (Reasoning)Qwen0.319929999999999942026-04-22evidence
Qwen3.6 35B A3B (Non-reasoning)Qwen0.2599452026-04-16evidence
Qwen3.6 35B A3B (Reasoning)Qwen0.278212026-04-16evidence
Qwen3.6 PlusQwen0.319565000000000042026-04-02evidence
Qwen3.7 MaxQwen0.384080000000000032026-05-19evidence
Qwen3.7 PlusQwen0.223152026-06-01evidence
Qwen3.8 2.4T A95BQwen0.60845500000000012026-08-12evidence
Qwen3.8 27B (low)Qwen0.494554999999999972026-08-14evidence
Qwen3.8 27B (medium)Qwen0.50945000000000012026-08-14evidence
Qwen3.8 27B (Non-reasoning)Qwen0.355472026-08-14evidence
Qwen3.8 27B (xhigh)Qwen0.5206152026-08-14evidence
Qwen3.8 MaxQwen0.615012026-08-03evidence
Ring-2.6-1TInclusionAI0.2114252026-05-08evidence
Solar Open2 250BUpstage0.311872026-08-12evidence
Solar Pro 3Upstage02026-04-06evidence
Solar Pro 4Upstage0.386659999999999952026-08-06evidence
Step 3.7 FlashStepFun0.259785000000000042026-05-29evidence
Trinity Large ThinkingArcee AI0.0312552026-04-01evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.