Benchmark

GDPval-AA v2 (Elo)

Agentic real-world work tasks

Categories
intelligence-index, agentic
Openness
unknown
Source
artificial_analysis
Reported scores
213

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
A.X-K2SK Telecom1113.442026-08-12evidence
Agnes 2.5 Pro AlphaSapiens AI1171.162026-07-24evidence
Celeris-1Celeris535.692026-07-24evidence
Claude 3.5 HaikuAnthropic458.092024-10-22evidence
Claude 4 Sonnet (Reasoning)Anthropic874.082025-05-22evidence
Claude 4.5 Haiku (Reasoning)Anthropic913.632025-10-15evidence
Claude 4.5 Sonnet (Reasoning)Anthropic1055.812025-09-29evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1730.832026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic1485.912026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic1581.942026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic1725.712026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic1455.082026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1834.672026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic1615.812026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic1811.012026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic1373.822026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic1400.852026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropic1219.172026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic1592.632026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic1300.972026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic1497.072026-06-30evidence
Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic1367.852026-06-30evidence
Command A+Cohere713.762026-05-20evidence
DeepSeek R1 (Jan '25)DeepSeek529.992025-01-20evidence
DeepSeek V3 (Dec '24)DeepSeek231.742024-12-26evidence
DeepSeek V3 0324DeepSeek324.572025-03-25evidence
DeepSeek V3.1 Terminus (Reasoning)DeepSeek882.732025-09-22evidence
DeepSeek V3.2 (Reasoning)DeepSeek865.032025-12-01evidence
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek1154.532026-04-24evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek1189.972026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek1558.522026-07-31evidence
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek1674.882026-08-21evidence
DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek1291.452026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek1302.912026-04-24evidence
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek1585.752026-08-13evidence
Devstral 2Mistral741.92025-12-09evidence
Devstral Small 2Mistral733.792025-12-09evidence
DiffusionGemma 26B A4BGoogle553.252026-06-10evidence
EXAONE 4.5 33BLG AI Research681.512026-04-09evidence
G9v3-39A5BAI9Stars1265.222026-08-20evidence
G9v3-3BAI9Stars863.412026-07-23evidence
Gemini 2.5 ProGoogle670.452025-06-05evidence
Gemini 3.1 Flash-LiteGoogle647.332026-03-03evidence
Gemini 3.1 Pro PreviewGoogle964.552026-02-19evidence
Gemini 3.5 Flash (high)Google1341.342026-05-19evidence
Gemini 3.5 Flash-LiteGoogle1140.012026-07-21evidence
Gemini 3.6 Flash (high)Google1419.092026-07-21evidence
Gemini 3.7 Flash (high)Google1527.112026-08-13evidence
Gemini 3.7 Flash (low)Google1452.412026-08-13evidence
Gemini 3.7 Flash (medium)Google1496.262026-08-13evidence
Gemma 3 12B InstructGoogle-121.392025-03-12evidence
Gemma 3 27B InstructGoogle-122.082025-03-12evidence
Gemma 4 12B (Reasoning)Google643.792026-06-03evidence
Gemma 4 26B A4B (Reasoning)Google767.382026-04-02evidence
Gemma 4 31B (Non-reasoning)Google747.112026-04-02evidence
Gemma 4 31B (Reasoning)Google810.862026-04-02evidence
Gemma 4 E2B (Reasoning)Google85.982026-04-02evidence
Gemma 4 E4B (Reasoning)Google228.912026-04-03evidence
GLM-4.6 (Reasoning)Z.ai934.332025-09-30evidence
GLM-4.7 (Reasoning)Z.ai1167.842025-12-22evidence
GLM-5.1 (Reasoning)Z.ai12572026-04-07evidence
GLM-5.2 (max)Z.ai1505.122026-06-16evidence
GLM-5.2 (Non-reasoning)Z.ai1393.472026-06-16evidence
GLM-5.3 (max)Z.ai1765.862026-08-18evidence
GPT-4OpenAI239.212023-03-14evidence
GPT-4.1 miniOpenAI506.242025-04-14evidence
GPT-4.1 nanoOpenAI60.082025-04-14evidence
GPT-4o miniOpenAI237.682024-07-18evidence
GPT-5 (high)OpenAI1084.992025-08-07evidence
GPT-5 mini (high)OpenAI939.882025-08-07evidence
GPT-5.1 (high)OpenAI995.582025-11-13evidence
GPT-5.4 (xhigh)OpenAI1391.792026-03-05evidence
GPT-5.4 mini (Non-Reasoning)OpenAI7912026-03-17evidence
GPT-5.4 mini (xhigh)OpenAI1169.722026-03-17evidence
GPT-5.4 nano (Non-Reasoning)OpenAI736.922026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI1104.62026-03-17evidence
GPT-5.5 (high)OpenAI1464.042026-04-23evidence
GPT-5.5 (low)OpenAI1186.392026-04-23evidence
GPT-5.5 (medium)OpenAI1373.592026-04-23evidence
GPT-5.5 (Non-reasoning)OpenAI1124.792026-04-23evidence
GPT-5.5 (xhigh)OpenAI1488.582026-04-23evidence
GPT-5.5 Instant (June 2026)OpenAI716.092026-06-25evidence
GPT-5.6 Luna (high)OpenAI14652026-07-09evidence
GPT-5.6 Luna (low)OpenAI11552026-07-09evidence
GPT-5.6 Luna (max)OpenAI1577.392026-07-09evidence
GPT-5.6 Luna (medium)OpenAI1272.792026-07-09evidence
GPT-5.6 Luna (Non-reasoning)OpenAI1074.062026-07-09evidence
GPT-5.6 Luna (xhigh)OpenAI1524.322026-07-09evidence
GPT-5.6 Sol (high)OpenAI1617.112026-07-09evidence
GPT-5.6 Sol (low)OpenAI1442.672026-07-09evidence
GPT-5.6 Sol (max)OpenAI17162026-07-09evidence
GPT-5.6 Sol (medium)OpenAI1547.462026-07-09evidence
GPT-5.6 Sol (Non-reasoning)OpenAI1380.372026-07-09evidence
GPT-5.6 Sol (xhigh)OpenAI1675.092026-07-09evidence
GPT-5.6 Terra (high)OpenAI1509.492026-07-09evidence
GPT-5.6 Terra (low)OpenAI1256.342026-07-09evidence
GPT-5.6 Terra (max)OpenAI1573.132026-07-09evidence
GPT-5.6 Terra (medium)OpenAI1406.212026-07-09evidence
GPT-5.6 Terra (Non-reasoning)OpenAI1244.212026-07-09evidence
GPT-5.6 Terra (xhigh)OpenAI1572.092026-07-09evidence
gpt-oss-120b (high)OpenAI799.72025-08-05evidence
gpt-oss-120b (low)OpenAI411.952025-08-05evidence
gpt-oss-20b (high)OpenAI565.682025-08-05evidence
Granite 4.1 30BIBM429.742026-04-29evidence
Granite 4.1 3BIBM122.772026-04-29evidence
Grok 4.3 (high)xAI1088.272026-04-30evidence
Grok 4.3 (Non-reasoning)xAI1098.412026-04-30evidence
Grok 4.5 (high)xAI1518.372026-07-08evidence
Grok 4.6 (high)xAI1741.762026-08-12evidence
Grok 4.6 (low)xAI1552.392026-08-12evidence
Grok 4.6 (medium)xAI1739.552026-08-12evidence
Grok 4.6 (xhigh)xAI1761.272026-08-12evidence
Grok Build 0.1 0616xAI1213.72026-06-16evidence
Hy3Tencent1213.422026-07-06evidence
HyperNova 60B 2605Multiverse Computing657.782026-05-26evidence
Inkling (xhigh)Thinking Machines1236.392026-07-15evidence
Inkling SmallThinking Machines1268.662026-07-30evidence
JT-4.1 Flash 236B A21BChina Mobile1264.882026-07-09evidence
K-EXAONE (Reasoning)LG AI Research589.582025-12-31evidence
K-EXAONE 2.0 0803LG AI Research979.092026-08-12evidence
K2 Think V2MBZUAI Institute of Foundation Models379.282025-12-15evidence
KAT Coder Pro V2KwaiKAT906.982026-03-27evidence
KAT-Coder-Pro V1KwaiKAT905.72025-11-11evidence
Kimi K2.5 (Reasoning)Moonshot AI1007.652026-01-27evidence
Kimi K2.6Moonshot AI1191.422026-04-20evidence
Kimi K2.7 CodeMoonshot AI1188.522026-06-12evidence
Kimi K3 (low)Moonshot AI1272.512026-07-16evidence
Kimi K3 (max)Moonshot AI1675.222026-07-16evidence
LFM2.5-2.6BLiquid AI251.352026-08-04evidence
Ling 2.6 FlashInclusionAI544.892026-04-21evidence
Ling 3.0 FlashInclusionAI1105.372026-08-04evidence
Ling 3.0 TinyInclusionAI774.272026-08-06evidence
Llama 3.1 Instruct 8BMeta-102.282024-07-23evidence
Llama 3.3 Instruct 70BMeta96.32024-12-06evidence
Llama 4 MaverickMeta3.812025-04-05evidence
Llama 4 ScoutMeta108.342025-04-05evidence
LongCat 2.0LongCat1031.122026-06-29evidence
Magistral Medium 1.2Mistral413.412025-09-18evidence
Magistral Small 1.2Mistral263.082025-09-17evidence
Mercury 2Inception698.642026-02-20evidence
MiMo-V2-Flash (Non-reasoning)Xiaomi841.82025-12-16evidence
MiMo-V2.5Xiaomi1150.172026-04-22evidence
MiMo-V2.5-ProXiaomi1264.092026-04-22evidence
MiniCPM-V 4.6 1.3BOpenBMB-85.862026-05-11evidence
MiniMax-M2.7MiniMax1159.22026-03-18evidence
MiniMax-M3MiniMax1384.322026-06-01evidence
Ministral 3 14BMistral484.152025-12-02evidence
Ministral 3 3BMistral283.612025-12-02evidence
Ministral 3 8BMistral453.662025-12-02evidence
Mistral Large 3Mistral640.542025-12-02evidence
Mistral Medium 3.1Mistral608.12025-08-12evidence
Mistral Medium 3.5Mistral933.272026-04-29evidence
Mistral Small 3.1Mistral603.12025-03-17evidence
Mistral Small 3.2Mistral78.832025-06-20evidence
Mistral Small 4 (Reasoning)Mistral5882026-03-16evidence
Motif 3Motif Technologies1272.222026-08-12evidence
Motif 3 (Beta)Motif Technologies1254.552026-07-14evidence
Muse Glimmer (high)Meta955.942026-08-10evidence
Muse SparkMeta1146.992026-04-08evidence
Muse Spark 1.1 (xhigh)Meta1374.972026-07-09evidence
Muse Spark 1.2 (xhigh)Meta1622.632026-08-05evidence
Nanbeige4.1-3BNanbeige-1172026-02-11evidence
Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA466.422026-04-29evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA698.642026-03-11evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA1162.112026-06-04evidence
Nemotron 3.5 LightningNVIDIA826.122026-08-11evidence
Nemotron Cascade 2 30B A3BNVIDIA499.772026-03-19evidence
Nex-N2-ProNex AGI1250.22026-06-02evidence
North Mini CodeCohere542.22026-06-09evidence
Nova 2.0 Lite (high)Amazon588.642025-10-29evidence
Nova 2.0 Pro Preview (low)Amazon653.952025-11-27evidence
Nova 2.0 Pro Preview (medium)Amazon681.862025-11-27evidence
Nova 2.0 Pro Preview (Non-reasoning)Amazon561.792025-11-27evidence
NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA-72.592025-12-15evidence
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA490.462025-12-15evidence
NVIDIA Nemotron 3 Nano 4BNVIDIA203.82026-03-16evidence
o3-mini (high)OpenAI470.922025-01-31evidence
Phi-4 Mini InstructMicrosoft-122.532024-02-26evidence
Qwen3 14B (Reasoning)Qwen236.972025-04-28evidence
Qwen3 235B A22B 2507 (Reasoning)Qwen546.832025-07-25evidence
Qwen3 30B A3B 2507 (Reasoning)Qwen323.182025-07-30evidence
Qwen3 32B (Reasoning)Qwen289.742025-04-28evidence
Qwen3 8B (Reasoning)Qwen214.872025-04-28evidence
Qwen3 Coder NextQwen717.562026-02-03evidence
Qwen3 Next 80B A3B (Reasoning)Qwen375.692025-09-11evidence
Qwen3.5 0.8B (Non-reasoning)Qwen-82.622026-03-02evidence
Qwen3.5 0.8B (Reasoning)Qwen-103.022026-03-02evidence
Qwen3.5 122B A10B (Non-reasoning)Qwen893.942026-02-24evidence
Qwen3.5 122B A10B (Reasoning)Qwen986.892026-02-24evidence
Qwen3.5 2B (Non-reasoning)Qwen-81.032026-03-02evidence
Qwen3.5 2B (Reasoning)Qwen215.632026-03-02evidence
Qwen3.5 35B A3B (Non-reasoning)Qwen799.162026-02-24evidence
Qwen3.5 397B A17B (Reasoning)Qwen965.382026-02-16evidence
Qwen3.5 9B (Reasoning)Qwen643.742026-03-02evidence
Qwen3.6 27B (Non-reasoning)Qwen1110.072026-04-22evidence
Qwen3.6 27B (Reasoning)Qwen1139.862026-04-22evidence
Qwen3.6 35B A3B (Non-reasoning)Qwen1019.892026-04-16evidence
Qwen3.6 35B A3B (Reasoning)Qwen1056.422026-04-16evidence
Qwen3.6 PlusQwen1139.132026-04-02evidence
Qwen3.7 MaxQwen1268.162026-05-19evidence
Qwen3.7 PlusQwen946.32026-06-01evidence
Qwen3.8 2.4T A95BQwen1716.912026-08-12evidence
Qwen3.8 27B (low)Qwen1489.112026-08-14evidence
Qwen3.8 27B (medium)Qwen1518.92026-08-14evidence
Qwen3.8 27B (Non-reasoning)Qwen1210.942026-08-14evidence
Qwen3.8 27B (xhigh)Qwen1541.232026-08-14evidence
Qwen3.8 MaxQwen1730.022026-08-03evidence
Ring-2.6-1TInclusionAI922.852026-05-08evidence
Solar Open2 250BUpstage1123.742026-08-12evidence
Solar Pro 3Upstage497.742026-04-06evidence
Solar Pro 4Upstage1273.322026-08-06evidence
Step 3.7 FlashStepFun1019.572026-05-29evidence
Trinity Large ThinkingArcee AI562.512026-04-01evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.