Benchmark

APEX-Agents-AA

Long-horizon agentic tasks

Categories
agentic, reasoning
Openness
unknown
Source
artificial_analysis
Reported scores
29

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.33038348082595872026-02-05evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.280235988200592026-02-17evidence
DeepSeek V3.2 (Reasoning)DeepSeek0.1452802359882012025-12-01evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.2426253687315632026-04-24evidence
Gemini 3 Flash Preview (Reasoning)Google0.2772861356932152025-12-17evidence
Gemini 3.1 Flash-LiteGoogle0.1216814159292042026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.3200589970501482026-02-19evidence
Gemini 3.5 Flash (high)Google0.4705014749262542026-05-19evidence
GLM-5 (Reasoning)Z.ai0.144542772861356942026-02-11evidence
GLM-5.2 (max)Z.ai0.3370206489675522026-06-16evidence
GPT-5.4 (xhigh)OpenAI0.332595870206492026-03-05evidence
GPT-5.4 mini (xhigh)OpenAI0.2817109144542772026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.2492625368731562026-03-17evidence
GPT-5.5 (xhigh)OpenAI0.3768436578171092026-04-23evidence
GPT-5.6 Luna (max)OpenAI0.3584070796460182026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.3893805309734512026-07-09evidence
gpt-oss-120b (high)OpenAI0.03097345132743362025-08-05evidence
gpt-oss-20b (high)OpenAI0.007374631268436582025-08-05evidence
Grok 4.20 0309 (Reasoning)xAI0.142330383480825972026-03-10evidence
Grok 4.3 (high)xAI0.1703539823008852026-04-30evidence
Kimi K2.5 (Reasoning)Moonshot AI0.115044247787610622026-01-27evidence
Kimi K2.6Moonshot AI0.2846607669616522026-04-20evidence
Kimi K3 (max)Moonshot AI0.4129793510324482026-07-16evidence
MiMo-V2.5-ProXiaomi0.02433628318584072026-04-22evidence
MiniMax-M2.7MiniMax0.1061946902654872026-03-18evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA0.01843657817109142026-03-11evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.1533923303834812026-02-16evidence
Qwen3.7 PlusQwen0.2241887905604722026-06-01evidence
Step 3.7 FlashStepFun0.1482300884955752026-05-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.