Benchmark
APEX-Agents-AA
Long-horizon agentic tasks
- Categories
- agentic, reasoning
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 29
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.3303834808259587 | 2026-02-05 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.28023598820059 | 2026-02-17 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 0.145280235988201 | 2025-12-01 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.242625368731563 | 2026-04-24 | evidence |
| Gemini 3 Flash Preview (Reasoning) | 0.277286135693215 | 2025-12-17 | evidence | |
| Gemini 3.1 Flash-Lite | 0.121681415929204 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.320058997050148 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.470501474926254 | 2026-05-19 | evidence | |
| GLM-5 (Reasoning) | Z.ai | 0.14454277286135694 | 2026-02-11 | evidence |
| GLM-5.2 (max) | Z.ai | 0.337020648967552 | 2026-06-16 | evidence |
| GPT-5.4 (xhigh) | OpenAI | 0.33259587020649 | 2026-03-05 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.281710914454277 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.249262536873156 | 2026-03-17 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.376843657817109 | 2026-04-23 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.358407079646018 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.389380530973451 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.0309734513274336 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.00737463126843658 | 2025-08-05 | evidence |
| Grok 4.20 0309 (Reasoning) | xAI | 0.14233038348082597 | 2026-03-10 | evidence |
| Grok 4.3 (high) | xAI | 0.170353982300885 | 2026-04-30 | evidence |
| Kimi K2.5 (Reasoning) | Moonshot AI | 0.11504424778761062 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.284660766961652 | 2026-04-20 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.412979351032448 | 2026-07-16 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.0243362831858407 | 2026-04-22 | evidence |
| MiniMax-M2.7 | MiniMax | 0.106194690265487 | 2026-03-18 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 0.0184365781710914 | 2026-03-11 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.153392330383481 | 2026-02-16 | evidence |
| Qwen3.7 Plus | Qwen | 0.224188790560472 | 2026-06-01 | evidence |
| Step 3.7 Flash | StepFun | 0.148230088495575 | 2026-05-29 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.