Benchmark
EnterpriseOps-Gym-AA
Agentic business operations
- Categories
- agentic, business
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 33
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.29394210683378097 | 2025-10-15 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 0.5111906893464637 | 2026-06-09 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 0.4395702775290958 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.474783646672635 | 2026-07-24 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.4467323187108326 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.4386750223813787 | 2026-06-30 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.39570277529095793 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.40435690838555655 | 2026-04-24 | evidence |
| Gemini 3.1 Flash-Lite | 0.2802148612354521 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.42166517457475383 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.5007460459564309 | 2026-05-19 | evidence | |
| Gemma 4 31B (Reasoning) | 0.28349746344374815 | 2026-04-02 | evidence | |
| GLM-5.2 (max) | Z.ai | 0.42733512384362876 | 2026-06-16 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.3461653237839451 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.3148313936138466 | 2026-03-17 | evidence |
| GPT-5.5 (medium) | OpenAI | 0.44106236944195765 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.4664279319606088 | 2026-04-23 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.42912563413906296 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.25544613548194567 | 2025-08-05 | evidence |
| Grok 4.3 (high) | xAI | 0.26260817666368247 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.40823634735899733 | 2026-07-08 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.37958818263205013 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 0.4270367054610564 | 2026-07-30 | evidence |
| Kimi K2.6 | Moonshot AI | 0.3852581319009251 | 2026-04-20 | evidence |
| Kimi K2.7 Code | Moonshot AI | 0.40226797970754996 | 2026-06-12 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.45329752312742466 | 2026-07-16 | evidence |
| MiniMax-M3 | MiniMax | 0.3210981796478663 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.3372127723067741 | 2026-04-29 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.28886899433005075 | 2026-06-04 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.3088630259623993 | 2026-02-16 | evidence |
| Qwen3.7 Max | Qwen | 0.4500149209191286 | 2026-05-19 | evidence |
| Qwen3.7 Plus | Qwen | 0.40555058191584603 | 2026-06-01 | evidence |
| Step 3.7 Flash | StepFun | 0.29065950462548495 | 2026-05-29 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.