Benchmark

EnterpriseOps-Gym-AA

Agentic business operations

Categories
agentic, business
Openness
unknown
Source
artificial_analysis
Reported scores
33

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic0.293942106833780972025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.51119068934646372026-06-09evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.43957027752909582026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.4747836466726352026-07-24evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.44673231871083262026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.43867502238137872026-06-30evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.395702775290957932026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.404356908385556552026-04-24evidence
Gemini 3.1 Flash-LiteGoogle0.28021486123545212026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.421665174574753832026-02-19evidence
Gemini 3.5 Flash (high)Google0.50074604595643092026-05-19evidence
Gemma 4 31B (Reasoning)Google0.283497463443748152026-04-02evidence
GLM-5.2 (max)Z.ai0.427335123843628762026-06-16evidence
GPT-5.4 mini (xhigh)OpenAI0.34616532378394512026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.31483139361384662026-03-17evidence
GPT-5.5 (medium)OpenAI0.441062369441957652026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.46642793196060882026-04-23evidence
GPT-5.6 Sol (max)OpenAI0.429125634139062962026-07-09evidence
gpt-oss-120b (high)OpenAI0.255446135481945672025-08-05evidence
Grok 4.3 (high)xAI0.262608176663682472026-04-30evidence
Grok 4.5 (high)xAI0.408236347358997332026-07-08evidence
Inkling (xhigh)Thinking Machines0.379588182632050132026-07-15evidence
Inkling SmallThinking Machines0.42703670546105642026-07-30evidence
Kimi K2.6Moonshot AI0.38525813190092512026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.402267979707549962026-06-12evidence
Kimi K3 (max)Moonshot AI0.453297523127424662026-07-16evidence
MiniMax-M3MiniMax0.32109817964786632026-06-01evidence
Mistral Medium 3.5Mistral0.33721277230677412026-04-29evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.288868994330050752026-06-04evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.30886302596239932026-02-16evidence
Qwen3.7 MaxQwen0.45001492091912862026-05-19evidence
Qwen3.7 PlusQwen0.405550581915846032026-06-01evidence
Step 3.7 FlashStepFun0.290659504625484952026-05-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.