Benchmark

AutomationBench-AA

Agentic SaaS workflows

Categories
agentic, tool-use, business
Openness
unknown
Source
artificial_analysis
Reported scores
39

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic0.095539462757720392025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.485818512627549772026-06-09evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.485293861731757042026-05-28evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.238235994563858942026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.391900971197040152026-06-30evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.165821727120705062026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.188277159391338522026-04-24evidence
Gemini 3.1 Flash-LiteGoogle0.106415333202882542026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.375358461444015972026-02-19evidence
Gemini 3.5 Flash (high)Google0.426375463232346652026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.32659100918018922026-07-21evidence
Gemini 3.6 Flash (high)Google0.51076999156385652026-07-21evidence
Gemini 3.7 Flash (high)Google0.62745561997107922026-08-13evidence
GLM-5.2 (max)Z.ai0.278446250794018972026-06-16evidence
GPT-5.5 (high)OpenAI0.40164087910940862026-04-23evidence
GPT-5.5 (medium)OpenAI0.378099624221219072026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.421031323916685962026-04-23evidence
GPT-5.5 Instant (June 2026)OpenAI0.0135653016706733622026-06-25evidence
GPT-5.6 Luna (max)OpenAI0.42242258374500712026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.51187695134950012026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.45614489249291062026-07-09evidence
Grok 4.3 (high)xAI0.081188723187818142026-04-30evidence
Grok 4.5 (high)xAI0.51437407211869432026-07-08evidence
Inkling SmallThinking Machines0.093950526317302522026-07-30evidence
KAT-Coder-Pro V1KwaiKAT0.095821567324033142025-11-11evidence
Kimi K2.6Moonshot AI0.195527110529302972026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.225285866346787242026-06-12evidence
Kimi K3 (max)Moonshot AI0.52705884430667962026-07-16evidence
MiMo-V2.5-ProXiaomi0.16862446349255012026-04-22evidence
MiniMax-M3MiniMax0.15897774346701092026-06-01evidence
Mistral Medium 3.5Mistral0.136551236429599352026-04-29evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.056705623509083162026-06-04evidence
Nex-N2-ProNex AGI0.1940331750651742026-06-02evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.121956052694636612026-02-16evidence
Qwen3.6 PlusQwen0.186456160105188532026-04-02evidence
Qwen3.7 MaxQwen0.25575893705210272026-05-19evidence
Qwen3.7 PlusQwen0.204335402925799662026-06-01evidence
Ring-2.6-1TInclusionAI0.0210136174654606162026-05-08evidence
Step 3.7 FlashStepFun0.07004607124635572026-05-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.