Benchmark

AA-Briefcase

Agentic knowledge work, Elo

Categories
agentic, business
Openness
unknown
Source
artificial_analysis
Reported scores
65

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic612.382025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1571.842026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic1274.512026-04-16evidence
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic1082.452026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic1338.422026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic1606.352026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic1225.512026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1710.262026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic1468.772026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic1686.332026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic1074.792026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic1193.882026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropic930.642026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic1383.742026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic1056.952026-06-30evidence
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic1291.782026-06-30evidence
Command A+Cohere370.672026-05-20evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek834.532026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek1283.732026-07-31evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek930.722026-04-24evidence
Gemini 3.1 Flash-LiteGoogle233.012026-03-03evidence
Gemini 3.1 Pro PreviewGoogle456.182026-02-19evidence
Gemini 3.5 Flash (high)Google872.362026-05-19evidence
Gemini 3.5 Flash (medium)Google871.892026-05-19evidence
Gemini 3.5 Flash-LiteGoogle635.622026-07-21evidence
Gemini 3.6 Flash (high)Google961.822026-07-21evidence
Gemini 3.7 Flash (high)Google1131.562026-08-13evidence
Gemma 4 31B (Reasoning)Google374.382026-04-02evidence
GLM-5.1 (Reasoning)Z.ai970.792026-04-07evidence
GLM-5.2 (max)Z.ai1251.242026-06-16evidence
GPT-5.3 Codex (xhigh)OpenAI870.922026-02-05evidence
GPT-5.4 mini (xhigh)OpenAI717.582026-03-17evidence
GPT-5.5 (high)OpenAI1099.32026-04-23evidence
GPT-5.5 (medium)OpenAI10002026-04-23evidence
GPT-5.5 (xhigh)OpenAI1150.862026-04-23evidence
GPT-5.6 Sol (max)OpenAI1502.552026-07-09evidence
gpt-oss-120b (high)OpenAI10.092025-08-05evidence
gpt-oss-20b (high)OpenAI02025-08-05evidence
Grok 4.3 (high)xAI759.782026-04-30evidence
Grok 4.5 (high)xAI1311.262026-07-08evidence
Grok 4.6 (high)xAI1576.342026-08-12evidence
Grok 4.6 (low)xAI1309.652026-08-12evidence
Grok 4.6 (medium)xAI1520.572026-08-12evidence
Grok 4.6 (xhigh)xAI1587.082026-08-12evidence
Inkling (xhigh)Thinking Machines837.912026-07-15evidence
Inkling SmallThinking Machines918.812026-07-30evidence
K2 Think V2MBZUAI Institute of Foundation Models612025-12-15evidence
KAT-Coder-Pro V1KwaiKAT598.982025-11-11evidence
Kimi K2.6Moonshot AI817.472026-04-20evidence
Kimi K3 (max)Moonshot AI1542.452026-07-16evidence
Llama 4 MaverickMeta02025-04-05evidence
MiMo-V2.5-ProXiaomi881.192026-04-22evidence
MiniMax-M3MiniMax1106.62026-06-01evidence
Mistral Medium 3.5Mistral517.52026-04-29evidence
Muse SparkMeta642.892026-04-08evidence
Muse Spark 1.1 (xhigh)Meta869.342026-07-09evidence
Muse Spark 1.2 (xhigh)Meta1362.672026-08-05evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA02026-03-11evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA875.062026-06-04evidence
North Mini CodeCohere239.642026-06-09evidence
Qwen3.5 397B A17B (Reasoning)Qwen555.072026-02-16evidence
Qwen3.6 27B (Reasoning)Qwen809.382026-04-22evidence
Qwen3.7 MaxQwen915.122026-05-19evidence
Qwen3.8 MaxQwen1419.712026-08-03evidence
Solar Pro 3Upstage140.142026-04-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.