Benchmark
AA-Briefcase
Agentic knowledge work, Elo
- Categories
- agentic, business
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 65
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4.5 Haiku (Reasoning) | Anthropic | 612.38 | 2025-10-15 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 1571.84 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 1274.51 | 2026-04-16 | evidence |
| Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 1082.45 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 1338.42 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 1606.35 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 1225.51 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 1710.26 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 1468.77 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 1686.33 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 1074.79 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, High Effort) | Anthropic | 1193.88 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | 930.64 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 1383.74 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 1056.95 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 1291.78 | 2026-06-30 | evidence |
| Command A+ | Cohere | 370.67 | 2026-05-20 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 834.53 | 2026-04-24 | evidence |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 1283.73 | 2026-07-31 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 930.72 | 2026-04-24 | evidence |
| Gemini 3.1 Flash-Lite | 233.01 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 456.18 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 872.36 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash (medium) | 871.89 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash-Lite | 635.62 | 2026-07-21 | evidence | |
| Gemini 3.6 Flash (high) | 961.82 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 1131.56 | 2026-08-13 | evidence | |
| Gemma 4 31B (Reasoning) | 374.38 | 2026-04-02 | evidence | |
| GLM-5.1 (Reasoning) | Z.ai | 970.79 | 2026-04-07 | evidence |
| GLM-5.2 (max) | Z.ai | 1251.24 | 2026-06-16 | evidence |
| GPT-5.3 Codex (xhigh) | OpenAI | 870.92 | 2026-02-05 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 717.58 | 2026-03-17 | evidence |
| GPT-5.5 (high) | OpenAI | 1099.3 | 2026-04-23 | evidence |
| GPT-5.5 (medium) | OpenAI | 1000 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 1150.86 | 2026-04-23 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 1502.55 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 10.09 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0 | 2025-08-05 | evidence |
| Grok 4.3 (high) | xAI | 759.78 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 1311.26 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 1576.34 | 2026-08-12 | evidence |
| Grok 4.6 (low) | xAI | 1309.65 | 2026-08-12 | evidence |
| Grok 4.6 (medium) | xAI | 1520.57 | 2026-08-12 | evidence |
| Grok 4.6 (xhigh) | xAI | 1587.08 | 2026-08-12 | evidence |
| Inkling (xhigh) | Thinking Machines | 837.91 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 918.81 | 2026-07-30 | evidence |
| K2 Think V2 | MBZUAI Institute of Foundation Models | 61 | 2025-12-15 | evidence |
| KAT-Coder-Pro V1 | KwaiKAT | 598.98 | 2025-11-11 | evidence |
| Kimi K2.6 | Moonshot AI | 817.47 | 2026-04-20 | evidence |
| Kimi K3 (max) | Moonshot AI | 1542.45 | 2026-07-16 | evidence |
| Llama 4 Maverick | Meta | 0 | 2025-04-05 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 881.19 | 2026-04-22 | evidence |
| MiniMax-M3 | MiniMax | 1106.6 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 517.5 | 2026-04-29 | evidence |
| Muse Spark | Meta | 642.89 | 2026-04-08 | evidence |
| Muse Spark 1.1 (xhigh) | Meta | 869.34 | 2026-07-09 | evidence |
| Muse Spark 1.2 (xhigh) | Meta | 1362.67 | 2026-08-05 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 0 | 2026-03-11 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 875.06 | 2026-06-04 | evidence |
| North Mini Code | Cohere | 239.64 | 2026-06-09 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 555.07 | 2026-02-16 | evidence |
| Qwen3.6 27B (Reasoning) | Qwen | 809.38 | 2026-04-22 | evidence |
| Qwen3.7 Max | Qwen | 915.12 | 2026-05-19 | evidence |
| Qwen3.8 Max | Qwen | 1419.71 | 2026-08-03 | evidence |
| Solar Pro 3 | Upstage | 140.14 | 2026-04-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.