Benchmark
AA-AnalystAgent
Quantitative analysis on spreadsheets & documents
- Categories
- agentic, business, reasoning
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 30
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.15 | 2025-10-15 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 0.4875 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 0.4375 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 0.45 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.5375 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.2 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.4625 | 2026-06-30 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.25 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.1875 | 2026-04-24 | evidence |
| Gemini 3.1 Flash-Lite | 0.0875 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.4125 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.45 | 2026-05-19 | evidence | |
| Gemini 3.7 Flash (high) | 0.6 | 2026-08-13 | evidence | |
| GPT-5.4 mini (xhigh) | OpenAI | 0.15 | 2026-03-17 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 0.075 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.5 | 2026-04-23 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.475 | 2026-07-09 | evidence |
| Grok 4.3 (high) | xAI | 0.0875 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.35 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 0.4125 | 2026-08-12 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.2375 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 0.275 | 2026-07-30 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.3875 | 2026-07-16 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.2 | 2026-04-22 | evidence |
| MiniMax-M2.7 | MiniMax | 0.1125 | 2026-03-18 | evidence |
| MiniMax-M3 | MiniMax | 0.1 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.125 | 2026-04-29 | evidence |
| Mistral Small 4 (Reasoning) | Mistral | 0.0125 | 2026-03-16 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.0625 | 2026-06-04 | evidence |
| Qwen3.7 Max | Qwen | 0.1875 | 2026-05-19 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.