Benchmark

AA-AnalystAgent

Quantitative analysis on spreadsheets & documents

Categories
agentic, business, reasoning
Openness
unknown
Source
artificial_analysis
Reported scores
30

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic0.152025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.48752026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic0.43752026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.452026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.53752026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.22026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.46252026-06-30evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.252026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.18752026-04-24evidence
Gemini 3.1 Flash-LiteGoogle0.08752026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.41252026-02-19evidence
Gemini 3.5 Flash (high)Google0.452026-05-19evidence
Gemini 3.7 Flash (high)Google0.62026-08-13evidence
GPT-5.4 mini (xhigh)OpenAI0.152026-03-17evidence
GPT-5.5 (Non-reasoning)OpenAI0.0752026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.52026-04-23evidence
GPT-5.6 Sol (max)OpenAI0.4752026-07-09evidence
Grok 4.3 (high)xAI0.08752026-04-30evidence
Grok 4.5 (high)xAI0.352026-07-08evidence
Grok 4.6 (high)xAI0.41252026-08-12evidence
Inkling (xhigh)Thinking Machines0.23752026-07-15evidence
Inkling SmallThinking Machines0.2752026-07-30evidence
Kimi K3 (max)Moonshot AI0.38752026-07-16evidence
MiMo-V2.5-ProXiaomi0.22026-04-22evidence
MiniMax-M2.7MiniMax0.11252026-03-18evidence
MiniMax-M3MiniMax0.12026-06-01evidence
Mistral Medium 3.5Mistral0.1252026-04-29evidence
Mistral Small 4 (Reasoning)Mistral0.01252026-03-16evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.06252026-06-04evidence
Qwen3.7 MaxQwen0.18752026-05-19evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.