Benchmark

Finance Agent v2

Finance Agent v2 is an agentic financial-analysis benchmark from Vals that evaluates models on real-world finance workflows, measuring their ability to…

Modality
text
Categories
reasoning, finance, agents
Openness
unknown
Source
llm_stats
Reported scores
26

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Fable 5Anthropic0.56312026-06-09evidence
Claude Haiku 4.5Anthropic0.31012025-10-15evidence
Claude Opus 4.7Anthropic0.51512026-04-16evidence
Claude Opus 4.8Anthropic0.53922026-05-28evidence
Claude Sonnet 4.6Anthropic0.51032026-02-17evidence
Gemini 3 FlashGoogle0.42552025-12-17evidence
Gemini 3.1 Flash-LiteGoogle0.29992026-03-03evidence
Gemini 3.1 ProGoogle0.42982026-02-19evidence
Gemini 3.5 FlashGoogle0.57862026-05-19evidence
GLM-5.1Z.ai0.44792026-04-07evidence
GPT-5.4 miniOpenAI0.45362026-03-17evidence
GPT-5.4 nanoOpenAI0.38222026-03-17evidence
GPT-5.5OpenAI0.51762026-04-23evidence
Grok 4.3xAI0.37712026-05-06evidence
Grok-4.20 Beta ReasoningxAI0.28492026-03-09evidence
Kimi K2.6Moonshot AI0.44872026-04-20evidence
MiMo-V2.5Xiaomi0.36732026-04-22evidence
MiMo-V2.5-ProXiaomi0.4152026-04-27evidence
MiniMax M2.7MiniMax0.27892026-03-18evidence
MiniMax M3MiniMax0.48272026-06-01evidence
Mistral Medium 3.5Mistral0.3212026-04-29evidence
Muse Spark 1.1Meta0.5722026-07-09evidence
Nemotron 3 Ultra (550B A55B)NVIDIA0.37532026-06-04evidence
Qwen3.6 PlusQwen0.40852026-04-02evidence
Qwen3.7 MaxQwen0.48352026-05-19evidence
Qwen3.7-PlusQwen0.38222026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.