Benchmark
Finance Agent v2
Finance Agent v2 is an agentic financial-analysis benchmark from Vals that evaluates models on real-world finance workflows, measuring their ability to…
- Modality
- text
- Categories
- reasoning, finance, agents
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 26
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude Fable 5 | Anthropic | 0.5631 | 2026-06-09 | evidence |
| Claude Haiku 4.5 | Anthropic | 0.3101 | 2025-10-15 | evidence |
| Claude Opus 4.7 | Anthropic | 0.5151 | 2026-04-16 | evidence |
| Claude Opus 4.8 | Anthropic | 0.5392 | 2026-05-28 | evidence |
| Claude Sonnet 4.6 | Anthropic | 0.5103 | 2026-02-17 | evidence |
| Gemini 3 Flash | 0.4255 | 2025-12-17 | evidence | |
| Gemini 3.1 Flash-Lite | 0.2999 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro | 0.4298 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash | 0.5786 | 2026-05-19 | evidence | |
| GLM-5.1 | Z.ai | 0.4479 | 2026-04-07 | evidence |
| GPT-5.4 mini | OpenAI | 0.4536 | 2026-03-17 | evidence |
| GPT-5.4 nano | OpenAI | 0.3822 | 2026-03-17 | evidence |
| GPT-5.5 | OpenAI | 0.5176 | 2026-04-23 | evidence |
| Grok 4.3 | xAI | 0.3771 | 2026-05-06 | evidence |
| Grok-4.20 Beta Reasoning | xAI | 0.2849 | 2026-03-09 | evidence |
| Kimi K2.6 | Moonshot AI | 0.4487 | 2026-04-20 | evidence |
| MiMo-V2.5 | Xiaomi | 0.3673 | 2026-04-22 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.415 | 2026-04-27 | evidence |
| MiniMax M2.7 | MiniMax | 0.2789 | 2026-03-18 | evidence |
| MiniMax M3 | MiniMax | 0.4827 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.321 | 2026-04-29 | evidence |
| Muse Spark 1.1 | Meta | 0.572 | 2026-07-09 | evidence |
| Nemotron 3 Ultra (550B A55B) | NVIDIA | 0.3753 | 2026-06-04 | evidence |
| Qwen3.6 Plus | Qwen | 0.4085 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 0.4835 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.3822 | 2026-05-31 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.