Benchmark
Legal Agent Benchmark
The Legal Agent Benchmark (LAB) is Harvey's open-source benchmark for evaluating AI agents on complex, long-horizon legal work. Tasks are scored under an…
- Modality
- text
- Categories
- legal, reasoning, agents
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 13
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude Fable 5 | Anthropic | 0.133 | 2026-06-09 | evidence |
| Claude Opus 4.6 | Anthropic | 0.042 | 2026-02-05 | evidence |
| Claude Opus 4.7 | Anthropic | 0.071 | 2026-04-16 | evidence |
| Claude Opus 5 | Anthropic | 0.117 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 | Anthropic | 0.054 | 2026-02-17 | evidence |
| Claude Sonnet 5 | Anthropic | 0.058 | 2026-06-30 | evidence |
| Gemini 3 Flash | 0.0 | 2025-12-17 | evidence | |
| Gemini 3.1 Flash-Lite | 0.0 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro | 0.0 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash | 0.008 | 2026-05-19 | evidence | |
| GPT-5.4 | OpenAI | 0.004 | 2026-03-05 | evidence |
| GPT-5.4 mini | OpenAI | 0.0 | 2026-03-17 | evidence |
| GPT-5.5 | OpenAI | 0.021 | 2026-04-23 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.