Benchmark

Harvey LAB-AA

Legal agentic work, criterion pass rate

Categories
agentic, legal
Openness
unknown
Source
artificial_analysis
Reported scores
36

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic0.6105080330004342025-10-15evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.9355912577797082026-06-09evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.9108409321175282026-05-28evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.8597481545809812026-02-17evidence
Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic0.8444058474453612026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.9007092198581562026-06-30evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.8132870169344332026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.8439716312056742026-04-24evidence
Gemini 3.1 Flash-LiteGoogle0.3114777826024032026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.5885077435229412026-02-19evidence
Gemini 3.5 Flash (high)Google0.8208134317556812026-05-19evidence
Gemini 3.6 Flash (high)Google0.8514980460269212026-07-21evidence
Gemini 3.7 Flash (high)Google0.9066435084672172026-08-13evidence
Gemma 4 31B (Reasoning)Google0.472282530033292026-04-02evidence
GLM-5.2 (max)Z.ai0.9096830221450282026-06-16evidence
GPT-5.4 mini (xhigh)OpenAI0.6074685193226232026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.5223621363438992026-03-17evidence
GPT-5.5 (xhigh)OpenAI0.8627876682587932026-04-23evidence
GPT-5.6 Luna (max)OpenAI0.8789984078737882026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.8717614705456652026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.8517875235200462026-07-09evidence
gpt-oss-120b (high)OpenAI0.1389491966999572025-08-05evidence
Grok 4.3 (high)xAI0.6838905775075992026-04-30evidence
Grok 4.5 (high)xAI0.9241568968012742026-07-08evidence
Kimi K2.6Moonshot AI0.8412215950209872026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.8501953973078592026-06-12evidence
Kimi K3 (max)Moonshot AI0.9464466637718922026-07-16evidence
MiMo-V2.5-ProXiaomi0.7325227963525842026-04-22evidence
MiniMax-M3MiniMax0.8840642640034742026-06-01evidence
Mistral Medium 3.5Mistral0.6909827760891592026-04-29evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.817194963091622026-06-04evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.7238384715588362026-02-16evidence
Qwen3.6 27B (Reasoning)Qwen0.8229845129541182026-04-22evidence
Qwen3.7 MaxQwen0.8342741351859892026-05-19evidence
Qwen3.7 PlusQwen0.8179186568244322026-06-01evidence
Step 3.7 FlashStepFun0.7273122014763352026-05-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.