Benchmark

BrowseComp

BrowseComp is a benchmark comprising 1,266 questions that challenge AI agents to persistently navigate the internet in search of hard-to-find, entangled…

Modality
text
Categories
reasoning, search, agents
Openness
unknown
Source
llm_stats
Reported scores
62

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Mythos PreviewAnthropic0.8692026-04-07evidence
Claude Opus 4.6Anthropic0.842026-02-05evidence
Claude Opus 4.7Anthropic0.7932026-04-16evidence
Claude Opus 4.8Anthropic0.8432026-05-28evidence
Claude Opus 5Anthropic0.9082026-07-24evidence
Claude Sonnet 4.6Anthropic0.7472026-02-17evidence
Claude Sonnet 5Anthropic0.8472026-06-30evidence
DeepSeek-R1-0528DeepSeek0.0892025-05-28evidence
DeepSeek-V3.1DeepSeek0.32025-01-10evidence
DeepSeek-V3.2DeepSeek0.5142025-12-01evidence
DeepSeek-V3.2 (Thinking)DeepSeek0.5142025-12-01evidence
DeepSeek-V3.2-ExpDeepSeek0.4012025-09-29evidence
DeepSeek-V4-Flash-0423DeepSeek0.5352026-04-23evidence
DeepSeek-V4-Flash-MaxDeepSeek0.7322026-04-23evidence
DeepSeek-V4-Pro-MaxDeepSeek0.8342026-04-23evidence
Gemini 3.1 ProGoogle0.8592026-02-19evidence
GLM-4.5Z.ai0.2642025-07-28evidence
GLM-4.5-AirZ.ai0.2132025-07-28evidence
GLM-4.6Z.ai0.4512025-09-30evidence
GLM-4.7Z.ai0.522025-12-22evidence
GLM-4.7-FlashZ.ai0.4282026-01-19evidence
GLM-5Z.ai0.7592026-02-11evidence
GLM-5.1Z.ai0.7932026-04-07evidence
GPT-5OpenAI0.5492025-08-07evidence
GPT-5.2OpenAI0.6582025-12-11evidence
GPT-5.2 ProOpenAI0.7792025-12-11evidence
GPT-5.4OpenAI0.8272026-03-05evidence
GPT-5.5OpenAI0.8442026-04-23evidence
GPT-5.5 ProOpenAI0.9012026-04-23evidence
GPT-5.6 LunaOpenAI0.8332026-07-09evidence
GPT-5.6 SolOpenAI0.9042026-07-09evidence
GPT-5.6 TerraOpenAI0.8752026-07-09evidence
Grok 4 FastxAI0.4492025-08-28evidence
Hy3Tencent0.8422026-07-06evidence
Inkling-SmallThinking Machines Lab0.7742026-07-30evidence
Kimi K2-Thinking-0905Moonshot AI0.6022025-09-05evidence
Kimi K2.5Moonshot AI0.7492026-01-27evidence
Kimi K2.6Moonshot AI0.8632026-04-20evidence
Kimi K3Moonshot AI0.9122026-07-16evidence
LongCat-Flash-Thinking-2601Meituan0.5662026-01-14evidence
MiMo-V2-FlashXiaomi0.5832025-12-16evidence
MiniMax M2MiniMax0.442025-10-27evidence
MiniMax M2.1MiniMax0.622025-12-23evidence
MiniMax M2.5MiniMax0.7632026-02-12evidence
MiniMax M3MiniMax0.83522026-06-01evidence
Mistral Medium 3.5Mistral0.4862026-04-29evidence
Nemotron 3 Super (120B A12B)NVIDIA0.31282026-03-11evidence
Nemotron 3 Ultra (550B A55B)NVIDIA0.4442026-06-04evidence
Nemotron 3.5 Lightning (30B A3B)NVIDIA0.36972026-08-11evidence
o3OpenAI0.4972025-04-16evidence
o4-miniOpenAI0.5152025-04-16evidence
Qwen3.5-122B-A10BQwen0.6382026-02-24evidence
Qwen3.5-27BQwen0.612026-02-24evidence
Qwen3.5-35B-A3BQwen0.612026-02-24evidence
Qwen3.5-397B-A17BQwen0.692026-02-16evidence
Sarvam-105BSarvam AI0.4952026-03-06evidence
Sarvam-30BSarvam AI0.3552026-03-06evidence
Seed 2.0 ProByteDance0.7732026-02-14evidence
Seed 2.1 ProByteDance0.8622026-06-24evidence
Seed 2.1 TurboByteDance0.8492026-06-24evidence
Solar Pro 4Upstage0.4922026-08-06evidence
Step-3.5-FlashStepFun0.692026-02-02evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.