Benchmark
BrowseComp
BrowseComp is a benchmark comprising 1,266 questions that challenge AI agents to persistently navigate the internet in search of hard-to-find, entangled…
- Modality
- text
- Categories
- reasoning, search, agents
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 62
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude Mythos Preview | Anthropic | 0.869 | 2026-04-07 | evidence |
| Claude Opus 4.6 | Anthropic | 0.84 | 2026-02-05 | evidence |
| Claude Opus 4.7 | Anthropic | 0.793 | 2026-04-16 | evidence |
| Claude Opus 4.8 | Anthropic | 0.843 | 2026-05-28 | evidence |
| Claude Opus 5 | Anthropic | 0.908 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 | Anthropic | 0.747 | 2026-02-17 | evidence |
| Claude Sonnet 5 | Anthropic | 0.847 | 2026-06-30 | evidence |
| DeepSeek-R1-0528 | DeepSeek | 0.089 | 2025-05-28 | evidence |
| DeepSeek-V3.1 | DeepSeek | 0.3 | 2025-01-10 | evidence |
| DeepSeek-V3.2 | DeepSeek | 0.514 | 2025-12-01 | evidence |
| DeepSeek-V3.2 (Thinking) | DeepSeek | 0.514 | 2025-12-01 | evidence |
| DeepSeek-V3.2-Exp | DeepSeek | 0.401 | 2025-09-29 | evidence |
| DeepSeek-V4-Flash-0423 | DeepSeek | 0.535 | 2026-04-23 | evidence |
| DeepSeek-V4-Flash-Max | DeepSeek | 0.732 | 2026-04-23 | evidence |
| DeepSeek-V4-Pro-Max | DeepSeek | 0.834 | 2026-04-23 | evidence |
| Gemini 3.1 Pro | 0.859 | 2026-02-19 | evidence | |
| GLM-4.5 | Z.ai | 0.264 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.213 | 2025-07-28 | evidence |
| GLM-4.6 | Z.ai | 0.451 | 2025-09-30 | evidence |
| GLM-4.7 | Z.ai | 0.52 | 2025-12-22 | evidence |
| GLM-4.7-Flash | Z.ai | 0.428 | 2026-01-19 | evidence |
| GLM-5 | Z.ai | 0.759 | 2026-02-11 | evidence |
| GLM-5.1 | Z.ai | 0.793 | 2026-04-07 | evidence |
| GPT-5 | OpenAI | 0.549 | 2025-08-07 | evidence |
| GPT-5.2 | OpenAI | 0.658 | 2025-12-11 | evidence |
| GPT-5.2 Pro | OpenAI | 0.779 | 2025-12-11 | evidence |
| GPT-5.4 | OpenAI | 0.827 | 2026-03-05 | evidence |
| GPT-5.5 | OpenAI | 0.844 | 2026-04-23 | evidence |
| GPT-5.5 Pro | OpenAI | 0.901 | 2026-04-23 | evidence |
| GPT-5.6 Luna | OpenAI | 0.833 | 2026-07-09 | evidence |
| GPT-5.6 Sol | OpenAI | 0.904 | 2026-07-09 | evidence |
| GPT-5.6 Terra | OpenAI | 0.875 | 2026-07-09 | evidence |
| Grok 4 Fast | xAI | 0.449 | 2025-08-28 | evidence |
| Hy3 | Tencent | 0.842 | 2026-07-06 | evidence |
| Inkling-Small | Thinking Machines Lab | 0.774 | 2026-07-30 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.602 | 2025-09-05 | evidence |
| Kimi K2.5 | Moonshot AI | 0.749 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.863 | 2026-04-20 | evidence |
| Kimi K3 | Moonshot AI | 0.912 | 2026-07-16 | evidence |
| LongCat-Flash-Thinking-2601 | Meituan | 0.566 | 2026-01-14 | evidence |
| MiMo-V2-Flash | Xiaomi | 0.583 | 2025-12-16 | evidence |
| MiniMax M2 | MiniMax | 0.44 | 2025-10-27 | evidence |
| MiniMax M2.1 | MiniMax | 0.62 | 2025-12-23 | evidence |
| MiniMax M2.5 | MiniMax | 0.763 | 2026-02-12 | evidence |
| MiniMax M3 | MiniMax | 0.8352 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.486 | 2026-04-29 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.3128 | 2026-03-11 | evidence |
| Nemotron 3 Ultra (550B A55B) | NVIDIA | 0.444 | 2026-06-04 | evidence |
| Nemotron 3.5 Lightning (30B A3B) | NVIDIA | 0.3697 | 2026-08-11 | evidence |
| o3 | OpenAI | 0.497 | 2025-04-16 | evidence |
| o4-mini | OpenAI | 0.515 | 2025-04-16 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.638 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.61 | 2026-02-24 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.61 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.69 | 2026-02-16 | evidence |
| Sarvam-105B | Sarvam AI | 0.495 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.355 | 2026-03-06 | evidence |
| Seed 2.0 Pro | ByteDance | 0.773 | 2026-02-14 | evidence |
| Seed 2.1 Pro | ByteDance | 0.862 | 2026-06-24 | evidence |
| Seed 2.1 Turbo | ByteDance | 0.849 | 2026-06-24 | evidence |
| Solar Pro 4 | Upstage | 0.492 | 2026-08-06 | evidence |
| Step-3.5-Flash | StepFun | 0.69 | 2026-02-02 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.