Benchmark
Terminal-Bench
Terminal-Bench is a benchmark for testing AI agents in real terminal environments. It evaluates how well agents can handle real-world, end-to-end tasks…
- Modality
- text
- Categories
- reasoning, agents, code
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 25
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.7 Sonnet | Anthropic | 0.352 | 2025-02-24 | evidence |
| Claude Haiku 4.5 | Anthropic | 0.41 | 2025-10-15 | evidence |
| Claude Opus 4 | Anthropic | 0.392 | 2025-05-22 | evidence |
| Claude Opus 4.1 | Anthropic | 0.433 | 2025-08-05 | evidence |
| Claude Sonnet 4 | Anthropic | 0.355 | 2025-05-22 | evidence |
| Claude Sonnet 4.5 | Anthropic | 0.5 | 2025-09-29 | evidence |
| DeepSeek-R1-0528 | DeepSeek | 0.057 | 2025-05-28 | evidence |
| DeepSeek-V3.1 | DeepSeek | 0.313 | 2025-01-10 | evidence |
| DeepSeek-V3.2-Exp | DeepSeek | 0.377 | 2025-09-29 | evidence |
| GLM-4.5 | Z.ai | 0.375 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.3 | 2025-07-28 | evidence |
| GLM-4.6 | Z.ai | 0.405 | 2025-09-30 | evidence |
| GLM-4.7 | Z.ai | 0.333 | 2025-12-22 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.3 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.25 | 2025-09-05 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.471 | 2025-09-05 | evidence |
| LongCat-Flash-Chat | Meituan | 0.3951 | 2025-08-29 | evidence |
| LongCat-Flash-Lite | Meituan | 0.3375 | 2026-02-05 | evidence |
| MiMo-V2-Flash | Xiaomi | 0.305 | 2025-12-16 | evidence |
| MiniMax M2 | MiniMax | 0.463 | 2025-10-27 | evidence |
| MiniMax M2.1 | MiniMax | 0.479 | 2025-12-23 | evidence |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.085 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.2578 | 2026-03-11 | evidence |
| Nova 2 Lite | Amazon | 0.325 | 2025-12-02 | evidence |
| Nova 2 Pro | Amazon | 0.413 | 2025-12-02 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.