Benchmark

Terminal-Bench 2.0

Terminal-Bench 2.0 is an updated benchmark for testing AI agents' tool use ability to operate a computer via terminal. It evaluates how well models can…

Modality
text
Categories
reasoning, agents, code, tool_calling
Openness
unknown
Source
llm_stats
Reported scores
51

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Mythos PreviewAnthropic0.822026-04-07evidence
Claude Opus 4.5Anthropic0.5932025-11-24evidence
Claude Opus 4.6Anthropic0.6542026-02-05evidence
Claude Opus 4.7Anthropic0.6942026-04-16evidence
Claude Opus 4.8Anthropic0.7462026-05-28evidence
Claude Sonnet 4.6Anthropic0.5912026-02-17evidence
Claude Sonnet 5Anthropic0.8042026-06-30evidence
DeepSeek-V3.2DeepSeek0.4642025-12-01evidence
DeepSeek-V3.2 (Thinking)DeepSeek0.4642025-12-01evidence
DeepSeek-V3.2-SpecialeDeepSeek0.4642025-12-01evidence
DeepSeek-V4-Flash-0423DeepSeek0.5662026-04-23evidence
DeepSeek-V4-Flash-MaxDeepSeek0.5692026-04-23evidence
DeepSeek-V4-Pro-MaxDeepSeek0.6792026-04-23evidence
Gemini 3 FlashGoogle0.4762025-12-17evidence
Gemini 3 ProGoogle0.5422025-11-18evidence
Gemini 3.1 ProGoogle0.6852026-02-19evidence
Gemini 3.5 FlashGoogle0.7622026-05-19evidence
GLM-4.7Z.ai0.412025-12-22evidence
GLM-5Z.ai0.5622026-02-11evidence
GLM-5.1Z.ai0.692026-04-07evidence
GPT-5.1 CodexOpenAI0.5282025-11-19evidence
GPT-5.2 CodexOpenAI0.642026-01-14evidence
GPT-5.3 CodexOpenAI0.7732026-02-05evidence
GPT-5.4OpenAI0.7512026-03-05evidence
GPT-5.4 miniOpenAI0.62026-03-17evidence
GPT-5.4 nanoOpenAI0.4632026-03-17evidence
GPT-5.5OpenAI0.8272026-04-23evidence
Kimi K2.5Moonshot AI0.5082026-01-27evidence
Kimi K2.6Moonshot AI0.6672026-04-20evidence
Laguna XS 2.1Poolside0.3752026-07-02evidence
MAI-Code-1-FlashMicrosoft0.5482026-06-02evidence
MAI-Thinking-1Microsoft0.462026-06-02evidence
MiMo-V2-FlashXiaomi0.3852025-12-16evidence
MiMo-V2-ProXiaomi0.5712026-03-18evidence
MiMo-V2.5Xiaomi0.6582026-04-22evidence
MiMo-V2.5-ProXiaomi0.6842026-04-27evidence
MiniMax M2.7MiniMax0.572026-03-18evidence
Muse SparkMeta0.592026-04-08evidence
Nemotron 3 Super (120B A12B)NVIDIA0.312026-03-11evidence
North Mini Code 1.0Cohere0.362026-06-09evidence
Qwen3-Coder 480B A35B InstructQwen0.3752025-01-31evidence
Qwen3.5-122B-A10BQwen0.4942026-02-24evidence
Qwen3.5-27BQwen0.4162026-02-24evidence
Qwen3.5-35B-A3BQwen0.4052026-02-24evidence
Qwen3.5-397B-A17BQwen0.5252026-02-16evidence
Qwen3.6 PlusQwen0.6162026-04-02evidence
Qwen3.6-27BQwen0.5932026-04-21evidence
Qwen3.6-35B-A3BQwen0.5152026-04-16evidence
Qwen3.7 MaxQwen0.6972026-05-19evidence
Qwen3.7-PlusQwen0.7032026-05-31evidence
Step-3.5-FlashStepFun0.512026-02-02evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.