Benchmark

Terminal-Bench v2.1

Agentic coding & terminal use

Categories
intelligence-index, agentic, coding, tool-use
Openness
unknown
Source
artificial_analysis
Reported scores
210

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
A.X-K2SK Telecom0.3895131086142322026-08-12evidence
Agnes 2.5 Pro AlphaSapiens AI0.6704119850187272026-07-24evidence
Celeris-1Celeris0.1123595505617982026-07-24evidence
Claude 3.5 HaikuAnthropic0.1011235955056182024-10-22evidence
Claude 4 Sonnet (Reasoning)Anthropic0.3632958801498132025-05-22evidence
Claude 4.5 Haiku (Reasoning)Anthropic0.4419475655430712025-10-15evidence
Claude 4.5 Sonnet (Reasoning)Anthropic0.5580524344569292025-09-29evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.8464419475655432026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic0.8314606741573032026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.8464419475655432026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic0.8764044943820232026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic0.7640449438202252026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.8913857677902622026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic0.8614232209737832026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.8801498127340822026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.7116104868913862026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.8052434456928842026-06-30evidence
Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic0.7528089887640452026-06-30evidence
Command A+Cohere0.2284644194756552026-05-20evidence
DeepSeek R1 (Jan '25)DeepSeek0.1910112359550562025-01-20evidence
DeepSeek V3 (Dec '24)DeepSeek0.1685393258426972024-12-26evidence
DeepSeek V3 0324DeepSeek0.1385767790262172025-03-25evidence
DeepSeek V3.1 Terminus (Reasoning)DeepSeek0.4494382022471912025-09-22evidence
DeepSeek V3.2 (Reasoning)DeepSeek0.4681647940074912025-12-01evidence
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek0.5692883895131092026-04-24evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.6179775280898882026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek0.7865168539325842026-07-31evidence
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek0.7415730337078652026-08-21evidence
DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek0.6479400749063672026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.6404494382022472026-04-24evidence
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek0.7865168539325842026-08-13evidence
Devstral 2Mistral0.3033707865168542025-12-09evidence
Devstral Small 2Mistral0.2958801498127342025-12-09evidence
DiffusionGemma 26B A4BGoogle0.1235955056179782026-06-10evidence
EXAONE 4.5 33BLG AI Research0.2134831460674162026-04-09evidence
G9v3-39A5BAI9Stars0.3258426966292142026-08-20evidence
G9v3-3BAI9Stars0.05992509363295882026-07-23evidence
Gemini 2.5 ProGoogle0.2846441947565542025-06-05evidence
Gemini 3.1 Flash-LiteGoogle0.3108614232209742026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.7378277153558052026-02-19evidence
Gemini 3.5 Flash (high)Google0.7865168539325842026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.5355805243445692026-07-21evidence
Gemini 3.6 Flash (high)Google0.7752808988764052026-07-21evidence
Gemini 3.7 Flash (high)Google0.8576779026217232026-08-13evidence
Gemini 3.7 Flash (low)Google0.7977528089887642026-08-13evidence
Gemini 3.7 Flash (medium)Google0.7827715355805242026-08-13evidence
Gemma 3 12B InstructGoogle02025-03-12evidence
Gemma 3 27B InstructGoogle0.04494382022471912025-03-12evidence
Gemma 3 4B InstructGoogle0.003745318352059932025-03-12evidence
Gemma 3n E4B InstructGoogle0.007490636704119852025-06-26evidence
Gemma 4 12B (Reasoning)Google0.2734082397003752026-06-03evidence
Gemma 4 26B A4B (Reasoning)Google0.3895131086142322026-04-02evidence
Gemma 4 31B (Non-reasoning)Google0.2921348314606742026-04-02evidence
Gemma 4 31B (Reasoning)Google0.4344569288389512026-04-02evidence
Gemma 4 E2B (Reasoning)Google0.003745318352059932026-04-02evidence
Gemma 4 E4B (Reasoning)Google0.01872659176029962026-04-03evidence
GLM-4.6 (Reasoning)Z.ai0.494382022471912025-09-30evidence
GLM-4.7 (Reasoning)Z.ai0.4531835205992512025-12-22evidence
GLM-5.1 (Reasoning)Z.ai0.6179775280898882026-04-07evidence
GLM-5.2 (max)Z.ai0.7790262172284642026-06-16evidence
GLM-5.2 (Non-reasoning)Z.ai0.516853932584272026-06-16evidence
GLM-5.3 (max)Z.ai0.8389513108614232026-08-18evidence
GPT-4.1 miniOpenAI0.1011235955056182025-04-14evidence
GPT-4.1 nanoOpenAI0.03745318352059932025-04-14evidence
GPT-4o miniOpenAI0.05617977528089892024-07-18evidence
GPT-5 (high)OpenAI0.3520599250936332025-08-07evidence
GPT-5 mini (high)OpenAI0.03745318352059932025-08-07evidence
GPT-5.1 (high)OpenAI0.5243445692883892025-11-13evidence
GPT-5.4 (xhigh)OpenAI0.7827715355805242026-03-05evidence
GPT-5.4 mini (xhigh)OpenAI0.5917602996254682026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.6067415730337082026-03-17evidence
GPT-5.5 (high)OpenAI0.7940074906367042026-04-23evidence
GPT-5.5 (low)OpenAI0.6554307116104872026-04-23evidence
GPT-5.5 (medium)OpenAI0.8052434456928842026-04-23evidence
GPT-5.5 (Non-reasoning)OpenAI0.6104868913857682026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.8426966292134832026-04-23evidence
GPT-5.5 Instant (June 2026)OpenAI0.3483146067415732026-06-25evidence
GPT-5.6 Luna (high)OpenAI0.6966292134831462026-07-09evidence
GPT-5.6 Luna (low)OpenAI0.4344569288389512026-07-09evidence
GPT-5.6 Luna (max)OpenAI0.8089887640449442026-07-09evidence
GPT-5.6 Luna (medium)OpenAI0.5318352059925092026-07-09evidence
GPT-5.6 Luna (Non-reasoning)OpenAI0.3895131086142322026-07-09evidence
GPT-5.6 Luna (xhigh)OpenAI0.7790262172284642026-07-09evidence
GPT-5.6 Sol (high)OpenAI0.8726591760299632026-07-09evidence
GPT-5.6 Sol (low)OpenAI0.7677902621722852026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.8801498127340822026-07-09evidence
GPT-5.6 Sol (medium)OpenAI0.8614232209737832026-07-09evidence
GPT-5.6 Sol (Non-reasoning)OpenAI0.7415730337078652026-07-09evidence
GPT-5.6 Sol (xhigh)OpenAI0.8951310861423222026-07-09evidence
GPT-5.6 Terra (high)OpenAI0.7565543071161052026-07-09evidence
GPT-5.6 Terra (low)OpenAI0.6254681647940072026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.8801498127340822026-07-09evidence
GPT-5.6 Terra (medium)OpenAI0.7228464419475662026-07-09evidence
GPT-5.6 Terra (Non-reasoning)OpenAI0.5617977528089892026-07-09evidence
GPT-5.6 Terra (xhigh)OpenAI0.8014981273408242026-07-09evidence
gpt-oss-120b (high)OpenAI0.2621722846441952025-08-05evidence
gpt-oss-120b (low)OpenAI0.1385767790262172025-08-05evidence
gpt-oss-20b (high)OpenAI0.1385767790262172025-08-05evidence
Granite 4.1 30BIBM0.02621722846441952026-04-29evidence
Granite 4.1 3BIBM0.01123595505617982026-04-29evidence
Granite 4.1 8BIBM0.03370786516853932026-04-29evidence
Grok 4.3 (high)xAI0.3970037453183522026-04-30evidence
Grok 4.3 (Non-reasoning)xAI0.3408239700374532026-04-30evidence
Grok 4.5 (high)xAI0.8164794007490642026-07-08evidence
Grok 4.6 (high)xAI0.8838951310861422026-08-12evidence
Grok 4.6 (low)xAI0.7528089887640452026-08-12evidence
Grok 4.6 (medium)xAI0.8426966292134832026-08-12evidence
Grok 4.6 (xhigh)xAI0.8801498127340822026-08-12evidence
Grok Build 0.1 0616xAI0.520599250936332026-06-16evidence
Hy3Tencent0.6441947565543072026-07-06evidence
HyperNova 60B 2605Multiverse Computing0.1835205992509362026-05-26evidence
Inkling (xhigh)Thinking Machines0.5505617977528092026-07-15evidence
Inkling SmallThinking Machines0.5505617977528092026-07-30evidence
JT-4.1 Flash 236B A21BChina Mobile0.5955056179775282026-07-09evidence
K-EXAONE (Reasoning)LG AI Research0.3033707865168542025-12-31evidence
K-EXAONE 2.0 0803LG AI Research0.4044943820224722026-08-12evidence
K2 Think V2MBZUAI Institute of Foundation Models0.1498127340823972025-12-15evidence
KAT Coder Pro V2KwaiKAT0.7003745318352062026-03-27evidence
Kimi K2.5 (Reasoning)Moonshot AI0.4569288389513112026-01-27evidence
Kimi K2.6Moonshot AI0.6591760299625472026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.6741573033707862026-06-12evidence
Kimi K3 (low)Moonshot AI0.8239700374531842026-07-16evidence
Kimi K3 (max)Moonshot AI0.8501872659176032026-07-16evidence
LFM2.5-2.6BLiquid AI0.04494382022471912026-08-04evidence
Ling 2.6 FlashInclusionAI0.2434456928838952026-04-21evidence
Ling 3.0 FlashInclusionAI0.5543071161048692026-08-04evidence
Ling 3.0 TinyInclusionAI0.2771535580524342026-08-06evidence
Llama 3.1 Instruct 8BMeta0.01498127340823972024-07-23evidence
Llama 3.3 Instruct 70BMeta0.0486891385767792024-12-06evidence
Llama 4 MaverickMeta0.07865168539325842025-04-05evidence
Llama 4 ScoutMeta0.03745318352059932025-04-05evidence
LongCat 2.0LongCat0.501872659176032026-06-29evidence
Magistral Medium 1.2Mistral0.1235955056179782025-09-18evidence
Magistral Small 1.2Mistral0.04494382022471912025-09-17evidence
Mercury 2Inception0.2734082397003752026-02-20evidence
MiMo-V2-Flash (Non-reasoning)Xiaomi0.6179775280898882025-12-16evidence
MiMo-V2.5Xiaomi0.6367041198501872026-04-22evidence
MiMo-V2.5-ProXiaomi0.6516853932584272026-04-22evidence
MiniCPM-V 4.6 1.3BOpenBMB02026-05-11evidence
MiniMax-M2.7MiniMax0.5543071161048692026-03-18evidence
MiniMax-M3MiniMax0.6516853932584272026-06-01evidence
Ministral 3 14BMistral0.09737827715355812025-12-02evidence
Ministral 3 3BMistral02025-12-02evidence
Ministral 3 8BMistral0.04119850187265922025-12-02evidence
Mistral Large 3Mistral0.1198501872659182025-12-02evidence
Mistral Medium 3.1Mistral0.1385767790262172025-08-12evidence
Mistral Medium 3.5Mistral0.505617977528092026-04-29evidence
Mistral Small 3.1Mistral0.2621722846441952025-03-17evidence
Mistral Small 3.2Mistral0.05617977528089892025-06-20evidence
Mistral Small 4 (Reasoning)Mistral0.2097378277153562026-03-16evidence
Motif 3Motif Technologies0.7490636704119852026-08-12evidence
Motif 3 (Beta)Motif Technologies0.7078651685393262026-07-14evidence
Muse Glimmer (high)Meta0.516853932584272026-08-10evidence
Muse SparkMeta0.6217228464419482026-04-08evidence
Muse Spark 1.1 (xhigh)Meta0.7790262172284642026-07-09evidence
Muse Spark 1.2 (xhigh)Meta0.8014981273408242026-08-05evidence
Nanbeige4.1-3BNanbeige0.01123595505617982026-02-11evidence
Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA0.06741573033707862026-04-29evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA0.3857677902621722026-03-11evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.5393258426966292026-06-04evidence
Nemotron 3.5 LightningNVIDIA0.2434456928838952026-08-11evidence
Nemotron Cascade 2 30B A3BNVIDIA0.2059925093632962026-03-19evidence
Nex-N2-ProNex AGI0.6779026217228462026-06-02evidence
North Mini CodeCohere0.3558052434456932026-06-09evidence
Nova 2.0 Lite (high)Amazon0.1610486891385772025-10-29evidence
Nova 2.0 Pro Preview (low)Amazon0.1947565543071162025-11-27evidence
Nova 2.0 Pro Preview (medium)Amazon0.2958801498127342025-11-27evidence
Nova 2.0 Pro Preview (Non-reasoning)Amazon0.1722846441947572025-11-27evidence
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA0.06741573033707862025-12-15evidence
NVIDIA Nemotron 3 Nano 4BNVIDIA0.03745318352059932026-03-16evidence
o3-mini (high)OpenAI0.04494382022471912025-01-31evidence
Phi-4 Mini InstructMicrosoft0.003745318352059932024-02-26evidence
Qwen3 14B (Reasoning)Qwen0.0486891385767792025-04-28evidence
Qwen3 235B A22B 2507 (Reasoning)Qwen0.1198501872659182025-07-25evidence
Qwen3 30B A3B 2507 (Reasoning)Qwen0.01498127340823972025-07-30evidence
Qwen3 32B (Reasoning)Qwen0.0524344569288392025-04-28evidence
Qwen3 8B (Reasoning)Qwen0.02247191011235952025-04-28evidence
Qwen3 Coder NextQwen0.3820224719101122026-02-03evidence
Qwen3 Next 80B A3B (Reasoning)Qwen0.06741573033707862025-09-11evidence
Qwen3.5 0.8B (Non-reasoning)Qwen0.003745318352059932026-03-02evidence
Qwen3.5 0.8B (Reasoning)Qwen02026-03-02evidence
Qwen3.5 122B A10B (Non-reasoning)Qwen0.4719101123595512026-02-24evidence
Qwen3.5 122B A10B (Reasoning)Qwen0.475655430711612026-02-24evidence
Qwen3.5 2B (Non-reasoning)Qwen02026-03-02evidence
Qwen3.5 2B (Reasoning)Qwen0.02996254681647942026-03-02evidence
Qwen3.5 35B A3B (Non-reasoning)Qwen0.4082397003745322026-02-24evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.513108614232212026-02-16evidence
Qwen3.5 4B (Non-reasoning)Qwen0.2134831460674162026-03-02evidence
Qwen3.5 4B (Reasoning)Qwen0.2584269662921352026-03-02evidence
Qwen3.5 9B (Non-reasoning)Qwen0.2134831460674162026-03-02evidence
Qwen3.5 9B (Reasoning)Qwen0.2921348314606742026-03-02evidence
Qwen3.6 27B (Non-reasoning)Qwen0.513108614232212026-04-22evidence
Qwen3.6 27B (Reasoning)Qwen0.6067415730337082026-04-22evidence
Qwen3.6 35B A3B (Non-reasoning)Qwen0.4157303370786522026-04-16evidence
Qwen3.6 35B A3B (Reasoning)Qwen0.4494382022471912026-04-16evidence
Qwen3.6 PlusQwen0.6142322097378282026-04-02evidence
Qwen3.7 MaxQwen0.7453183520599252026-05-19evidence
Qwen3.7 PlusQwen0.6104868913857682026-06-01evidence
Qwen3.8 2.4T A95BQwen0.8202247191011242026-08-12evidence
Qwen3.8 27B (low)Qwen0.6741573033707862026-08-14evidence
Qwen3.8 27B (medium)Qwen0.6516853932584272026-08-14evidence
Qwen3.8 27B (Non-reasoning)Qwen0.490636704119852026-08-14evidence
Qwen3.8 27B (xhigh)Qwen0.7977528089887642026-08-14evidence
Qwen3.8 MaxQwen0.8127340823970042026-08-03evidence
Ring-2.6-1TInclusionAI0.4307116104868912026-05-08evidence
Solar Open2 250BUpstage0.4419475655430712026-08-12evidence
Solar Pro 3Upstage0.1198501872659182026-04-06evidence
Solar Pro 4Upstage0.5730337078651682026-08-06evidence
Step 3.7 FlashStepFun0.3932584269662922026-05-29evidence
Trinity Large ThinkingArcee AI0.2059925093632962026-04-01evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.