Benchmark
Terminal-Bench v2.1
Agentic coding & terminal use
- Categories
- intelligence-index, agentic, coding, tool-use
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 210
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| A.X-K2 | SK Telecom | 0.389513108614232 | 2026-08-12 | evidence |
| Agnes 2.5 Pro Alpha | Sapiens AI | 0.670411985018727 | 2026-07-24 | evidence |
| Celeris-1 | Celeris | 0.112359550561798 | 2026-07-24 | evidence |
| Claude 3.5 Haiku | Anthropic | 0.101123595505618 | 2024-10-22 | evidence |
| Claude 4 Sonnet (Reasoning) | Anthropic | 0.363295880149813 | 2025-05-22 | evidence |
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.441947565543071 | 2025-10-15 | evidence |
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 0.558052434456929 | 2025-09-29 | evidence |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 0.846441947565543 | 2026-06-09 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 0.831460674157303 | 2026-04-16 | evidence |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 0.846441947565543 | 2026-05-28 | evidence |
| Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 0.876404494382023 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 0.764044943820225 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.891385767790262 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 0.861423220973783 | 2026-07-24 | evidence |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 0.880149812734082 | 2026-07-24 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.711610486891386 | 2026-02-17 | evidence |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 0.805243445692884 | 2026-06-30 | evidence |
| Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 0.752808988764045 | 2026-06-30 | evidence |
| Command A+ | Cohere | 0.228464419475655 | 2026-05-20 | evidence |
| DeepSeek R1 (Jan '25) | DeepSeek | 0.191011235955056 | 2025-01-20 | evidence |
| DeepSeek V3 (Dec '24) | DeepSeek | 0.168539325842697 | 2024-12-26 | evidence |
| DeepSeek V3 0324 | DeepSeek | 0.138576779026217 | 2025-03-25 | evidence |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 0.449438202247191 | 2025-09-22 | evidence |
| DeepSeek V3.2 (Reasoning) | DeepSeek | 0.468164794007491 | 2025-12-01 | evidence |
| DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 0.569288389513109 | 2026-04-24 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.617977528089888 | 2026-04-24 | evidence |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 0.786516853932584 | 2026-07-31 | evidence |
| DeepSeek V4 Flash Vision (Reasoning, Max Effort) | DeepSeek | 0.741573033707865 | 2026-08-21 | evidence |
| DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 0.647940074906367 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.640449438202247 | 2026-04-24 | evidence |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 0.786516853932584 | 2026-08-13 | evidence |
| Devstral 2 | Mistral | 0.303370786516854 | 2025-12-09 | evidence |
| Devstral Small 2 | Mistral | 0.295880149812734 | 2025-12-09 | evidence |
| DiffusionGemma 26B A4B | 0.123595505617978 | 2026-06-10 | evidence | |
| EXAONE 4.5 33B | LG AI Research | 0.213483146067416 | 2026-04-09 | evidence |
| G9v3-39A5B | AI9Stars | 0.325842696629214 | 2026-08-20 | evidence |
| G9v3-3B | AI9Stars | 0.0599250936329588 | 2026-07-23 | evidence |
| Gemini 2.5 Pro | 0.284644194756554 | 2025-06-05 | evidence | |
| Gemini 3.1 Flash-Lite | 0.310861423220974 | 2026-03-03 | evidence | |
| Gemini 3.1 Pro Preview | 0.737827715355805 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.786516853932584 | 2026-05-19 | evidence | |
| Gemini 3.5 Flash-Lite | 0.535580524344569 | 2026-07-21 | evidence | |
| Gemini 3.6 Flash (high) | 0.775280898876405 | 2026-07-21 | evidence | |
| Gemini 3.7 Flash (high) | 0.857677902621723 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (low) | 0.797752808988764 | 2026-08-13 | evidence | |
| Gemini 3.7 Flash (medium) | 0.782771535580524 | 2026-08-13 | evidence | |
| Gemma 3 12B Instruct | 0 | 2025-03-12 | evidence | |
| Gemma 3 27B Instruct | 0.0449438202247191 | 2025-03-12 | evidence | |
| Gemma 3 4B Instruct | 0.00374531835205993 | 2025-03-12 | evidence | |
| Gemma 3n E4B Instruct | 0.00749063670411985 | 2025-06-26 | evidence | |
| Gemma 4 12B (Reasoning) | 0.273408239700375 | 2026-06-03 | evidence | |
| Gemma 4 26B A4B (Reasoning) | 0.389513108614232 | 2026-04-02 | evidence | |
| Gemma 4 31B (Non-reasoning) | 0.292134831460674 | 2026-04-02 | evidence | |
| Gemma 4 31B (Reasoning) | 0.434456928838951 | 2026-04-02 | evidence | |
| Gemma 4 E2B (Reasoning) | 0.00374531835205993 | 2026-04-02 | evidence | |
| Gemma 4 E4B (Reasoning) | 0.0187265917602996 | 2026-04-03 | evidence | |
| GLM-4.6 (Reasoning) | Z.ai | 0.49438202247191 | 2025-09-30 | evidence |
| GLM-4.7 (Reasoning) | Z.ai | 0.453183520599251 | 2025-12-22 | evidence |
| GLM-5.1 (Reasoning) | Z.ai | 0.617977528089888 | 2026-04-07 | evidence |
| GLM-5.2 (max) | Z.ai | 0.779026217228464 | 2026-06-16 | evidence |
| GLM-5.2 (Non-reasoning) | Z.ai | 0.51685393258427 | 2026-06-16 | evidence |
| GLM-5.3 (max) | Z.ai | 0.838951310861423 | 2026-08-18 | evidence |
| GPT-4.1 mini | OpenAI | 0.101123595505618 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.0374531835205993 | 2025-04-14 | evidence |
| GPT-4o mini | OpenAI | 0.0561797752808989 | 2024-07-18 | evidence |
| GPT-5 (high) | OpenAI | 0.352059925093633 | 2025-08-07 | evidence |
| GPT-5 mini (high) | OpenAI | 0.0374531835205993 | 2025-08-07 | evidence |
| GPT-5.1 (high) | OpenAI | 0.524344569288389 | 2025-11-13 | evidence |
| GPT-5.4 (xhigh) | OpenAI | 0.782771535580524 | 2026-03-05 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.591760299625468 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.606741573033708 | 2026-03-17 | evidence |
| GPT-5.5 (high) | OpenAI | 0.794007490636704 | 2026-04-23 | evidence |
| GPT-5.5 (low) | OpenAI | 0.655430711610487 | 2026-04-23 | evidence |
| GPT-5.5 (medium) | OpenAI | 0.805243445692884 | 2026-04-23 | evidence |
| GPT-5.5 (Non-reasoning) | OpenAI | 0.610486891385768 | 2026-04-23 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.842696629213483 | 2026-04-23 | evidence |
| GPT-5.5 Instant (June 2026) | OpenAI | 0.348314606741573 | 2026-06-25 | evidence |
| GPT-5.6 Luna (high) | OpenAI | 0.696629213483146 | 2026-07-09 | evidence |
| GPT-5.6 Luna (low) | OpenAI | 0.434456928838951 | 2026-07-09 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.808988764044944 | 2026-07-09 | evidence |
| GPT-5.6 Luna (medium) | OpenAI | 0.531835205992509 | 2026-07-09 | evidence |
| GPT-5.6 Luna (Non-reasoning) | OpenAI | 0.389513108614232 | 2026-07-09 | evidence |
| GPT-5.6 Luna (xhigh) | OpenAI | 0.779026217228464 | 2026-07-09 | evidence |
| GPT-5.6 Sol (high) | OpenAI | 0.872659176029963 | 2026-07-09 | evidence |
| GPT-5.6 Sol (low) | OpenAI | 0.767790262172285 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.880149812734082 | 2026-07-09 | evidence |
| GPT-5.6 Sol (medium) | OpenAI | 0.861423220973783 | 2026-07-09 | evidence |
| GPT-5.6 Sol (Non-reasoning) | OpenAI | 0.741573033707865 | 2026-07-09 | evidence |
| GPT-5.6 Sol (xhigh) | OpenAI | 0.895131086142322 | 2026-07-09 | evidence |
| GPT-5.6 Terra (high) | OpenAI | 0.756554307116105 | 2026-07-09 | evidence |
| GPT-5.6 Terra (low) | OpenAI | 0.625468164794007 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.880149812734082 | 2026-07-09 | evidence |
| GPT-5.6 Terra (medium) | OpenAI | 0.722846441947566 | 2026-07-09 | evidence |
| GPT-5.6 Terra (Non-reasoning) | OpenAI | 0.561797752808989 | 2026-07-09 | evidence |
| GPT-5.6 Terra (xhigh) | OpenAI | 0.801498127340824 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.262172284644195 | 2025-08-05 | evidence |
| gpt-oss-120b (low) | OpenAI | 0.138576779026217 | 2025-08-05 | evidence |
| gpt-oss-20b (high) | OpenAI | 0.138576779026217 | 2025-08-05 | evidence |
| Granite 4.1 30B | IBM | 0.0262172284644195 | 2026-04-29 | evidence |
| Granite 4.1 3B | IBM | 0.0112359550561798 | 2026-04-29 | evidence |
| Granite 4.1 8B | IBM | 0.0337078651685393 | 2026-04-29 | evidence |
| Grok 4.3 (high) | xAI | 0.397003745318352 | 2026-04-30 | evidence |
| Grok 4.3 (Non-reasoning) | xAI | 0.340823970037453 | 2026-04-30 | evidence |
| Grok 4.5 (high) | xAI | 0.816479400749064 | 2026-07-08 | evidence |
| Grok 4.6 (high) | xAI | 0.883895131086142 | 2026-08-12 | evidence |
| Grok 4.6 (low) | xAI | 0.752808988764045 | 2026-08-12 | evidence |
| Grok 4.6 (medium) | xAI | 0.842696629213483 | 2026-08-12 | evidence |
| Grok 4.6 (xhigh) | xAI | 0.880149812734082 | 2026-08-12 | evidence |
| Grok Build 0.1 0616 | xAI | 0.52059925093633 | 2026-06-16 | evidence |
| Hy3 | Tencent | 0.644194756554307 | 2026-07-06 | evidence |
| HyperNova 60B 2605 | Multiverse Computing | 0.183520599250936 | 2026-05-26 | evidence |
| Inkling (xhigh) | Thinking Machines | 0.550561797752809 | 2026-07-15 | evidence |
| Inkling Small | Thinking Machines | 0.550561797752809 | 2026-07-30 | evidence |
| JT-4.1 Flash 236B A21B | China Mobile | 0.595505617977528 | 2026-07-09 | evidence |
| K-EXAONE (Reasoning) | LG AI Research | 0.303370786516854 | 2025-12-31 | evidence |
| K-EXAONE 2.0 0803 | LG AI Research | 0.404494382022472 | 2026-08-12 | evidence |
| K2 Think V2 | MBZUAI Institute of Foundation Models | 0.149812734082397 | 2025-12-15 | evidence |
| KAT Coder Pro V2 | KwaiKAT | 0.700374531835206 | 2026-03-27 | evidence |
| Kimi K2.5 (Reasoning) | Moonshot AI | 0.456928838951311 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.659176029962547 | 2026-04-20 | evidence |
| Kimi K2.7 Code | Moonshot AI | 0.674157303370786 | 2026-06-12 | evidence |
| Kimi K3 (low) | Moonshot AI | 0.823970037453184 | 2026-07-16 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.850187265917603 | 2026-07-16 | evidence |
| LFM2.5-2.6B | Liquid AI | 0.0449438202247191 | 2026-08-04 | evidence |
| Ling 2.6 Flash | InclusionAI | 0.243445692883895 | 2026-04-21 | evidence |
| Ling 3.0 Flash | InclusionAI | 0.554307116104869 | 2026-08-04 | evidence |
| Ling 3.0 Tiny | InclusionAI | 0.277153558052434 | 2026-08-06 | evidence |
| Llama 3.1 Instruct 8B | Meta | 0.0149812734082397 | 2024-07-23 | evidence |
| Llama 3.3 Instruct 70B | Meta | 0.048689138576779 | 2024-12-06 | evidence |
| Llama 4 Maverick | Meta | 0.0786516853932584 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.0374531835205993 | 2025-04-05 | evidence |
| LongCat 2.0 | LongCat | 0.50187265917603 | 2026-06-29 | evidence |
| Magistral Medium 1.2 | Mistral | 0.123595505617978 | 2025-09-18 | evidence |
| Magistral Small 1.2 | Mistral | 0.0449438202247191 | 2025-09-17 | evidence |
| Mercury 2 | Inception | 0.273408239700375 | 2026-02-20 | evidence |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 0.617977528089888 | 2025-12-16 | evidence |
| MiMo-V2.5 | Xiaomi | 0.636704119850187 | 2026-04-22 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.651685393258427 | 2026-04-22 | evidence |
| MiniCPM-V 4.6 1.3B | OpenBMB | 0 | 2026-05-11 | evidence |
| MiniMax-M2.7 | MiniMax | 0.554307116104869 | 2026-03-18 | evidence |
| MiniMax-M3 | MiniMax | 0.651685393258427 | 2026-06-01 | evidence |
| Ministral 3 14B | Mistral | 0.0973782771535581 | 2025-12-02 | evidence |
| Ministral 3 3B | Mistral | 0 | 2025-12-02 | evidence |
| Ministral 3 8B | Mistral | 0.0411985018726592 | 2025-12-02 | evidence |
| Mistral Large 3 | Mistral | 0.119850187265918 | 2025-12-02 | evidence |
| Mistral Medium 3.1 | Mistral | 0.138576779026217 | 2025-08-12 | evidence |
| Mistral Medium 3.5 | Mistral | 0.50561797752809 | 2026-04-29 | evidence |
| Mistral Small 3.1 | Mistral | 0.262172284644195 | 2025-03-17 | evidence |
| Mistral Small 3.2 | Mistral | 0.0561797752808989 | 2025-06-20 | evidence |
| Mistral Small 4 (Reasoning) | Mistral | 0.209737827715356 | 2026-03-16 | evidence |
| Motif 3 | Motif Technologies | 0.749063670411985 | 2026-08-12 | evidence |
| Motif 3 (Beta) | Motif Technologies | 0.707865168539326 | 2026-07-14 | evidence |
| Muse Glimmer (high) | Meta | 0.51685393258427 | 2026-08-10 | evidence |
| Muse Spark | Meta | 0.621722846441948 | 2026-04-08 | evidence |
| Muse Spark 1.1 (xhigh) | Meta | 0.779026217228464 | 2026-07-09 | evidence |
| Muse Spark 1.2 (xhigh) | Meta | 0.801498127340824 | 2026-08-05 | evidence |
| Nanbeige4.1-3B | Nanbeige | 0.0112359550561798 | 2026-02-11 | evidence |
| Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 0.0674157303370786 | 2026-04-29 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 0.385767790262172 | 2026-03-11 | evidence |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.539325842696629 | 2026-06-04 | evidence |
| Nemotron 3.5 Lightning | NVIDIA | 0.243445692883895 | 2026-08-11 | evidence |
| Nemotron Cascade 2 30B A3B | NVIDIA | 0.205992509363296 | 2026-03-19 | evidence |
| Nex-N2-Pro | Nex AGI | 0.677902621722846 | 2026-06-02 | evidence |
| North Mini Code | Cohere | 0.355805243445693 | 2026-06-09 | evidence |
| Nova 2.0 Lite (high) | Amazon | 0.161048689138577 | 2025-10-29 | evidence |
| Nova 2.0 Pro Preview (low) | Amazon | 0.194756554307116 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (medium) | Amazon | 0.295880149812734 | 2025-11-27 | evidence |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 0.172284644194757 | 2025-11-27 | evidence |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 0.0674157303370786 | 2025-12-15 | evidence |
| NVIDIA Nemotron 3 Nano 4B | NVIDIA | 0.0374531835205993 | 2026-03-16 | evidence |
| o3-mini (high) | OpenAI | 0.0449438202247191 | 2025-01-31 | evidence |
| Phi-4 Mini Instruct | Microsoft | 0.00374531835205993 | 2024-02-26 | evidence |
| Qwen3 14B (Reasoning) | Qwen | 0.048689138576779 | 2025-04-28 | evidence |
| Qwen3 235B A22B 2507 (Reasoning) | Qwen | 0.119850187265918 | 2025-07-25 | evidence |
| Qwen3 30B A3B 2507 (Reasoning) | Qwen | 0.0149812734082397 | 2025-07-30 | evidence |
| Qwen3 32B (Reasoning) | Qwen | 0.052434456928839 | 2025-04-28 | evidence |
| Qwen3 8B (Reasoning) | Qwen | 0.0224719101123595 | 2025-04-28 | evidence |
| Qwen3 Coder Next | Qwen | 0.382022471910112 | 2026-02-03 | evidence |
| Qwen3 Next 80B A3B (Reasoning) | Qwen | 0.0674157303370786 | 2025-09-11 | evidence |
| Qwen3.5 0.8B (Non-reasoning) | Qwen | 0.00374531835205993 | 2026-03-02 | evidence |
| Qwen3.5 0.8B (Reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 122B A10B (Non-reasoning) | Qwen | 0.471910112359551 | 2026-02-24 | evidence |
| Qwen3.5 122B A10B (Reasoning) | Qwen | 0.47565543071161 | 2026-02-24 | evidence |
| Qwen3.5 2B (Non-reasoning) | Qwen | 0 | 2026-03-02 | evidence |
| Qwen3.5 2B (Reasoning) | Qwen | 0.0299625468164794 | 2026-03-02 | evidence |
| Qwen3.5 35B A3B (Non-reasoning) | Qwen | 0.408239700374532 | 2026-02-24 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.51310861423221 | 2026-02-16 | evidence |
| Qwen3.5 4B (Non-reasoning) | Qwen | 0.213483146067416 | 2026-03-02 | evidence |
| Qwen3.5 4B (Reasoning) | Qwen | 0.258426966292135 | 2026-03-02 | evidence |
| Qwen3.5 9B (Non-reasoning) | Qwen | 0.213483146067416 | 2026-03-02 | evidence |
| Qwen3.5 9B (Reasoning) | Qwen | 0.292134831460674 | 2026-03-02 | evidence |
| Qwen3.6 27B (Non-reasoning) | Qwen | 0.51310861423221 | 2026-04-22 | evidence |
| Qwen3.6 27B (Reasoning) | Qwen | 0.606741573033708 | 2026-04-22 | evidence |
| Qwen3.6 35B A3B (Non-reasoning) | Qwen | 0.415730337078652 | 2026-04-16 | evidence |
| Qwen3.6 35B A3B (Reasoning) | Qwen | 0.449438202247191 | 2026-04-16 | evidence |
| Qwen3.6 Plus | Qwen | 0.614232209737828 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 0.745318352059925 | 2026-05-19 | evidence |
| Qwen3.7 Plus | Qwen | 0.610486891385768 | 2026-06-01 | evidence |
| Qwen3.8 2.4T A95B | Qwen | 0.820224719101124 | 2026-08-12 | evidence |
| Qwen3.8 27B (low) | Qwen | 0.674157303370786 | 2026-08-14 | evidence |
| Qwen3.8 27B (medium) | Qwen | 0.651685393258427 | 2026-08-14 | evidence |
| Qwen3.8 27B (Non-reasoning) | Qwen | 0.49063670411985 | 2026-08-14 | evidence |
| Qwen3.8 27B (xhigh) | Qwen | 0.797752808988764 | 2026-08-14 | evidence |
| Qwen3.8 Max | Qwen | 0.812734082397004 | 2026-08-03 | evidence |
| Ring-2.6-1T | InclusionAI | 0.430711610486891 | 2026-05-08 | evidence |
| Solar Open2 250B | Upstage | 0.441947565543071 | 2026-08-12 | evidence |
| Solar Pro 3 | Upstage | 0.119850187265918 | 2026-04-06 | evidence |
| Solar Pro 4 | Upstage | 0.573033707865168 | 2026-08-06 | evidence |
| Step 3.7 Flash | StepFun | 0.393258426966292 | 2026-05-29 | evidence |
| Trinity Large Thinking | Arcee AI | 0.205992509363296 | 2026-04-01 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.