Benchmark
ITBench-AA
Kubernetes incident root-cause analysis
- Categories
- agentic, tool-use, engineering
- Openness
- unknown
- Source
- artificial_analysis
- Reported scores
- 33
Reported scores
artificial_analysis
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4.5 Haiku (Reasoning) | Anthropic | 0.273069679849341 | 2025-10-15 | evidence |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 0.466572504708098 | 2026-04-16 | evidence |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 0.398022598870057 | 2026-02-17 | evidence |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.315160075329567 | 2026-04-24 | evidence |
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 0.383239171374765 | 2026-04-24 | evidence |
| Gemini 3.1 Pro Preview | 0.303309120258273 | 2026-02-19 | evidence | |
| Gemini 3.5 Flash (high) | 0.403483992467043 | 2026-05-19 | evidence | |
| Gemma 4 26B A4B (Reasoning) | 0.236346516007533 | 2026-04-02 | evidence | |
| Gemma 4 31B (Reasoning) | 0.372881355932203 | 2026-04-02 | evidence | |
| GLM-5.1 (Reasoning) | Z.ai | 0.402542372881356 | 2026-04-07 | evidence |
| GLM-5.2 (max) | Z.ai | 0.426553672316384 | 2026-06-16 | evidence |
| GPT-5.4 mini (Non-Reasoning) | OpenAI | 0.186440677966102 | 2026-03-17 | evidence |
| GPT-5.4 mini (xhigh) | OpenAI | 0.352165725047081 | 2026-03-17 | evidence |
| GPT-5.4 nano (Non-Reasoning) | OpenAI | 0.12909604519774 | 2026-03-17 | evidence |
| GPT-5.4 nano (xhigh) | OpenAI | 0.243879472693032 | 2026-03-17 | evidence |
| GPT-5.5 (xhigh) | OpenAI | 0.458097928436911 | 2026-04-23 | evidence |
| GPT-5.6 Luna (max) | OpenAI | 0.403201506591337 | 2026-07-09 | evidence |
| GPT-5.6 Sol (max) | OpenAI | 0.562146892655367 | 2026-07-09 | evidence |
| GPT-5.6 Terra (max) | OpenAI | 0.510357815442561 | 2026-07-09 | evidence |
| gpt-oss-120b (high) | OpenAI | 0.0564971751412429 | 2025-08-05 | evidence |
| Grok 4.1 Fast (Non-reasoning) | xAI | 0.178907721280603 | 2025-11-19 | evidence |
| Grok 4.3 (high) | xAI | 0.327212806026365 | 2026-04-30 | evidence |
| Kimi K2.6 | Moonshot AI | 0.311864406779661 | 2026-04-20 | evidence |
| Kimi K3 (max) | Moonshot AI | 0.476930320150659 | 2026-07-16 | evidence |
| Llama 3.3 Instruct 70B | Meta | 0.00564971751412429 | 2024-12-06 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.382297551789077 | 2026-04-22 | evidence |
| MiniMax-M2.7 | MiniMax | 0.264595103578154 | 2026-03-18 | evidence |
| Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 0.0112994350282486 | 2026-03-11 | evidence |
| Qwen3.5 27B (Reasoning) | Qwen | 0.354990583804143 | 2026-02-24 | evidence |
| Qwen3.5 35B A3B (Reasoning) | Qwen | 0.215160075329567 | 2026-02-24 | evidence |
| Qwen3.5 397B A17B (Reasoning) | Qwen | 0.340866290018832 | 2026-02-16 | evidence |
| Qwen3.7 Max | Qwen | 0.424670433145009 | 2026-05-19 | evidence |
| Step 3.7 Flash | StepFun | 0.302730696798493 | 2026-05-29 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.