Benchmark

ITBench-AA

Kubernetes incident root-cause analysis

Categories
agentic, tool-use, engineering
Openness
unknown
Source
artificial_analysis
Reported scores
33

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
Claude 4.5 Haiku (Reasoning)Anthropic0.2730696798493412025-10-15evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic0.4665725047080982026-04-16evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.3980225988700572026-02-17evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.3151600753295672026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.3832391713747652026-04-24evidence
Gemini 3.1 Pro PreviewGoogle0.3033091202582732026-02-19evidence
Gemini 3.5 Flash (high)Google0.4034839924670432026-05-19evidence
Gemma 4 26B A4B (Reasoning)Google0.2363465160075332026-04-02evidence
Gemma 4 31B (Reasoning)Google0.3728813559322032026-04-02evidence
GLM-5.1 (Reasoning)Z.ai0.4025423728813562026-04-07evidence
GLM-5.2 (max)Z.ai0.4265536723163842026-06-16evidence
GPT-5.4 mini (Non-Reasoning)OpenAI0.1864406779661022026-03-17evidence
GPT-5.4 mini (xhigh)OpenAI0.3521657250470812026-03-17evidence
GPT-5.4 nano (Non-Reasoning)OpenAI0.129096045197742026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.2438794726930322026-03-17evidence
GPT-5.5 (xhigh)OpenAI0.4580979284369112026-04-23evidence
GPT-5.6 Luna (max)OpenAI0.4032015065913372026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.5621468926553672026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.5103578154425612026-07-09evidence
gpt-oss-120b (high)OpenAI0.05649717514124292025-08-05evidence
Grok 4.1 Fast (Non-reasoning)xAI0.1789077212806032025-11-19evidence
Grok 4.3 (high)xAI0.3272128060263652026-04-30evidence
Kimi K2.6Moonshot AI0.3118644067796612026-04-20evidence
Kimi K3 (max)Moonshot AI0.4769303201506592026-07-16evidence
Llama 3.3 Instruct 70BMeta0.005649717514124292024-12-06evidence
MiMo-V2.5-ProXiaomi0.3822975517890772026-04-22evidence
MiniMax-M2.7MiniMax0.2645951035781542026-03-18evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA0.01129943502824862026-03-11evidence
Qwen3.5 27B (Reasoning)Qwen0.3549905838041432026-02-24evidence
Qwen3.5 35B A3B (Reasoning)Qwen0.2151600753295672026-02-24evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.3408662900188322026-02-16evidence
Qwen3.7 MaxQwen0.4246704331450092026-05-19evidence
Step 3.7 FlashStepFun0.3027306967984932026-05-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.