Benchmark

τ³-Banking

Agentic tool use

Categories
intelligence-index, agentic, tool-use
Openness
unknown
Source
artificial_analysis
Reported scores
178

Reported scores

artificial_analysis

ModelOrganizationReported valueReportedEvidence
A.X-K2SK Telecom0.1608247422680412026-08-12evidence
Agnes 2.5 Pro AlphaSapiens AI0.1237113402061862026-07-24evidence
Celeris-1Celeris0.03917525773195882026-07-24evidence
Claude 4 Sonnet (Reasoning)Anthropic0.1670103092783512025-05-22evidence
Claude 4.5 Haiku (Reasoning)Anthropic0.09278350515463922025-10-15evidence
Claude 4.5 Sonnet (Reasoning)Anthropic0.2453608247422682025-09-29evidence
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic0.3814432989690722026-06-09evidence
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic0.346391752577322026-04-16evidence
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic0.3422680412371132026-05-28evidence
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic0.4474226804123712026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic0.3030927835051552026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic0.4206185567010312026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic0.3855670103092782026-07-24evidence
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic0.432989690721652026-07-24evidence
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic0.3443298969072162026-02-17evidence
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic0.373195876288662026-06-30evidence
Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic0.1567010309278352026-06-30evidence
Command A+Cohere0.05979381443298972026-05-20evidence
DeepSeek R1 (Jan '25)DeepSeek0.06391752577319592025-01-20evidence
DeepSeek V3 (Dec '24)DeepSeek0.04742268041237112024-12-26evidence
DeepSeek V3 0324DeepSeek0.04742268041237112025-03-25evidence
DeepSeek V3.1 Terminus (Reasoning)DeepSeek0.2103092783505152025-09-22evidence
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek0.2618556701030932026-04-24evidence
DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.3092783505154642026-04-24evidence
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek0.3938144329896912026-07-31evidence
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek0.4103092783505152026-08-21evidence
DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek0.2618556701030932026-04-24evidence
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek0.3010309278350522026-04-24evidence
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek0.3958762886597942026-08-13evidence
Devstral 2Mistral0.1051546391752582025-12-09evidence
Devstral Small 2Mistral0.1072164948453612025-12-09evidence
G9v3-39A5BAI9Stars0.2206185567010312026-08-20evidence
Gemini 2.5 ProGoogle0.09690721649484542025-06-05evidence
Gemini 3 Flash Preview (Reasoning)Google0.2082474226804122025-12-17evidence
Gemini 3.1 Flash-LiteGoogle0.09690721649484542026-03-03evidence
Gemini 3.1 Pro PreviewGoogle0.2144329896907222026-02-19evidence
Gemini 3.5 Flash (high)Google0.3216494845360822026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.1752577319587632026-07-21evidence
Gemini 3.6 Flash (high)Google0.2989690721649482026-07-21evidence
Gemini 3.7 Flash (high)Google0.3278350515463922026-08-13evidence
Gemini 3.7 Flash (low)Google0.2948453608247422026-08-13evidence
Gemini 3.7 Flash (medium)Google0.3546391752577322026-08-13evidence
Gemma 3 12B InstructGoogle0.008247422680412372025-03-12evidence
Gemma 3 27B InstructGoogle0.008247422680412372025-03-12evidence
Gemma 3 4B InstructGoogle0.004123711340206192025-03-12evidence
Gemma 3n E4B InstructGoogle0.002061855670103092025-06-26evidence
Gemma 4 26B A4B (Reasoning)Google0.1195876288659792026-04-02evidence
Gemma 4 31B (Non-reasoning)Google0.0886597938144332026-04-02evidence
Gemma 4 31B (Reasoning)Google0.1484536082474232026-04-02evidence
GLM-4.6 (Reasoning)Z.ai0.1340206185567012025-09-30evidence
GLM-4.7 (Reasoning)Z.ai0.1216494845360822025-12-22evidence
GLM-5.1 (Reasoning)Z.ai0.1360824742268042026-04-07evidence
GLM-5.2 (max)Z.ai0.346391752577322026-06-16evidence
GLM-5.2 (Non-reasoning)Z.ai0.1670103092783512026-06-16evidence
GLM-5.3 (max)Z.ai0.5030927835051552026-08-18evidence
GPT-4.1 miniOpenAI0.05360824742268042025-04-14evidence
GPT-4.1 nanoOpenAI0.03505154639175262025-04-14evidence
GPT-4o miniOpenAI0.02886597938144332024-07-18evidence
GPT-5 (high)OpenAI0.2206185567010312025-08-07evidence
GPT-5 mini (high)OpenAI0.1546391752577322025-08-07evidence
GPT-5.1 (high)OpenAI0.1587628865979382025-11-13evidence
GPT-5.2 (Non-reasoning)OpenAI0.1113402061855672025-12-11evidence
GPT-5.4 (xhigh)OpenAI0.3958762886597942026-03-05evidence
GPT-5.4 mini (xhigh)OpenAI0.2556701030927832026-03-17evidence
GPT-5.4 nano (xhigh)OpenAI0.2742268041237112026-03-17evidence
GPT-5.5 (high)OpenAI0.367010309278352026-04-23evidence
GPT-5.5 (low)OpenAI0.2494845360824742026-04-23evidence
GPT-5.5 (medium)OpenAI0.2989690721649482026-04-23evidence
GPT-5.5 (Non-reasoning)OpenAI0.1484536082474232026-04-23evidence
GPT-5.5 (xhigh)OpenAI0.3896907216494852026-04-23evidence
GPT-5.5 Instant (June 2026)OpenAI0.1175257731958762026-06-25evidence
GPT-5.6 Luna (high)OpenAI0.2515463917525772026-07-09evidence
GPT-5.6 Luna (low)OpenAI0.1278350515463922026-07-09evidence
GPT-5.6 Luna (max)OpenAI0.3113402061855672026-07-09evidence
GPT-5.6 Luna (medium)OpenAI0.1773195876288662026-07-09evidence
GPT-5.6 Luna (Non-reasoning)OpenAI0.09690721649484542026-07-09evidence
GPT-5.6 Luna (xhigh)OpenAI0.286597938144332026-07-09evidence
GPT-5.6 Sol (high)OpenAI0.367010309278352026-07-09evidence
GPT-5.6 Sol (low)OpenAI0.2907216494845362026-07-09evidence
GPT-5.6 Sol (max)OpenAI0.4432989690721652026-07-09evidence
GPT-5.6 Sol (medium)OpenAI0.3649484536082472026-07-09evidence
GPT-5.6 Sol (Non-reasoning)OpenAI0.1958762886597942026-07-09evidence
GPT-5.6 Sol (xhigh)OpenAI0.3814432989690722026-07-09evidence
GPT-5.6 Terra (high)OpenAI0.286597938144332026-07-09evidence
GPT-5.6 Terra (low)OpenAI0.1876288659793812026-07-09evidence
GPT-5.6 Terra (max)OpenAI0.4020618556701032026-07-09evidence
GPT-5.6 Terra (medium)OpenAI0.2556701030927832026-07-09evidence
GPT-5.6 Terra (Non-reasoning)OpenAI0.1567010309278352026-07-09evidence
GPT-5.6 Terra (xhigh)OpenAI0.2969072164948452026-07-09evidence
gpt-oss-120b (high)OpenAI0.1278350515463922025-08-05evidence
gpt-oss-120b (low)OpenAI0.02886597938144332025-08-05evidence
gpt-oss-20b (high)OpenAI0.07010309278350522025-08-05evidence
Grok 4.3 (high)xAI0.1237113402061862026-04-30evidence
Grok 4.3 (Non-reasoning)xAI0.08041237113402062026-04-30evidence
Grok 4.5 (high)xAI0.4206185567010312026-07-08evidence
Grok 4.6 (high)xAI0.5072164948453612026-08-12evidence
Grok 4.6 (low)xAI0.3814432989690722026-08-12evidence
Grok 4.6 (medium)xAI0.4432989690721652026-08-12evidence
Grok 4.6 (xhigh)xAI0.432989690721652026-08-12evidence
Grok Build 0.1 0616xAI0.1340206185567012026-06-16evidence
Hy3Tencent0.2288659793814432026-07-06evidence
HyperNova 60B 2605Multiverse Computing0.05567010309278352026-05-26evidence
Inkling (xhigh)Thinking Machines0.2907216494845362026-07-15evidence
Inkling SmallThinking Machines0.1876288659793812026-07-30evidence
K-EXAONE 2.0 0803LG AI Research0.1154639175257732026-08-12evidence
KAT Coder Pro V2KwaiKAT0.0453608247422682026-03-27evidence
Kimi K2.5 (Reasoning)Moonshot AI0.1422680412371132026-01-27evidence
Kimi K2.6Moonshot AI0.2329896907216492026-04-20evidence
Kimi K2.7 CodeMoonshot AI0.2020618556701032026-06-12evidence
Kimi K3 (low)Moonshot AI0.4164948453608252026-07-16evidence
Kimi K3 (max)Moonshot AI0.459793814432992026-07-16evidence
LFM2.5-2.6BLiquid AI0.07216494845360822026-08-04evidence
Ling 2.6 FlashInclusionAI0.02886597938144332026-04-21evidence
Ling 3.0 FlashInclusionAI0.2721649484536082026-08-04evidence
Ling 3.0 TinyInclusionAI0.2082474226804122026-08-06evidence
Llama 4 MaverickMeta0.03711340206185572025-04-05evidence
Llama 4 ScoutMeta0.03298969072164952025-04-05evidence
LongCat 2.0LongCat0.1319587628865982026-06-29evidence
Magistral Medium 1.2Mistral0.05567010309278352025-09-18evidence
Magistral Small 1.2Mistral0.0453608247422682025-09-17evidence
Mercury 2Inception0.09484536082474232026-02-20evidence
MiMo-V2.5Xiaomi0.08659793814432992026-04-22evidence
MiMo-V2.5-ProXiaomi0.09896907216494842026-04-22evidence
MiniMax-M2.7MiniMax0.09896907216494842026-03-18evidence
MiniMax-M3MiniMax0.1525773195876292026-06-01evidence
Ministral 3 14BMistral0.0659793814432992025-12-02evidence
Ministral 3 3BMistral0.04742268041237112025-12-02evidence
Ministral 3 8BMistral0.03711340206185572025-12-02evidence
Mistral Large 3Mistral0.05773195876288662025-12-02evidence
Mistral Medium 3.1Mistral0.08247422680412372025-08-12evidence
Mistral Medium 3.5Mistral0.1505154639175262026-04-29evidence
Mistral Small 3.1Mistral0.07422680412371132025-03-17evidence
Mistral Small 3.2Mistral0.06185567010309282025-06-20evidence
Mistral Small 4 (Reasoning)Mistral0.04948453608247422026-03-16evidence
Motif 3Motif Technologies0.3525773195876292026-08-12evidence
Muse Glimmer (high)Meta0.2350515463917532026-08-10evidence
Muse Spark 1.1 (xhigh)Meta0.3175257731958762026-07-09evidence
Muse Spark 1.2 (xhigh)Meta0.3484536082474232026-08-05evidence
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA0.1030927835051552026-03-11evidence
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.1422680412371132026-06-04evidence
Nemotron 3.5 LightningNVIDIA0.0886597938144332026-08-11evidence
Nex-N2-ProNex AGI0.1752577319587632026-06-02evidence
North Mini CodeCohere0.06391752577319592026-06-09evidence
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA0.05979381443298972025-12-15evidence
o3-mini (high)OpenAI0.05154639175257732025-01-31evidence
Qwen3 14B (Reasoning)Qwen0.05567010309278352025-04-28evidence
Qwen3 235B A22B 2507 (Reasoning)Qwen0.07835051546391752025-07-25evidence
Qwen3 30B A3B 2507 (Reasoning)Qwen0.05360824742268042025-07-30evidence
Qwen3 32B (Reasoning)Qwen0.05360824742268042025-04-28evidence
Qwen3 8B (Reasoning)Qwen0.04742268041237112025-04-28evidence
Qwen3 Coder NextQwen0.05360824742268042026-02-03evidence
Qwen3 Next 80B A3B (Reasoning)Qwen0.06185567010309282025-09-11evidence
Qwen3.5 122B A10B (Non-reasoning)Qwen0.1030927835051552026-02-24evidence
Qwen3.5 122B A10B (Reasoning)Qwen0.1525773195876292026-02-24evidence
Qwen3.5 35B A3B (Non-reasoning)Qwen0.04948453608247422026-02-24evidence
Qwen3.5 397B A17B (Reasoning)Qwen0.1340206185567012026-02-16evidence
Qwen3.5 4B (Non-reasoning)Qwen0.04329896907216492026-03-02evidence
Qwen3.5 4B (Reasoning)Qwen0.06804123711340212026-03-02evidence
Qwen3.5 9B (Reasoning)Qwen0.07010309278350522026-03-02evidence
Qwen3.6 27B (Non-reasoning)Qwen0.09278350515463922026-04-22evidence
Qwen3.6 27B (Reasoning)Qwen0.1670103092783512026-04-22evidence
Qwen3.6 35B A3B (Non-reasoning)Qwen0.05360824742268042026-04-16evidence
Qwen3.6 35B A3B (Reasoning)Qwen0.09278350515463922026-04-16evidence
Qwen3.6 PlusQwen0.2082474226804122026-04-02evidence
Qwen3.7 MaxQwen0.1175257731958762026-05-19evidence
Qwen3.7 PlusQwen0.1752577319587632026-06-01evidence
Qwen3.8 2.4T A95BQwen0.4907216494845362026-08-12evidence
Qwen3.8 27B (low)Qwen0.3216494845360822026-08-14evidence
Qwen3.8 27B (medium)Qwen0.4742268041237112026-08-14evidence
Qwen3.8 27B (Non-reasoning)Qwen0.22026-08-14evidence
Qwen3.8 27B (xhigh)Qwen0.4804123711340212026-08-14evidence
Qwen3.8 MaxQwen0.513402061855672026-08-03evidence
Ring-2.6-1TInclusionAI0.1793814432989692026-05-08evidence
Solar Open2 250BUpstage0.2164948453608252026-08-12evidence
Solar Pro 3Upstage0.08659793814432992026-04-06evidence
Solar Pro 4Upstage0.2329896907216492026-08-06evidence
Step 3.7 FlashStepFun0.1195876288659792026-05-29evidence
Trinity Large ThinkingArcee AI0.05773195876288662026-04-01evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.