Benchmark

TAU-bench Retail

A benchmark for evaluating tool-agent-user interaction in retail environments. Tests language agents' ability to handle dynamic conversations with users…

Modality
text
Categories
reasoning, communication, tool_calling
Openness
unknown
Source
llm_stats
Reported scores
25

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.5 HaikuAnthropic0.512024-10-22evidence
Claude 3.5 SonnetAnthropic0.6922024-10-22evidence
Claude 3.7 SonnetAnthropic0.8122025-02-24evidence
Claude Opus 4Anthropic0.8142025-05-22evidence
Claude Opus 4.1Anthropic0.8242025-08-05evidence
Claude Sonnet 4Anthropic0.8052025-05-22evidence
Claude Sonnet 4.5Anthropic0.8622025-09-29evidence
GLM-4.5Z.ai0.7972025-07-28evidence
GLM-4.5-AirZ.ai0.7792025-07-28evidence
GPT OSS 120BOpenAI0.6782025-08-05evidence
GPT OSS 20BOpenAI0.5482025-08-05evidence
GPT-4.1OpenAI0.682025-04-14evidence
GPT-4.1 miniOpenAI0.5582025-04-14evidence
GPT-4.1 nanoOpenAI0.2262025-04-14evidence
GPT-4.5OpenAI0.6842025-02-27evidence
GPT-4oOpenAI0.6032024-08-06evidence
MiniMax M1 40KMiniMax0.6782025-06-16evidence
MiniMax M1 80KMiniMax0.6352025-06-16evidence
o1OpenAI0.7082024-12-17evidence
o3-miniOpenAI0.5762025-01-30evidence
o4-miniOpenAI0.7182025-04-16evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.6782025-07-25evidence
Qwen3-Coder 480B A35B InstructQwen0.7752025-01-31evidence
Qwen3-Next-80B-A3B-InstructQwen0.6092025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.6962025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.