Benchmark
TAU-bench Retail
A benchmark for evaluating tool-agent-user interaction in retail environments. Tests language agents' ability to handle dynamic conversations with users…
- Modality
- text
- Categories
- reasoning, communication, tool_calling
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 25
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.5 Haiku | Anthropic | 0.51 | 2024-10-22 | evidence |
| Claude 3.5 Sonnet | Anthropic | 0.692 | 2024-10-22 | evidence |
| Claude 3.7 Sonnet | Anthropic | 0.812 | 2025-02-24 | evidence |
| Claude Opus 4 | Anthropic | 0.814 | 2025-05-22 | evidence |
| Claude Opus 4.1 | Anthropic | 0.824 | 2025-08-05 | evidence |
| Claude Sonnet 4 | Anthropic | 0.805 | 2025-05-22 | evidence |
| Claude Sonnet 4.5 | Anthropic | 0.862 | 2025-09-29 | evidence |
| GLM-4.5 | Z.ai | 0.797 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.779 | 2025-07-28 | evidence |
| GPT OSS 120B | OpenAI | 0.678 | 2025-08-05 | evidence |
| GPT OSS 20B | OpenAI | 0.548 | 2025-08-05 | evidence |
| GPT-4.1 | OpenAI | 0.68 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.558 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.226 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.684 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.603 | 2024-08-06 | evidence |
| MiniMax M1 40K | MiniMax | 0.678 | 2025-06-16 | evidence |
| MiniMax M1 80K | MiniMax | 0.635 | 2025-06-16 | evidence |
| o1 | OpenAI | 0.708 | 2024-12-17 | evidence |
| o3-mini | OpenAI | 0.576 | 2025-01-30 | evidence |
| o4-mini | OpenAI | 0.718 | 2025-04-16 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.678 | 2025-07-25 | evidence |
| Qwen3-Coder 480B A35B Instruct | Qwen | 0.775 | 2025-01-31 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.609 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.696 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.