Benchmark
TAU-bench Airline
Part of τ-bench (TAU-bench), a benchmark for Tool-Agent-User interaction in real-world domains. The airline domain evaluates language agents' ability to…
- Modality
- text
- Categories
- reasoning, communication, tool_calling
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 23
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.5 Haiku | Anthropic | 0.228 | 2024-10-22 | evidence |
| Claude 3.5 Sonnet | Anthropic | 0.46 | 2024-10-22 | evidence |
| Claude 3.7 Sonnet | Anthropic | 0.584 | 2025-02-24 | evidence |
| Claude Opus 4 | Anthropic | 0.596 | 2025-05-22 | evidence |
| Claude Opus 4.1 | Anthropic | 0.56 | 2025-08-05 | evidence |
| Claude Sonnet 4 | Anthropic | 0.6 | 2025-05-22 | evidence |
| Claude Sonnet 4.5 | Anthropic | 0.7 | 2025-09-29 | evidence |
| GLM-4.5 | Z.ai | 0.604 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.608 | 2025-07-28 | evidence |
| GPT-4.1 | OpenAI | 0.494 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.36 | 2025-04-14 | evidence |
| GPT-4.1 nano | OpenAI | 0.14 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.5 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.428 | 2024-08-06 | evidence |
| MiniMax M1 40K | MiniMax | 0.6 | 2025-06-16 | evidence |
| MiniMax M1 80K | MiniMax | 0.62 | 2025-06-16 | evidence |
| o1 | OpenAI | 0.5 | 2024-12-17 | evidence |
| o3-mini | OpenAI | 0.324 | 2025-01-30 | evidence |
| o4-mini | OpenAI | 0.492 | 2025-04-16 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.46 | 2025-07-25 | evidence |
| Qwen3-Coder 480B A35B Instruct | Qwen | 0.6 | 2025-01-31 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.44 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.49 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.