Benchmark

TAU-bench Airline

Part of τ-bench (TAU-bench), a benchmark for Tool-Agent-User interaction in real-world domains. The airline domain evaluates language agents' ability to…

Modality
text
Categories
reasoning, communication, tool_calling
Openness
unknown
Source
llm_stats
Reported scores
23

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.5 HaikuAnthropic0.2282024-10-22evidence
Claude 3.5 SonnetAnthropic0.462024-10-22evidence
Claude 3.7 SonnetAnthropic0.5842025-02-24evidence
Claude Opus 4Anthropic0.5962025-05-22evidence
Claude Opus 4.1Anthropic0.562025-08-05evidence
Claude Sonnet 4Anthropic0.62025-05-22evidence
Claude Sonnet 4.5Anthropic0.72025-09-29evidence
GLM-4.5Z.ai0.6042025-07-28evidence
GLM-4.5-AirZ.ai0.6082025-07-28evidence
GPT-4.1OpenAI0.4942025-04-14evidence
GPT-4.1 miniOpenAI0.362025-04-14evidence
GPT-4.1 nanoOpenAI0.142025-04-14evidence
GPT-4.5OpenAI0.52025-02-27evidence
GPT-4oOpenAI0.4282024-08-06evidence
MiniMax M1 40KMiniMax0.62025-06-16evidence
MiniMax M1 80KMiniMax0.622025-06-16evidence
o1OpenAI0.52024-12-17evidence
o3-miniOpenAI0.3242025-01-30evidence
o4-miniOpenAI0.4922025-04-16evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.462025-07-25evidence
Qwen3-Coder 480B A35B InstructQwen0.62025-01-31evidence
Qwen3-Next-80B-A3B-InstructQwen0.442025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.492025-09-10evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.