Benchmark
Tau2 Retail
τ²-bench retail domain evaluates conversational AI agents in customer service scenarios within a dual-control environment where both agent and user can…
- Modality
- text
- Categories
- reasoning, communication, tool_calling
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 26
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude Haiku 4.5 | Anthropic | 0.832 | 2025-10-15 | evidence |
| Claude Opus 4.5 | Anthropic | 0.889 | 2025-11-24 | evidence |
| Claude Opus 4.6 | Anthropic | 0.919 | 2026-02-05 | evidence |
| Claude Sonnet 4.6 | Anthropic | 0.917 | 2026-02-17 | evidence |
| GPT-4o | OpenAI | 0.634 | 2024-08-06 | evidence |
| GPT-5 | OpenAI | 0.811 | 2025-08-07 | evidence |
| GPT-5.1 | OpenAI | 0.779 | 2025-11-13 | evidence |
| GPT-5.1 Instant | OpenAI | 0.779 | 2025-11-12 | evidence |
| GPT-5.1 Thinking | OpenAI | 0.779 | 2025-11-12 | evidence |
| GPT-5.2 | OpenAI | 0.82 | 2025-12-11 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.706 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.706 | 2025-09-05 | evidence |
| LongCat-Flash-Chat | Meituan | 0.7127 | 2025-08-29 | evidence |
| LongCat-Flash-Lite | Meituan | 0.731 | 2026-02-05 | evidence |
| LongCat-Flash-Thinking | Meituan | 0.715 | 2025-09-22 | evidence |
| LongCat-Flash-Thinking-2601 | Meituan | 0.886 | 2026-01-14 | evidence |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.569 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.6283 | 2026-03-11 | evidence |
| Nova 2 Lite | Amazon | 0.765 | 2025-12-02 | evidence |
| Nova 2 Omni | Amazon | 0.783 | 2025-12-02 | evidence |
| Nova 2 Pro | Amazon | 0.777 | 2025-12-02 | evidence |
| o3 | OpenAI | 0.802 | 2025-04-16 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.713 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.719 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.573 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.678 | 2025-09-10 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.