Paper page - τ-Rec: A Verifiable Benchmark for Agentic Recommender Systems
…Our evaluation of nine configurations across five model families -- GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Flash, DeepSeek V4 Flash, Qwen3-32B and GPT-5 mini -- reveals a steep…