Paper page - When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?
…Xuanfei Ren , Abstract Offline reinforcement learning with trajectory-level outcome supervision presents statistical challenges that can be addressed through pessimistic actor-critic methods, though fundamental barriers exist for certain generalized outcome-based…