@misc{indiciaea64f133de9d8, title = {Reinforcement Learning from Bagged Reward}, author = {Yuting Tang and Xin-Qiang Cai and Yao-Xiang Ding and Qiyu Wu and Guoqing Liu and Masashi Sugiyama}, year = {2024}, url = {https://arxiv.org/abs/2402.03771}, note = {Source identifier: 2402.03771} }