TY - RPRT TI - Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning AU - Jiaming Zhang AU - Yujie Yang AU - Haoning Wang AU - Liping Zhang AU - Shengbo Eben Li PY - 2026 UR - https://arxiv.org/abs/2511.04147 ID - 2511.04147 ER -