TY - RPRT TI - RSPO: Regularized Self-Play Alignment of Large Language Models AU - Xiaohang Tang AU - Sangwoong Yoon AU - Seongho Son AU - Huizhuo Yuan AU - Quanquan Gu AU - Ilija Bogunovic PY - 2026 UR - https://arxiv.org/abs/2503.00030 ID - 2503.00030 ER -