TY - RPRT TI - Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective AU - Han Cui AU - Jianhao Yan AU - Yun Luo AU - Hongbo Zhang AU - Zhizhang Fu AU - Yue Zhang PY - 2026 UR - https://arxiv.org/abs/2610.03185 ID - 2610.03185 ER -