TY - RPRT TI - Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation AU - Jiacheng Xu AU - Feng Chen AU - Xiuneng Xu AU - Bo An PY - 2026 UR - https://arxiv.org/abs/2609.09135 ID - 2609.09135 ER -