TY - RPRT TI - Small Language Models as Judges for Rubric-Based Reinforcement Learning AU - Fengyu Xie AU - Yilun Zhao AU - Bingsen Chen AU - Arman Cohan AU - Chen Zhao PY - 2026 UR - https://arxiv.org/abs/2608.30005 ID - 2608.30005 ER -