TY - RPRT TI - Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards AU - Fanchao Chen AU - Hengyu Fu AU - Shivaram Venkataraman AU - Jiantao Jiao PY - 2026 UR - https://arxiv.org/abs/2609.36864 ID - 2609.36864 ER -