TY - RPRT TI - From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery AU - Xinglin Wang AU - Zishen Liu AU - Tong Zheng AU - Shaoxiong Feng AU - Peiwen Yuan AU - Yiwei Li AU - Jiayi Shi AU - Yueqi Zhang AU - Chuyi Tan AU - Ji Zhang AU - Boyuan Pan AU - Kan Li PY - 2026 UR - https://arxiv.org/abs/2610.09684 ID - 2610.09684 ER -