TY - RPRT TI - Reinforcement World Model Learning for LLM-based Agents AU - Xiao Yu AU - Baolin Peng AU - Ruize Xu AU - Yelong Shen AU - Pengcheng He AU - Suman Nath AU - Nikhil Singh AU - Jiangfeng Gao AU - Zhou Yu PY - 2026 UR - https://arxiv.org/abs/2602.05842 ID - 2602.05842 ER -