TY - RPRT TI - LexiHorizon: Stabilizing Reinforcement Learning for Long-Horizon Deep Search AU - Zhiqing Nong AU - Liang Wen AU - Chao-Hsuan Liu PY - 2026 UR - https://arxiv.org/abs/2610.05119 ID - 2610.05119 ER -