TY - RPRT TI - CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning AU - Pietro Noah Crestaz AU - Mohamed Yassine Kabouri AU - Nicolas Mansard AU - Andrea Del Prete PY - 2026 UR - https://arxiv.org/abs/2609.08853 ID - 2609.08853 ER -