@misc{indiciaece4d8255fdcd, title = {Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning}, author = {Xinjie Liu and Ruihan Zhao and Anirban Chaudhuri and Cyrus Neary and Ufuk Topcu and David Fridovich-Keil}, year = {2026}, url = {https://arxiv.org/abs/2610.02505}, note = {Source identifier: 2610.02505} }