@misc{indiciae5675a2b19813, title = {Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards}, author = {Magnus Jørgenvåg and David Kaczér and Lasse Ruttert and Marvin Gülhan and Lucie Flek and Florian Mai}, year = {2026}, url = {https://arxiv.org/abs/2605.31328}, note = {Source identifier: 2605.31328} }