TY - RPRT TI - VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences AU - Yiwen Jiang AU - Yang Deng AU - Stephanie Fong AU - Zimu Wang AU - Yaling Shen AU - Wei Feng AU - Hongxi Yang AU - Xiangyu Zhao AU - Zhongxing Xu AU - Deval Mehta AU - Xuelian Cheng AU - Zongyuan Ge PY - 2026 UR - https://arxiv.org/abs/2609.00921 ID - 2609.00921 ER -