TY - RPRT TI - An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models AU - Xinxin Lin AU - Guangxin Dai AU - Yi Zhong AU - Xiang Li AU - Xue Xiao AU - Jian Liu AU - Yixin Zhang AU - Lingming Hu AU - Zhengdong Wu AU - Yongbo Zheng AU - Runchuan Zhu AU - Ming Zhao AU - Huizi Yu AU - Yi Zhang AU - Fangting Lu AU - Shuo Wu AU - Jun Zhao AU - Ping Yin AU - Joey W. Y. Chan AU - Ngan Yin Chan AU - Yumei Wang AU - Lejin Yang AU - Yanqiu Xing AU - Sijing Chen AU - Yun Kwok Wing AU - Lin Lu AU - Xin Ma AU - Lizhou Fan PY - 2026 UR - https://arxiv.org/abs/2602.06449 ID - 2602.06449 ER -