@misc{indiciaebff49576f36d, title = {State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models}, author = {Mingxu Chai and Chenyu Liu and Ziyu Shen and Jiazheng Zhang and Kaidi Zhang and Ruoyu Chen and Jun Long and Jihua Kang and Tao Gui and Qi Zhang}, year = {2026}, url = {https://arxiv.org/abs/2608.28698}, note = {Source identifier: 2608.28698} }