@misc{indiciae4d581b71da5c, title = {VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio}, author = {Hao Zhang and Qinran Lin and Linqi Song and Yong Li}, year = {2026}, url = {https://arxiv.org/abs/2606.11546}, note = {Source identifier: 2606.11546} }