@misc{indiciae760bb6f5fc58, title = {Multimodal Language Models as Text-to-Image Model Evaluators}, author = {Jiahui Chen and Candace Ross and Reyhane Askari-Hemmat and Koustuv Sinha and Melissa Hall and Amy Zhang and Michal Drozdzal and Adriana Romero-Soriano}, year = {2026}, url = {https://arxiv.org/abs/2505.00759}, note = {Source identifier: 2505.00759} }