Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵
机构 * Georgetown University(乔治城大学) ; University of Southern California(南加州大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。
Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026