Evaluating Robustness of Vision-Language Models Under Noisy Conditions
机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
机构 * Liverpool John Moores University(利物浦约翰·穆里斯大学) ; Birla Institute of Technology(比拉理工学院) ; Christ University(基督大学) ; Columbia University(哥伦比亚大学) ; New York University(纽约大学) ; University of Washington(华盛顿大学) ; Hanyang University(翰阳大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);vision-language model(abstract);MLLM(abstract);分类 cs.CV
Comments 228 references
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments 14 pages, 8 figures, AAAI 2025
Journal ref AAAI 2025
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI
Comments ICML 2024 Workshop on Large Language Models and Cognition
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);LLaVA(abstract);grounding(abstract)
Comments Accepted at ECCV 2024
危险还是异常?评估用于理解危险和差异的视觉语言模型
机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。
Comments 8 pages, accepted to RO-MAN 2026
计数存在但未对齐:理解和纠正视觉语言模型中的计数失败
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Imperial College London(伦敦帝国学院)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。
惊喜引导的归并排序:通过自适应比较调度实现预算高效的人机协同排名
机构 * Hanyang University(汉阳大学) ; Hankuk University of Foreign Studies(韩国外国语大学)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 提出惊喜引导的归并排序(SGS)框架,利用视觉语言模型(VLM)作为问题优先级排序器,通过自适应预算分配将高模糊度比较路由给人类,在六个基准上以相同预算实现Kendall's τ×100提升6-12点。
Comments After submission, we discovered significant issues in the reference and citation information used in the manuscript. Because these issues affect the integrity of the scholarly record and require substantial revision and verification, we request withdrawal of the current submission. A corrected version may be submitted in the future after a comprehensive review
GhostPrompt:视觉语言模型的跨图像对抗性提示
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 研究视觉语言模型对抗攻击问题,提出GhostPrompt方法,通过联合优化提炼图像不变对抗特征,跨图像引导模型输出,相比现有基线攻击成功率显著提高且计算时间大幅减少。
Comments Accepted to ACM MM 2026. Code: this https://github.com/Ye-ze-yu/GhostPrompt
镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。
安全关键场景下基于蒸馏视觉语言模型的事件自适应运动规划
机构 * Southern University of Science and Technology(南方科技大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Manifold Tech Limited(曼孚科技股份有限公司)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 提出事件自适应运动规划(EAMP)框架,通过可配置语义事件触发器、蒸馏视觉语言模型和语义模型预测控制,在安全关键场景中实现高层推理与底层控制的协同,提升动态安全裕度并保持实时性。
Comments 8 pages, 8 figures, 4 tables. Accepted by IROS 2026
MirrorCheck: 视觉-语言模型的高效对抗防御
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) ; NVIDIA ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Michigan State University(密歇根州立大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。
见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce AI研究)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。
VISOR:基于视觉-语言模型的机器人测试 oracle
机构 * Simula Research Laboratory(Simula研究实验室) ; Oslo Metropolitan University(奥斯陆理工大学) ; Mondragon University(蒙dragon大学) ; National Institute of Informatics(国立信息研究所)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 VISOR 提出基于视觉-语言模型的自动化测试 oracle 方法,解决机器人测试中任务正确性评估难题,通过两个模型在多个任务上验证,展现高召回率和高精确度,但不确定性与正确性相关性低。
系统介导的注意力失衡使视觉-语言模型倾向于说‘是’
机构 * Saarland Informatics Campus, Saarland University, Germany(萨尔兰州信息学校区,萨尔兰州大学,德国) ; Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所,德国)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文研究了视觉-语言模型中系统介导的注意力失衡对‘是’偏见的影响,提出通过重新分配注意力以减少这种偏见,从而提升模型可靠性。
Comments Accepted to ACL Findings 2026
评估基于视觉语言模型的非人形机器人语义可及性推理
机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) ; University of Bristol(布里斯托尔大学)
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)
AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。
Comments AAMAS 2026 (main track), 9 pages, 4 figures
VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别
机构 * Department of Inforation Engineering(信息工程系)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。
使VLM在卡通角色图像上通过姿态信息识别视觉幻觉
机构 * Chung-Ang University(Chung-Ang 大学) ; Coupang(韩国Coupang)
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。
Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)
多模态大语言模型的不确定性量化:基于不一致性调整的语义体积
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 UMPIRE是一种无需训练的多模态大语言模型不确定性量化框架,通过内部特征有效捕捉语义多样性和响应不一致性,提升错误检测和不确定性校准性能。
Comments Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop
为大型视觉-语言模型设计对抗输入使用黑盒优化
机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) ; School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。
Comments EACL
机构 * Centre for Robotic Autonomy in Demanding and Long-lasting Environments(机器人自主性在恶劣和持久环境中的研究中心) ; Centre for Robotics and AI(机器人与人工智能中心) ; University of Manchester(曼彻斯特大学) ; Amentum Clean Energy Ltd(Amentum清洁能源有限公司)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref MisD 2025: 1st Workshop on Misinformation Detection in the Era of LLMs
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 23 pages, 10 figures
机构 * Hewlett Packard Enterprise (Hewlett Packard Labs)(惠普企业公司(惠普实验室))
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted: IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2025
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2024 Workshops: RBFM (Best Paper), Frontiers in AdvML (Oral), Red Teaming GenAI (Oral), SoLaR (Spotlight), SATA
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Code URL: https://github.com/d-ailin/CLIP-Guided-Decoding
更大还是更便宜?图像退化下视觉语言模型中尺度和量化对不确定性信号的影响
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.CV、cs.LG
AI总结 研究在图像退化下视觉语言模型中尺度和量化对不确定性信号的影响,通过对Qwen2-VL系列模型的实验发现,尺度提升内部不确定性信号,4位量化对准确性影响小但对置信信号影响大,建议固定内存预算下选更大量化模型,如7B-4bit。
Comments 12 pages, 4 figures. Code and data: https://github.com/Asif-Ferdous/vlm-scale-quant