Debiasing Vision-Language Models via Biased Prompts
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments 17 pages, 4 figures, 7 tables. For code and trained token embeddings, see https://github.com/oxai/debias-vision-lang; Changed to use ACL layout, added joint training with comparison figure, corrected spelling and formatting errors; This paper is accepted for publication at AACL 2022, the official version of record is in the ACL Anthology
专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2021
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
机构 * University of Aberdeen(阿伯丁大学) ; International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Southern California(南加利福尼亚大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。
Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com
FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)
AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。
利用文本拒绝方向实现多模态安全
机构 * University of Trento(特伦托大学)
专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。
Comments Preprint
超越模板:通过元提示重新审视零样本遥感
机构 * Remote Sensing Lab, National Technical University of Athens(遥感实验室,国家技术大学雅典分校) ; Remote Sensing Lab, Department of Engineering and Sciences, National Technical University of Athens(遥感实验室,工程与科学系,国家技术大学雅典分校) ; Universitas Mercatorum(默卡托大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究通过元提示框架(MPVR)在17种视觉语言模型和12个遥感数据集上探索零样本性能,发现语义丰富的LLM生成描述可能引入噪声,而轻量级查询嵌入校准能稳定提升分类和检索性能。
当提示误导:多模态大语言模型中的文本主导与诊断偏差
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)
AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。
Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop
面向人机装配遥操作的不确定性感知意图预测
机构 * University of California, Riverside(加州大学河滨分校) ; University of Miami(迈阿密大学)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)
AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。
Comments 7 pages, 6 figures. Preprint version
视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划
专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。
手术内窥镜视频的时间视觉语言模型的鲁棒性研究
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Birmingham City University(伯明翰城市大学) ; University Hospitals Birmingham(伯明翰大学医院) ; Khalifa University(哈利法大学) ; German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。
Comments Accepted to MICCAI 2026
大型视觉语言模型的测试时幻觉控制
机构 * Australian National University(澳大利亚国立大学) ; The University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; York University(约克大学) ; Lancaster University(兰卡斯特大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。
Comments Accepted at ECCV 2026 MUCG
PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。
超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控
机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) ; Khalifa University, UAE(卡布斯大学,阿联酋) ; Australian National University, Australia(澳大利亚国立大学,澳大利亚)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。
Journal ref The 37th British Machine Vision Conference (BMVC) 2026
重视零样本不确定性:面向测试时自适应视觉-语言模型的保守校准
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对测试时自适应(TTA)视觉-语言模型校准度下降的问题,提出零样本锚定熵校准(ZAEC)方法,通过最小温度缩放恢复锐化预测的零样本熵,在多模型多数据集上实现了更低的期望校准误差(ECE)。
用于视觉-语言模型测试时适应的局部间隔恢复
机构 * Guangzhou University(广州大学) ; The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) ; Jinan University(暨南大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。
Comments Accepted by ACM MM 2026
扩大视觉-语言模型规模不足以缓解偏见
机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。
统一视觉-语言模型中的对抗鲁棒模型专家
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。
CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。
BioPro: 关于差分意识的性别公平性在视觉-语言模型中
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI
AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。
Comments ACM Multimedia 2026
高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(日本信息处理研究所) ; The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。
Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT
GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击
机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) ; School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。
Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance
视觉语言模型中模态顺序一致性的测试时训练
机构 * University of Chicago(芝加哥大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究发现视觉语言模型对图像和问题呈现顺序敏感,利用此设计测试时训练方法,缩小模态顺序差距,使两种顺序相互一致,定位顺序失败区域,证明该方法可缓解故障并提升性能。
Comments 16 pages, 7 figures, preprint
用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例
机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) ; College of Computer Science, Chongqing University(重庆大学计算机科学学院) ; School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。
Comments Accepted by ACM MM 2026
用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序
机构 * KAIST(韩国科学技术院) ; KENTECH(KENTECH研究院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。
Comments Pre-print
SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉
机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ; ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) ; City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) ; Shanghai Jiao Tong University, China(上海交通大学,中国) ; Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) ; VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。
Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER
合成CT何时迁移?一种无标签的供体/宿主诊断方法用于真实肺CT上的医学视觉-语言模型路由
专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract_cn);分类 cs.CV
AI总结 本文提出一种无标签方法,通过合成数字双胞胎区分供体驱动和宿主驱动的模型能力,预测合成CT到真实CT的迁移性,并在肺CT视觉-语言任务上验证。
Comments 10 pages, 7 figures, 1 table, 1 supplement
利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动
机构 * KAIST(韩国科学技术院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。