arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2242 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2242 篇

2302.00070 2023-05-16 cs.LG cs.CV 81%

Debiasing Vision-Language Models via Biased Prompts

Ching-Yao Chuang, Varun Jampani, Yuanzhen Li, Antonio Torralba, Stefanie Jegelka

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12748 2023-04-20 cs.CV cs.LG 81%

Enabling Calibration In The Zero-Shot Inference of Large Vision-Language Models

Will LeVine, Benjamin Pikus, Pranav Raja, Fernando Amat Gil

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12734 2023-03-23 cs.CV cs.CL cs.LG 81%

MultiModal Bias: Introducing a Framework for Stereotypical Bias Assessment beyond Gender and Race in Vision Language Models

Sepehr Janghorbani, Gerard de Melo

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11933 2022-10-27 cs.LG cs.CL cs.CV cs.CY 81%

A Prompt Array Keeps the Bias Away: Debiasing Vision-Language Models with Adversarial Learning

Hugo Berg, Siobhan Mackenzie Hall, Yash Bhalgat, Wonsuk Yang, Hannah Rose Kirk, Aleksandar Shtedritski, Max Bain

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 17 pages, 4 figures, 7 tables. For code and trained token embeddings, see https://github.com/oxai/debias-vision-lang; Changed to use ACL layout, added joint training with comparison figure, corrected spelling and formatting errors; This paper is accepted for publication at AACL 2022, the official version of record is in the ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16848 2021-06-25 cs.CV cs.AI 81%

Embracing Uncertainty: Decoupling and De-bias for Robust Temporal Grounding

Hao Zhou, Chongyang Zhang, Yan Luo, Yanjun Chen, Chuanping Hu

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 80%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 80%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 80%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20702 2026-06-23 cs.CV cs.AI cs.LG 新提交 80%

Beyond Templates: Revisiting Zero-Shot Remote Sensing through Meta-Prompting

超越模板:通过元提示重新审视零样本遥感

Eirini Baltzi, Dionysis Christopoulos, Sotiris Spanos, Valsamis Ntouskos, Konstantinos Karantzalos

机构 * Remote Sensing Lab, National Technical University of Athens(遥感实验室,国家技术大学雅典分校) Remote Sensing Lab, Department of Engineering and Sciences, National Technical University of Athens(遥感实验室,工程与科学系,国家技术大学雅典分校) Universitas Mercatorum(默卡托大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过元提示框架(MPVR)在17种视觉语言模型和12个遥感数据集上探索零样本性能,发现语义丰富的LLM生成描述可能引入噪声,而轻量级查询嵌入校准能稳定提升分类和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 80%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08341 2026-06-09 cs.RO 新提交 80%

Uncertainty-Aware Intention Prediction for Human-to-Robot Assembly Teleoperation

面向人机装配遥操作的不确定性感知意图预测

Fnu Heman, Yixuan Wang, Kolin Xu, Conner Wallace, John Dang, Akhil Joshi, Jun Sheng, Pinhas Ben-Tzvi, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) University of Miami(迈阿密大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)

AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。

Comments 7 pages, 6 figures. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 80%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14262 2026-08-17 cs.CV 新提交 79%

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

手术内窥镜视频的时间视觉语言模型的鲁棒性研究

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad Haris Khan, Imran Razzak, Brejesh Lall, Lena Maier-Hein, Yutong Xie

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Birmingham City University(伯明翰城市大学) University Hospitals Birmingham(伯明翰大学医院) Khalifa University(哈利法大学) German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11474 2026-08-13 cs.CV 新提交 79%

Test-Time Hallucination Control in Large Vision-Language Models

大型视觉语言模型的测试时幻觉控制

Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani

机构 * Australian National University(澳大利亚国立大学) The University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) York University(约克大学) Lancaster University(兰卡斯特大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。

Comments Accepted at ECCV 2026 MUCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 79%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03730 2026-08-12 cs.CV 版本更新 79%

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡布斯大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05945 2026-08-07 cs.CV 新提交 79%

Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models

重视零样本不确定性:面向测试时自适应视觉-语言模型的保守校准

Jingyan Jiang, Yaru Sun, Xiao Chen, Jiazhen Huang, Caiting Li, Zhijian He, Yin Chen, Pingting Hao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对测试时自适应(TTA)视觉-语言模型校准度下降的问题,提出零样本锚定熵校准(ZAEC)方法,通过最小温度缩放恢复锐化预测的零样本熵,在多模型多数据集上实现了更低的期望校准误差(ECE)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02216 2026-08-04 cs.CV 新提交 79%

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

用于视觉-语言模型测试时适应的局部间隔恢复

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

机构 * Guangzhou University(广州大学) The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) Jinan University(暨南大学) Pengcheng Laboratory(鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28211 2026-07-31 cs.CV 新提交 79%

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

扩大视觉-语言模型规模不足以缓解偏见

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27897 2026-07-31 cs.CV 新提交 79%

Unifying Adversarially Robust Model Experts in Vision-Language Models

统一视觉-语言模型中的对抗鲁棒模型专家

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 79%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新 79%

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21036 2026-07-24 cs.CV 新提交 79%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20351 2026-07-23 cs.CV cs.CL 新提交 79%

Test-Time Training for Modality Order Consistency in Vision-Language Models

视觉语言模型中模态顺序一致性的测试时训练

Aditi Gupta, Yossi Gandelsman

机构 * University of Chicago(芝加哥大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究发现视觉语言模型对图像和问题呈现顺序敏感,利用此设计测试时训练方法,缩小模态顺序差距,使两种顺序相互一致,定位顺序失败区域,证明该方法可缓解故障并提升性能。

Comments 16 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 79%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 79%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03177 2026-07-07 cs.CV 版本更新 79%

SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision

SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Yi Yu, Qiangqiang Wu, Xinghao Jiang, Ngai-Man Cheung, Bihan Wen, Alex Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) Shanghai Jiao Tong University, China(上海交通大学,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。

Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29232 2026-06-30 cs.CV 79%

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT

合成CT何时迁移?一种无标签的供体/宿主诊断方法用于真实肺CT上的医学视觉-语言模型路由

Fakrul Islam Tushar

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出一种无标签方法,通过合成数字双胞胎区分供体驱动和宿主驱动的模型能力,预测合成CT到真实CT的迁移性,并在肺CT视觉-语言任务上验证。

Comments 10 pages, 7 figures, 1 table, 1 supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR 79%

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏