arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2604.05510 2026-04-14 cs.CV 79%

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10299 2026-04-14 cs.CV cs.CL 79%

Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking

见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全

Jingru Li, Wei Ren, Tianqing Zhu

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) City University of Macau(澳门城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。

Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV 79%

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 79%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 幻觉与鲁棒性 :grounding(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 79%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 79%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 79%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI 79%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26984 2026-04-01 cs.CV 79%

A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性

Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi

机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)

专题命中 幻觉与鲁棒性 :vision-language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV 79%

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07619 2026-03-31 cs.CV 79%

Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models

过度思考导致幻觉:追踪视觉语言模型中的混杂因素传播

Abin Shoby, Ta Duc Huy, Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Anton van den Hengel, Phi Le Nguyen, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, University of Adelaide(阿德莱德大学澳大利亚机器学习研究所) Hanoi University of Science and Technology(河内科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 研究发现视觉语言模型幻觉源于过度思考,通过分析模型推理过程揭示混杂因素传播机制,提出Overthinking Score提升幻觉检测性能。

Comments CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08391 2026-03-31 cs.CV 79%

SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding

SECOND:通过选择性和对比性解码缓解视觉-语言模型中的感知幻觉

Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出SECOND方法,通过选择性与对比性解码机制,有效利用多尺度视觉信息,减少视觉语言模型中的感知幻觉并提升性能。

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25088 2026-03-27 cs.CV 79%

Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors

视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉

Chengxu Yang, Jingling Yuan, Chuang Hu, Jiawei Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25035 2026-03-27 cs.AI 79%

Mechanistically Interpreting Compression in Vision-Language Models

视觉语言模型压缩的机理解释

Veeraraju Elluru, Arth Singh, Roberto Aguero, Ajay Agarwal, Debojyoti Das, Hreetam Paul

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校) AIM Intelligence National Institute of Technology Agartala(国立阿加尔塔拉理工学院) Fordham University(福特汉姆大学) University of Fukui(福井大学) Independent Researcher(独立研究员)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文通过因果电路分析和交叉编码器特征比较,研究了剪枝和量化对视觉语言模型内部结构的影响,并提出VLMSafe-420基准测试,揭示压缩对安全行为的影响。

Comments 15 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22094 2026-03-26 cs.CV 79%

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御

Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV 79%

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16501 2026-03-26 cs.AI 79%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21047 2026-03-24 cs.CV 79%

When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound

微小修改同样重要:基于LLM驱动的提示攻击用于医学视觉语言模型在超声中的鲁棒性

Yasamin Medghalchi, Milad Yazdani, Amirhossein Dabiriaghdam, Moein Heidari, Mojan Izadkhah, Zahra Kavian, Giuseppe Carenini, Lele Wang, Dena Shahriari, Ilker Hacihaliloglu

机构 * University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一个可扩展的对抗评估框架,利用大语言模型生成临床合理的对抗提示变体,评估SOTA医学视觉语言模型在超声中的鲁棒性,揭示模型在临床应用中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25620 2026-03-19 cs.CV 79%

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

机构 * School of Medicine, Yale University(耶鲁大学医学院) School of Computing, Australian National University(澳大利亚国立大学计算机学院) School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。

Comments ACM Transactions on Computing for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15940 2026-03-18 cs.CR cs.CV 79%

Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models

不要留下空白:视觉-语言模型中的无幻觉物体遮蔽

Amira Guesmi, Muhammad Shafique

机构 * Engineering Division, New York University Abu Dhabi, UAE(纽约大学阿布扎比分校工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种背景一致的物体遮蔽攻击方法,通过重新编码视觉表示使目标物体与背景一致,避免幻觉产生,实验显示其能有效遮蔽目标物体并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10577 2026-03-13 cs.AI cs.HC 79%

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

CUAAudit: 视觉语言模型作为自主计算机使用代理的元评估

Marta Sumyk, Oleksandr Kosovan

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型作为自主计算机使用代理审计员的元评估,发现尽管先进模型在准确性方面表现良好,但在复杂环境中性能下降,突显了现实部署中需考虑评估者可靠性与不确定性的重要性。

Comments This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 79%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 79%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08708 2026-03-10 cs.CV 79%

FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models

FVG-PT:适应性前景视图引导的提示微调用于视觉-语言模型

Haoyang Li, Liang Wang, Siyu Zhou, Jiacheng Sun, Jing Jiang, Chao Wang, Guodong Long, Yan Peng

机构 * University of Technology Sydney(悉尼技术大学) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 FVG-PT通过引入前景可靠性门、蒸馏补偿模块和先验校准模块,解决提示微调中前景注意力偏移问题,提升视觉-语言模型的适应性和泛化能力。

Comments 27 Pages, 9 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23465 2026-03-03 cs.AI 79%

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架

Zhuoli Yin, Yi Ding, Reem Khir, Hua Cai

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.AI

AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 79%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 79%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05535 2026-02-27 cs.LG 79%

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

通过证据不确定性量化检测大视觉-语言模型的误行

Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV 79%

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏