arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2409.19967 2024-10-01 cs.CV 74%

Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function

Chenyi Zhuang, Ying Hu, Pan Gao

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

Comments Accepted to NeurIPS 2024. Code is available at https://github.com/I2-Multimedia-Lab/Magnet

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14977 2024-09-10 cs.CV 74%

A Lost Opportunity for Vision-Language Models: A Comparative Study of Online Test-Time Adaptation for Vision-Language Models

Mario Döbler, Robert A. Marsden, Tobias Raichle, Bin Yang

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

Comments Accepted at ECCV 2024 OOD-CV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02546 2024-05-30 cs.CV 74%

Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning

Zhuo Huang, Chang Liu, Yinpeng Dong, Hang Su, Shibao Zheng, Tongliang Liu

专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02415 2024-04-04 cs.CV 74%

What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases

Anthony Meng Huat Tiong, Junqi Zhao, Boyang Li, Junnan Li, Steven C. H. Hoi, Caiming Xiong

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09766 2024-03-18 cs.CV 74%

An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models

Haochen Luo, Jindong Gu, Fengyuan Liu, Philip Torr

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04403 2023-12-08 cs.CV 74%

OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization

Dongchen Han, Xiaojun Jia, Yang Bai, Jindong Gu, Yang Liu, Xiaochun Cao

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14381 2023-09-27 cs.CL cs.AI 74%

Survey of Social Bias in Vision-Language Models

Nayeon Lee, Yejin Bang, Holy Lovenia, Samuel Cahyawijaya, Wenliang Dai, Pascale Fung

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 73%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 73%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 73%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 73%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 73%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15657 2026-07-20 cs.CR cs.CV cs.LG 新提交 73%

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents

智能体是否会梦到虚假记忆?对多模态人工智能智能体长期记忆的黑盒视觉攻击

Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 研究针对多模态人工智能智能体长期记忆的黑盒视觉攻击,提出Lucid框架,通过制作扰动实现记忆中毒和注入两种攻击模式,在多种对话领域和架构上评估,揭示了多模态记忆管道的结构漏洞。

Comments 34 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 73%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 73%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 73%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 73%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10764 2026-06-30 cs.CV cs.AI 73%

Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization

打破刹车,而非车轮:通过熵最大化实现无目标越狱

Mengqi He, Xinyu Tian, Xin Shen, Shu Zou, Jinhong Ni, Zhaoyuan Yang, Weikang Li, Xuesong Li, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) The University Of Queensland(昆士兰大学) Peking University(北京大学) GE research(通用电气研究院) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出UJEM-KL攻击方法,通过最大化决策令牌的熵来翻转视觉-语言模型的拒绝输出,实现高迁移性的无目标越狱。

Comments Preprint. 17 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 73%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07647 2026-06-09 cs.CV cs.CL cs.LG 新提交 73%

Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation

关键位置引导:基于令牌级视觉敏感度引导的LVLMs幻觉缓解

Ruipeng Zhang, Zhihao Li, C. L. Philip Chen, Tong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 提出令牌级视觉敏感度引导(TLVS)方法,通过提取令牌级引导向量并自适应调整引导强度,仅在关键解码步骤抑制幻觉,在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02578 2026-06-02 cs.CV cs.AI 73%

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 73%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04946 2026-06-02 cs.CV cs.AI 73%

Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics

原型性偏差揭示多模态评估指标中的盲点

Subhadeep Roy, Gagan Bhatia, Steffen Eger

机构 * University of Technology Nuremberg(图恩大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文通过构建受控诊断基准PROTOBIAS,发现并验证了多模态评估指标中存在原型性偏差,即倾向于选择视觉或社会原型性高但语义错误的图像,并提出了轻量级对比训练评估器PROTOSCORE作为缓解基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO 73%

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 73%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11559 2026-05-13 cs.CV cs.AI 73%

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

当观察不足时:视觉注意结构揭示大语言模型中的幻觉

Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou)(人工智能前沿 thrust,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过分析视觉注意的高频结构揭示大语言模型中的幻觉现象,提出LaSCD解码策略,有效减少幻觉并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG 73%

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR 73%

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05594 2026-05-08 cs.CL cs.CV cs.LG 73%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08486 2026-04-16 cs.CV cs.AI 73%

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images

视觉自我实现对齐:通过威胁相关图像塑造安全导向的人设

Qishun Yang, Shu Yang, Lijie Hu, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Provable Responsible AI and Data Analytics Lab(可证责任AI与数据分析实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) China University of Petroleum-Beijing at Karamay(北京石油大学克拉玛依校区)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉自我实现对齐方法,通过威胁相关图像训练视觉语言模型,塑造安全导向的人设,减少攻击成功率并提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏