arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2251 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2251 篇

2506.07022 2026-02-10 cs.LG cs.AI cs.CR 62%

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06652 2026-02-09 cs.AI cs.CV 62%

Same Answer, Different Representations: Hidden instability in VLMs

相同答案,不同表示:VLMs中的隐藏不稳定性

Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena, Aryo Pradipta Gema, Wai-Chung Kwan, Fazl Barez, Maria Sofia Bucarelli, Fabrizio Silvestri, Pasquale Minervini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) CNRS(法国国家科学研究中心) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) i3S(i3S研究所)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示了视觉语言模型中隐藏的不稳定性,通过引入新的评估框架发现模型在内部表示漂移、鲁棒性与决策边界等方面存在显著问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05710 2026-02-06 cs.CY cs.CL cs.CV cs.LG 62%

Ethology of Latent Spaces

潜在空间的伦理学

Philippe Boisnard

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过伦理学视角揭示视觉语言模型潜在空间的非中立性,发现不同模型对政治与文化类别的归因差异显著,提出计算潜在政治化、涌现偏见和三种算法视域制度等核心概念。

Comments 23. pages, 14 figures, presented Hyperheritage International Symposium 9 ( https://paragraphe.univ-paris8.fr/IMG/pdf/programme_colloque_his9_campuscondorcet_v3.pdf ) and accepted for publication in double-blind peer review in French in 2026-2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04340 2026-02-05 cs.CV cs.AI 62%

Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning

显式不确定性建模用于主动CLIP适应与双提示微调

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于双提示微调的显式不确定性建模框架,用于提升主动CLIP适应的分类可靠性与主动样本选择效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03895 2026-02-05 cs.CV cs.LG 62%

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

面向视觉到大视觉语言模型的公平性无害基准测试

Xuwei Tan, Ziyu Hu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 NH-Fair提出一个统一基准,评估视觉到大视觉语言模型的公平性无害性,通过系统调优和数据增强方法减少偏见,提升公平性和准确性。

Comments Accepted at ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 62%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02004 2026-02-03 cs.CV cs.AI 62%

ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning

ClueTracer: 问题到视觉线索追踪用于无训练 hallucination 抑制在多模态推理

Gongli Xi, Kun Wang, Zeming Gao, Huahui Yi, Haolang Lu, Ye Tian, Wendong Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) West China Biomedical Big Data Center(西京生物大数据中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ClueTracer通过问题到视觉线索追踪,无训练抑制多模态推理中的幻觉,提升推理和非推理任务性能。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13379 2026-01-27 cs.AI cs.CV 62%

The Art of Saying "Maybe": A Conformal Lens for Uncertainty Benchmarking in VLMs

也许的艺术:一种用于VLMs不确定性基准测试的共形透镜

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, M Saifur Rahman, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于VLMs不确定性基准测试的共形透镜,评估了18种最先进的VLMs在6个多元数据集上的表现,发现更大模型在不确定性量化方面表现更佳,而数学和推理任务则表现出较差的不确定性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17357 2026-01-27 cs.LG cs.AI 62%

Spectral Geometry for Deep Learning: Compression and Hallucination Detection via Random Matrix Theory

深度学习的谱几何:通过随机矩阵理论实现压缩与幻觉检测

Davide Ettori

机构 * Politecnico di Milano(米兰理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于谱几何和随机矩阵理论的统一框架,通过分析隐藏激活的特征值结构,实现幻觉检测与模型压缩,提升深度学习的可靠性和效率。

Comments Master thesis, MS in Computer Science, University of Illinois Chicago, defended November 21, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17093 2026-01-27 cs.LG cs.AI 62%

The Triangle of Similarity: A Multi-Faceted Framework for Comparing Neural Network Representations

相似性的三角形:一种多维框架用于比较神经网络表示

Olha Sirikova, Alvin Chan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出相似性三角形框架,通过静态、功能和稀疏性三个视角比较神经网络表示,揭示架构对表示相似性的影响及剪枝对模型核心的影响。

Comments Accepted to AAAI 2026 Workshop on AI for Scientific Research (AI4Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16429 2026-01-26 cs.CV cs.AI 62%

AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose

AlphaFace: 高保真和实时的面部交换器,对面部姿态具有鲁棒性

Jongmin Yu, Hyeontaek Oh, Zhongtian Sun, Angelica I Aviles-Rivero, Moongu Jeon, Jinhong Yang

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Tsinghua University(清华大学) Gwangju Institute of Science and Technology(全州科学技术院) Inje University(庆北大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 AlphaFace通过结合视觉-语言模型和CLIP嵌入,实现高保真和实时的面部交换,提升对极端面部姿态的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16378 2026-01-26 cs.CV cs.AI q-bio.NC 62%

Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models

具有认知启发的标记克服了多模态模型中的自我中心偏差

Bridget Leonard, Scott O. Murray

机构 * Department of Psychology University of Washington(心理学系华盛顿大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10010 2026-01-16 cs.CV cs.AI 62%

VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models

VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉

Zefan Zhang, Kehua Zhu, Shijie Jiang, Hongyuan Lu, Shengkai Sun, Tian Bai

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) College of Software, Jilin University(吉林大学软件学院) Facemind Group(FaceMind集团) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08557 2026-01-14 cs.CV cs.AI 62%

VideoHEDGE: Entropy-Based Hallucination Detection for Video-VLMs via Semantic Clustering and Spatiotemporal Perturbations

VideoHEDGE: 基于熵的视频视频语言模型幻觉检测方法:通过语义聚类和时空扰动

Sushant Gautam, Cise Midoglu, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoHEDGE通过语义聚类和时空扰动检测视频VLMs中的幻觉,利用熵和校准方法提高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 62%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 62%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 62%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04199 2026-01-09 cs.LG cs.AI cs.CL 62%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04163 2026-01-08 eess.IV cs.CV cs.LG 62%

Scanner-Induced Domain Shifts Undermine the Robustness of Pathology Foundation Models

扫描诱导的域偏移损害病理基础模型的鲁棒性

Erik Thiringer, Fredrik K. Gustafsson, Kajsa Ledesma Eriksson, Mattias Rantalainen

机构 * Department of Medical Epidemiology and Biostatistics, Karolinska Institutet(卡罗林斯卡研究所医学流行病学与生物统计学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了扫描诱导的域偏移对病理基础模型鲁棒性的影响,发现现有模型在面对扫描设备变异性时存在显著偏差,需改进嵌入稳定性和校准以提升临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 62%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23090 2026-01-05 cs.AI cs.LG 62%

Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients

基准成功,临床失败:当强化学习优化于基准,而非患者

Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Department of Health Queensland(昆士兰健康部) Griffith University(格里菲斯大学) University Hospital Bonn(波恩大学医院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17126 2026-01-01 cs.CV cs.LG 62%

MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。

Comments Accepted at KDD 2026 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO 62%

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15068 2025-12-22 cs.LG cs.AI cs.CL 62%

The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems

语义幻觉:基于嵌入的幻觉检测在RAG系统中的认证极限

Debu Sinha

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了基于嵌入的幻觉检测在RAG系统中存在语义幻觉问题,通过符合预测方法发现真实幻觉检测的挑战,证明需通过推理而非表面语义解决。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16921 2025-12-19 cs.CV cs.AI 62%

Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification

关键差异:用于能力缺口发现与纠正的模型审计

Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu

机构 * Google(谷歌) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 AuditDM通过主动发现和纠正多模态大语言模型的失败模式,提升模型性能和诊断能力。

Comments project page: https://auditdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14801 2025-12-18 cs.CL cs.AI cs.LG 62%

Incentives or Ontology? A Structural Rebuttal to OpenAI's Hallucination Thesis

激励还是本体?对OpenAI“幻觉假说”的结构反驳

Richard Ackermann, Simeon Emanuilov

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文反驳OpenAI关于幻觉源于激励不匹配的观点,指出幻觉是Transformer架构的必然结果,需通过外部验证模块消除,而非改变激励或微调。

Comments 17 pages, references to prior work arXiv:2509.16297 and arXiv:2511.06073

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14715 2025-12-18 cs.LG cs.AI 62%

How a Bit Becomes a Story: Semantic Steering via Differentiable Fault Injection

一位比特如何成为故事:通过可微分故障注入实现语义引导

Zafaryab Haider, Md Hafizur Rahman, Shane Moeykens, Vijay Devabhaktuni, Prabuddha Chakraborty

机构 * University of Maine(缅因大学) Illinois State University(伊利诺伊州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 通过可微分故障注入分析,研究比特级扰动对生成模型语义的影响,揭示低级变化如何引导高层语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14102 2025-12-17 cs.CV cs.AI cs.IR 62%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04960 2025-12-17 cs.CV cs.AI 62%

MIMIR: Masked Image Modeling for Mutual Information-based Adversarial Robustness

MIMIR:基于互信息的对抗鲁棒性图像建模

Xiaoyun Xu, Shujian Yu, Zhuoran Liu, Stjepan Picek

机构 * Radboud University Nijmegen(拉德博德大学尼姆维根分校) Vrije Universiteit Amsterdam(自由大学阿姆斯特丹) University of Zagreb Faculty of Electrical Engineering and Computing(Zagreb大学电子工程与计算学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MIMIR通过互信息惩罚和自编码器的遮蔽图像建模,提升视觉变换器的对抗鲁棒性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07730 2025-12-12 cs.CV cs.AI 62%

SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination

SAVE:基于稀疏自编码器的视觉信息增强用于缓解物体幻觉

Sangha Park, Seungryong Yoo, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州科学技术院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 SAVE通过引导模型沿稀疏自编码器潜在特征减少物体幻觉,提升视觉理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏