arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 103 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 103 篇

2605.04641 2026-07-30 cs.CV 版本更新 79%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新 79%

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 79%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03177 2026-07-07 cs.CV 版本更新 79%

SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision

SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Yi Yu, Qiangqiang Wu, Xinghao Jiang, Ngai-Man Cheung, Bihan Wen, Alex Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) Shanghai Jiao Tong University, China(上海交通大学,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。

Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00591 2026-06-16 cs.CV 版本更新 79%

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

视觉语言模型中标签噪声提示调优的内在梯度抑制

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出双Softmax提示调优(DSPT),通过内在梯度抑制机制自适应压制高错误噪声样本的梯度,实现标签噪声下的鲁棒提示调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15687 2026-06-11 cs.CL cs.AI 版本更新 79%

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

ASRU:激活引导与强化遗忘融合用于多模态大语言模型

Jiahui Guang, Haiyan Wang, Yingjie Zhu, Cuiyun Gao, Jing Li, Di Shao, Zhaoquan Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03100 2026-08-11 cs.CV cs.AI 版本更新 79%

TGIF: Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs

基于文本引导的层融合缓解多模态大语言模型中的幻觉

Chenchen Lin, Sanbao Su, Rachel Luo, Yuxiao Chen, Yan Wang, Marco Pavone, Fei Miao

机构 * University of Connecticut(康涅狄格大学) NVIDIA(NVIDIA公司) Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 TGIF通过文本引导的层融合方法,有效缓解多模态大语言模型中的幻觉问题,提升视觉接地能力。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新 79%

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03989 2026-07-23 cs.CV cs.AI 版本更新 79%

When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models

当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针

Qianpu Chen, Derya Soydaner, Rob Saunders

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 79%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22038 2026-08-11 cs.CL 版本更新 78%

Source-Modality Monitoring in Vision-Language Models

视觉-语言模型中的源模态监控

Etha Tianze Hua, Tian Yun, Ellie Pavlick

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。

Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 77%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 77%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新 77%

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07822 2026-08-11 cs.RO cs.HC 版本更新 75%

Knowing When to Ask: Resolving Uncertainty in Human-Robot Joint Planning via Explicit Dialogue and Implicit Intent Cues

不确定性缓解与意图推断:一种双模式人机联合规划系统

Zeyu Fang, Yuxin Lin, Cheng Liu, Beomyeol Yu, Zeyuan Yang, Rongqian Chen, Taeyoung Lee, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治华盛顿大学) Department of Mechanical and Aerospace Engineering, George Washington University(机械与航空航天工程系,乔治华盛顿大学) Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出一种双模式人机联合规划系统,通过缓解不确定性与推断意图,提升人机协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 74%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12571 2026-06-12 cs.CV 版本更新 74%

Measurement Plasticity: Sensor-Level Adaptation for Vision-Language Models

测量塑性:面向视觉-语言模型的传感器级自适应

Boyeong Im, Wooseok Lee, Yoojin Kwon, Hyung-Sin Kim

机构 * University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。

Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 73%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 73%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 73%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03713 2026-08-12 cs.CV 版本更新 70%

Investigating Adversarial Robustness of Multi-modal Large Language Models

探究多模态大语言模型的对抗鲁棒性

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(哈利法大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 通过系统研究多模态大语言模型的对抗鲁棒性,提出诊断性CLIP对齐协议预测鲁棒视觉编码器的迁移效果,并证明端到端多模态对抗训练能显著提升模型在强对抗攻击下的性能。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 70%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 70%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract_cn);分类 cs.CV

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13698 2026-07-15 cs.CV 版本更新 70%

Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

注意力忽视视觉风险:多模态安全对齐的风险适应性转向

Jonghyun Park, Minhyuk Seo, Chaewon Yeo, Jonghyun Choi

机构 * Seoul National University(首尔大学) KU Leuven(鲁汶大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 70%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16173 2026-08-12 cs.RO 版本更新 67%

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

视觉-语言-运动地图:用于3D场景地图的开放词汇、不确定性感知、可查询运动属性

Dibyendu Ghosh, Ayushi Shakya

机构 * Rekise Marine(瑞基斯海洋)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn)

AI总结 研究针对开放词汇3D地图无法处理场景元素运动查询的问题,提出视觉-语言-运动地图(VLMM),其元素有融合运动属性及不确定性。通过实验验证模式字段不可替代,在真实数据集上该方法提升精度、减少错误标志且对噪声姿态鲁棒。

Comments 8 pages, 5 figures, 3 tables. v2: corrected Eq. (7) (residual covariance;implementation unaffected), added the persistent-map update rule, the query-parser grammar, and an aggregation-quantile ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新 67%

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn)

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新 62%

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17173 2026-08-12 cs.CL cs.AI cs.LG 版本更新 62%

Why Do Safety Guardrails Degrade Across Languages?

为何安全护栏在不同语言中会退化?

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。

Comments Poster at Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏