arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1267 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 103 篇

2606.10198 2026-06-11 cs.LG cs.AI cs.CV 版本更新 82%

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测

Nina I. Shamsi

机构 * Northeastern University Boston, United States(东北大学波士顿分校)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 81%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 81%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 81%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12055 2026-07-31 cs.CV cs.LG 版本更新 81%

Continual Learning with Vision-Language Models via Semantic-Geometry Preservation

通过语义-几何保持实现视觉-语言模型的持续学习

Chiyuan He, Zihuan Qiu, Fanman Meng, Runtong Zhang, Linfeng Xu, Qingbo Wu, Hongliang Li

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。

Comments Accepted by IEEE TCSVT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29759 2026-07-17 cs.CV cs.AI 版本更新 81%

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

TSHA:用于可信安全危害评估场景的视觉语言模型基准

Qiucheng Yu, Ruijie Xu, Mingang Chen, Jianfeng Dong, Xin Tan

机构 * City University of Hong Kong(香港城市大学) East China Normal University(华东师范大学) University of Western Australia(西澳大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) Zhejiang Gongshang University(浙江工商大学)

专题命中 幻觉与鲁棒性 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TSHA基准,通过81809个精心挑选的训练样本和1707个挑战性测试样本,评估视觉语言模型在复杂家庭安全场景中的鲁棒性和泛化能力,发现现有模型在安全危害评估中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 81%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 81%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 80%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract)

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03730 2026-08-12 cs.CV 版本更新 79%

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡布斯大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 79%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新 79%

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 79%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03177 2026-07-07 cs.CV 版本更新 79%

SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision

SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Yi Yu, Qiangqiang Wu, Xinghao Jiang, Ngai-Man Cheung, Bihan Wen, Alex Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) Shanghai Jiao Tong University, China(上海交通大学,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。

Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00591 2026-06-16 cs.CV 版本更新 79%

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

视觉语言模型中标签噪声提示调优的内在梯度抑制

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出双Softmax提示调优(DSPT),通过内在梯度抑制机制自适应压制高错误噪声样本的梯度,实现标签噪声下的鲁棒提示调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15687 2026-06-11 cs.CL cs.AI 版本更新 79%

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

ASRU:激活引导与强化遗忘融合用于多模态大语言模型

Jiahui Guang, Haiyan Wang, Yingjie Zhu, Cuiyun Gao, Jing Li, Di Shao, Zhaoquan Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03100 2026-08-11 cs.CV cs.AI 版本更新 79%

TGIF: Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs

基于文本引导的层融合缓解多模态大语言模型中的幻觉

Chenchen Lin, Sanbao Su, Rachel Luo, Yuxiao Chen, Yan Wang, Marco Pavone, Fei Miao

机构 * University of Connecticut(康涅狄格大学) NVIDIA(NVIDIA公司) Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 TGIF通过文本引导的层融合方法,有效缓解多模态大语言模型中的幻觉问题,提升视觉接地能力。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新 79%

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03989 2026-07-23 cs.CV cs.AI 版本更新 79%

When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models

当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针

Qianpu Chen, Derya Soydaner, Rob Saunders

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 79%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22038 2026-08-11 cs.CL 版本更新 78%

Source-Modality Monitoring in Vision-Language Models

视觉-语言模型中的源模态监控

Etha Tianze Hua, Tian Yun, Ellie Pavlick

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。

Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 77%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 77%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新 77%

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07822 2026-08-11 cs.RO cs.HC 版本更新 75%

Knowing When to Ask: Resolving Uncertainty in Human-Robot Joint Planning via Explicit Dialogue and Implicit Intent Cues

不确定性缓解与意图推断:一种双模式人机联合规划系统

Zeyu Fang, Yuxin Lin, Cheng Liu, Beomyeol Yu, Zeyuan Yang, Rongqian Chen, Taeyoung Lee, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治华盛顿大学) Department of Mechanical and Aerospace Engineering, George Washington University(机械与航空航天工程系,乔治华盛顿大学) Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出一种双模式人机联合规划系统,通过缓解不确定性与推断意图,提升人机协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 74%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12571 2026-06-12 cs.CV 版本更新 74%

Measurement Plasticity: Sensor-Level Adaptation for Vision-Language Models

测量塑性:面向视觉-语言模型的传感器级自适应

Boyeong Im, Wooseok Lee, Yoojin Kwon, Hyung-Sin Kim

机构 * University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。

Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 73%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 73%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏