arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-19 至 2026-08-19 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2608.17084 2026-08-19 cs.CL 新提交 88%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);grounding(abstract)

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17723 2026-08-19 cs.CV 新提交 85%

Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability

用于模拟仪表读数的视觉-语言模型:专业化、迁移与可靠性的实证研究

Abdul Mueez, Aaditya Baranwal, Junior Chaj-Mejia, Guneet Bhatia, Jason T. Voelker, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学) Siemens Energy(西门子能源)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过实证评估Qwen2.5-VL-7B-Instruct模型在模拟仪表读数任务中的表现,发现其经QLoRA微调后在三类数据集上误差较低,但存在迁移性能下降和高置信度错误问题,暂不适合直接部署为工厂监控流程。

Comments Submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 85%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: this https URL (https://xishuxishu.github.io/Know3D.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 83%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17306 2026-08-19 cs.CV cs.AI 新提交 81%

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优

Yang Chen, Zhan Zhuang, Yanbin Wei, Zebin Chen, Hua Liu, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-19 cs.AI cs.MM 版本更新 70%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13706 2026-08-19 cs.CL cs.AI 版本更新 57%

CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

CLAIR-Fin:用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain

机构 * Ahsanullah University of Science and Technology(阿萨努拉科技大学) Jashore University of Science and Technology(杰索尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究提出CLAIR-Fin九智能体框架,针对跨模态金融问答的声明级验证与自适应辩论,在BB-FinQA-X数据集上提升了模型忠实度,且弃权比例合理,优于相关基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17717 2026-08-19 cs.RO 新提交 50%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 50%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract)

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏