arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-11 至 2026-05-11 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2605.07394 2026-05-11 cs.CV cs.AI 86%

BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning

BalCapRL:一种基于RL的MLLM图像描述的平衡框架

Shaokai Ye, Vasileios Saveris, Yihao Qian, Jiaming Hu, Elmira Amirloo, Peter Grasch

机构 * Apple(苹果公司)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BalCapRL框架,通过联合优化正确性、参考覆盖和语言质量,解决图像描述中因评价指标狭窄导致的权衡问题,并通过改进的奖励解耦归一化和长度条件奖励遮蔽提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG 71%

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

专题命中 图文多模态 :multimodal(title)

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 67%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07273 2026-05-11 cs.CV cs.AI 62%

From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG

从云层到幻觉:遥感视觉-语言RAG中的大气检索劫持

Jiaju Han, Chao Li, Chengyin Hu, Qike Zhang, Xuemeng Sun, Xin Wang, Fengyu Zhang, Xiang Chen, Yiwei Wei, Jiahuan Long, Jiujiang Guo

机构 * China University of Petroleum, Beijing at Karamay(中国石油大学(北京)克拉玛依校区)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出CloudWeb攻击,通过修改输入图像实现遥感多模态RAG中的大气证据劫持,展示了大气变化对检索阶段的影响,并揭示了自然外观的天气变化可能破坏证据检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 57%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05340 2026-05-11 cs.CR cs.AI 57%

How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

VLMs在物理世界中离隐私意识还有多远?一项实证研究

Junran Wang, Xinjie Shen, Zehao Jin, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 图文多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文通过实证研究揭示VLMs在物理环境中隐私意识的不足,提出ImmersedPrivacy框架评估模型在复杂场景中的隐私感知能力,发现现有模型在感知和隐私冲突处理上存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏