arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-12 至 2026-08-12 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 86%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 86%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 多模态训练与对齐 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07917 2026-08-12 cs.AI 版本更新 83%

TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents

TongGuOCR:面向中文历史文献的布局感知与 token 增强 OCR 框架

Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对中文历史文献OCR的复杂布局、生僻字等挑战,提出TongGuOCR框架,通过布局感知预处理与token增强识别模块,在M5HisDoc等基准上取得优于同类模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15779 2026-08-12 cs.CV 版本更新 83%

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

通过交叉注意力和门控融合进行多模态矛盾与犹豫识别

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

机构 * University of Paris 8(巴黎第八大学) LIASD Laboratory(LIASD实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10316 2026-08-12 cs.CV cs.LG cs.MM 新提交 81%

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

UniMod:通过跨模态与模态内对齐增强多模态医学诊断

Zijian Gu, Weikai Lin, Shuang Zhou, Zihan Chen, Song Wang

机构 * University of Central Florida(中佛罗里达大学) University of Rochester(罗切斯特大学) Harvard Medical School(哈佛医学院) University of Virginia(弗吉尼亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 UniMod框架通过要求各模态独立预测诊断缓解多模态医学诊断的捷径学习,添加跨模态与模态内对齐,在两个数据集上优于基线方法,还可扩展至多标签5分类诊断。

Comments Accepted to ACM Multimedia 2026 (MM '26). 10 pages, 7 figures, 5 tables. Code: https://github.com/futurespyhi/UniMod

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 81%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09986 2026-08-12 cs.AI cs.LG 新提交 79%

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

MIDAS:面向不完整多模态情感分析的基于不确定性感知融合的互信息解缠方法

Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析中模态不完整的问题,提出MIDAS框架,通过互信息解缠与不确定性感知融合实现鲁棒的多模态表示,在多个数据集上取得优于基线的性能。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15821 2026-08-12 cs.CL cs.AI cs.LG 版本更新 79%

The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

真相留在家族中:通过模型谱系中继承的真相头增强上下文基础

Miso Choi, Seonga Choi, Mincheol Kwon, Woosung Joung, Jinkyu Kim, Jungbeom Lee

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基础LLM与下游变体间存在上下文真相分数的强继承性,提出TruthProbe软门控策略放大真相头以提升上下文真实性并减少多模态幻觉。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 78%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16108 2026-08-12 eess.SP 版本更新 78%

Advancing Industry 4.0: Multimodal Sensor Fusion for AI-Based Fault Detection in 3D Printing

推进工业4.0:面向基于3D打印的AI故障检测的多模态传感器融合

Muhammad Fasih Waheed, Shonda Bernadin, Ali Hassan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究提出了一种低成本、便携的多模态传感器融合AI系统,用于实时监测FDM 3D打印过程中的故障,提升制造可靠性和可持续性。

Comments International Journal of Engineering Research and Innovation | v17, n2, Fall/Winter 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10489 2026-08-12 cs.CV 新提交 74%

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

当视觉变为文本:视觉语言模型(VLM)中基于跨模态残差引导的视觉令牌剪枝

Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 该研究针对视觉语言模型(VLM)海量视觉令牌导致推理成本高的问题,提出基于跨模态残差(CMR)的无训练压缩方法SIEVE,在LLaVA-NeXT-7B上仅保留11.1%视觉令牌,实现显著加速与缓存缩减且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28969 2026-08-12 cs.CV 版本更新 70%

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin, Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10600 2026-08-12 cs.RO cs.CV cs.LG 新提交 57%

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

BooST:桥接语义与运动以实现高效的技能迁移

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

机构 * Seoul National University(首尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 BooST是桥接语义与运动的两阶段框架,通过跨模态VQ-VAE生成统一技能表示并蒸馏为轻量级策略,在仿真与真实机器人场景下实现了更优的少样本适配、跨领域技能迁移及鲁棒性。

Comments Project page: https://boost-robots.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 57%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10350 2026-08-12 cond-mat.str-el cond-mat.mtrl-sci 新提交 50%

Observation geometry for uncertainty-aware Hamiltonian inference and experimental design in quantum magnets

量子磁体中不确定性感知哈密顿量推断与实验设计的观测几何

Roy Liu, Venugopal Ranganathan, David Dahlbom, Shizhou Xu, Tianyu Zhang, Yuan Ni, Daniel M. Pajerowski, Garrett Granroth, Thomas Strohmer, Matthew B. Stone, Andrew F. May, Mark D. Lumsden, Joshua J. Turner, Yongqiang Cheng, Zhantao Chen

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究提出AI赋能的不确定性感知哈密顿量推断与自适应实验设计框架,结合哈密顿量条件神经代理等方法,通过NiPS₃的中子散射测量验证,为量子材料表征与实验设计提供通用策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10959 2026-08-12 cs.LG 版本更新 50%

Population-Aware Physics-Informed Neural Particle Flow for Robust Spacecraft Bayesian Navigation

群体感知的物理信息神经粒子流用于贝叶斯更新

Batu Candan, Simone Servadio

机构 * Iowa State University(爱荷华州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23035 2026-08-12 cs.LG 版本更新 50%

Learning Disease-Sensitive Latent Interaction Graphs From Noisy Cardiac Flow Measurements

从噪声心脏血流测量中学习疾病敏感的潜在交互图

Viraj Patel, Marko Grujic, Philipp Aigner, Theodor Abart, Marcus Granegger, Deblina Bhattacharjee, Katharine Fraser

机构 * Department of Computer Science, University of Bath(巴斯大学计算机科学系) Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) Christian Doppler Laboratory for Mechanical Circulatory Support, Department of Cardiac and Thoracic Aortic Surgery, Medical University of Vienna(维也纳医学大学心脏和胸主动脉外科系基督教多普勒实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出了一种物理指导的潜在关系框架,用于从噪声心脏血流测量中学习疾病敏感的潜在交互图,以捕捉心脏疾病和干预的稳健标志。

详情

展开后加载摘要…

URL PDF HTML 收藏