arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 19 篇

2605.28575 2026-05-28 cs.AI 83%

A Conflict-Aware Penalty and Statistical Loss Framework for Balancing Modalities and Enhancing Stability in Multimodal Sentiment Analysis

一种冲突感知惩罚与统计损失框架,用于平衡模态并增强多模态情感分析的稳定性

Jianheng Dai, Jiazhang Liang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态情感分析中文本模态主导导致梯度冲突的问题,提出冲突感知惩罚和统计损失框架,实现模态平衡与训练稳定,在CMU-MOSI上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27436 2026-05-28 cs.IR cs.AI cs.CV 81%

RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

RE-TRIANGLE:TRIANGLE 在检索中能否实现超越余弦相似度的多模态对齐?

Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra, Jingfen Qiao

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文复现 TRIANGLE 框架,验证其通过最小化超球面上模态三元组面积实现多模态对齐的几何目标在检索任务中的鲁棒性,发现其在零样本设置下优于成对基线,但存在优化不稳定和领域依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03491 2026-05-28 cs.CV cs.CL 81%

Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance

解耦骨架与血肉:基于解缠对齐和结构感知引导的高效多模态表格推理

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Xiaoqiang Zhou, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出DiSCo解缠结构-内容对齐框架和Table-GLS全局到局部结构引导推理框架,高效增强LVLM的表格理解与推理能力,无需昂贵监督或外部工具。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06999 2026-05-28 cs.CV cs.CL cs.LG 81%

Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs

有意学习,直觉行动:解锁多模态大语言模型的测试时推理能力

Yahan Yu, Yuyang Dong, Masafumi Oyamada

机构 * Kyoto University(京都大学) Initial S NEC Corporation, Japan(日本NEC公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出D2I框架,通过训练时使用基于规则的格式奖励进行有意推理以增强模态对齐,推理时移除显式策略转为直觉推理,从而提升多模态大语言模型的推理能力,无需额外标注或复杂奖励。

Comments 22 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28459 2026-05-28 cs.CV 79%

REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection

REVEAL:基于参考依据的多模态篡改检测推理

Jun Zhou, Bingwen Hu, Yaxiong Wang, Zhedong Zheng, Yongzhen Wang, Yuchen Zhang, Ping Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出REVEAL框架,通过参考依据验证和差异感知融合机制,结合任务解耦的混合专家架构,实现多模态篡改检测与定位,并支持无训练域适应。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27906 2026-05-28 cs.AI 79%

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

推理至关重要:通过推理条件偏好优化减轻多模态大型推理模型中的幻觉

Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出推理条件直接偏好优化(RC-DPO)方法,通过将思维链作为答案生成的条件并对比不同思维链下的偏好,结合蒙特卡洛树搜索和注意力引导的思维链剪枝生成偏好数据,有效减轻多模态大型推理模型中的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27431 2026-05-28 cs.LG cs.AI 79%

Tackling Multimodal Learning Challenges with Mixture-of-Expert: A Survey

应对多模态学习挑战的混合专家方法:综述

Liangwei Nathan Zheng, Wei Emma Zhang, Olaf Maennel, Lin Yue, Weitong Chen

机构 * Adelaide University(阿德莱德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了混合专家(MoE)如何通过高效扩展、表示学习和自适应适配解决多模态学习中的可扩展性、异质性和数据不完美等核心挑战。

Comments This survey paper has just been accepted by IJCAI 2026. Results were released by 30 April 2026. As I could not find a particular place to drop the acceptance email. I have upload the acceptance email alongside the LaTeX files of the paper, named as Acceptance_email.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-05-28 cs.LG cs.AI 79%

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28422 2026-05-28 cs.CV cs.AI 79%

VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

VITAL: 视觉-语义双重监督增强可解释的医学多模态大语言模型潜在推理

Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai, Jianwei Yin, Yankai Jiang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出VITAL框架,通过视觉-语义双重监督(文本解码器重构推理链、视觉投影器回归ROI特征)实现医学MLLM的可解释潜在推理,在7个基准上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 78%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27583 2026-05-28 cs.LG 78%

Information-theoretic Multimodal Representation Learning for Electrocardiogram Signals

基于信息论的心电图信号多模态表示学习

Phu X. Nguyen, Konstantinos Kontras, Wei Dai, Huy Phan, Christos Chatzichristos, Paul Pu Liang, Bert Vandenberk, Maarten De Vos

机构 * KU Leuven(库勒芬大学) University Hospitals Leuven(鲁文大学医院) MIT(麻省理工学院) DFKI(德国达姆施塔特研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20480 2026-05-28 cs.RO 78%

Degradation-Aware Cooperative Multi-Modal GNSS-Denied Localization Leveraging LiDAR-Based Robot Detections

基于激光雷达机器人检测的退化感知协同多模态GNSS拒止定位

Václav Pritzl, Xianjia Yu, Tomi Westerlund, Petr Štěpán, Martin Saska

机构 * Multi-robot Systems Group, Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电气工程学院控制学系多机器人系统组) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku(图尔库大学智能嵌入式与机器人系统实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出一种因子图框架下的自适应多模态多机器人协同定位方法,融合异步VIO、LIO和3D机器人间检测,通过插值因子和Wasserstein距离加权处理传感器退化,显著提升定位精度。

Comments Preprint version. This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28231 2026-05-28 cs.RO cs.LG 67%

ProgVLA: Progress-Aware Robot Manipulation Skill Learning

ProgVLA:进度感知的机器人操作技能学习

Seungsu Kim, Jinyoung Choi, Seungmin Baek, Jean-Michel Renders

机构 * NAVER LABS(NAVER实验室) NAVER LABS Europe(NAVER实验室欧洲)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03549 2026-05-28 cs.CV cs.CL 62%

FEA-SLT: A Gloss-Free End-to-End Framework for Facial-Expression-Aware Sign Language Translation

FEA-SLT:一种面向面部表情感知的手语翻译的无词汇端到端框架

Guobin Tu, Di Weng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出FEA-SLT框架,通过面部表情感知融合模块利用面部动态作为语义锚点,解决无词汇手语翻译中手势歧义问题,在PHOENIX14T和CSL-Daily数据集上达到最优BLEU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28820 2026-05-28 cs.CV 57%

From Pixels to Words -- Towards Native One-Vision Models at Scale

从像素到文字——迈向原生单视觉大规模模型

Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu, Zhongang Cai, Weichen Fan, Linjun Dai, Silei Wu, Xuanyu Zheng, Mingxuan Li, Yuanhan Zhang, Bo Li, Hanming Deng, Huchuan Lu, Quan Wang, Lei Yang, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, NTU(S实验室,国立科技大学) SenseTime Research(商汤科技研究院) DLUT(大连理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出NEO-ov原生基础模型,通过端到端学习跨帧和像素-文字对应,无需外部编码器或适配器,在细粒度视觉感知上缩小了与模块化模型的差距,验证了原生单视觉架构的可行性和竞争力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28520 2026-05-28 cs.AI 57%

GS-FUSE: Granger-Supervised Gated Fusion and Multi-Granularity Alignment for Event-Driven Financial Forecasting

GS-FUSE: 格兰杰监督的门控融合与多粒度对齐用于事件驱动的金融预测

Yang Zhang, En Chun, Ziyun Mao, Yulu Wu, Jun Wang

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出GS-Fuse框架,通过格兰杰因果监督的门控融合模块和多粒度对齐机制,选择性利用事件文本与价格信号,提升金融事件对市场影响的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28271 2026-05-28 cs.CV 57%

LV-OSD: Language-Vision-Complementary Open-Set Object Detection

LV-OSD: 语言-视觉互补的开放集目标检测

Yupeng Zhang, Ruize Han, Wei Feng, Song Wang, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(计算机科学与人工智能学院,深圳先进技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出语言-视觉互补开放集目标检测问题,设计双分支检测框架LVDor,通过目标引导提示动态加权模块和提示随机掩码机制实现文本与图像提示的灵活组合与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21668 2026-05-28 cs.CV 57%

Encoder-Free Human Motion Understanding via Structured Motion Descriptions

通过结构化运动描述实现无编码器的人体运动理解

Yao Zhang, Zhuchenyang Liu, Thomas Ploetz, Yu Xiao

机构 * Aalto University(阿alto大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出结构化运动描述(SMD),将关节位置序列转换为结构化自然语言描述,使大语言模型无需专用编码器即可直接进行运动推理,在运动问答和字幕生成任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27927 2026-05-28 cs.CV cs.LG 57%

Structure-Guided Visual Perturbation Neutralization for LVLMs

结构引导的视觉扰动中和用于大型视觉语言模型

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) JIUTIAN Research(JIUTIAN研究所) Nanyang Technological University(南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出结构诱导引导中和(SIGN)框架,通过先验结构提取和动态引导中和实现轻量级、即插即用的对抗性防御,在仅0.5%像素修改和0.16秒每图下达到87%以上防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏