arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2607.07438 2026-07-09 cs.CV 新提交 83%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25542 2026-07-09 cs.CV 新提交 83%

SAC$^2$-Net: Semantic Anchoring and Complementary-Consensus Fusion for Multimodal Micro-Expression Recognition

SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合

Xuepeng Zheng, Tong Chen, Chaoping Gui, Yingjuan Jia, Hanpu Wang, Yuhao Shan

机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新 81%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07016 2026-07-09 cs.LG cs.AI 新提交 79%

Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

用于蜂窝流量预测的具有峰值增强的多模态时空频率融合

Qingzhong Li, Yue Hu, Hui Ma, Yajun Zhang, Xinjun Pei, Ming Yan, Fei Xing

机构 * Xinjiang University(新疆大学) College of Geography and Remote Sensing Sciences, Xinjiang University(新疆大学地理与遥感科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对蜂窝网络流量预测难题,提出MSPF-Net框架,它集成外部上下文信息,含时空频率流量编码器、峰值增强模块等,能联合建模流量动态、突发模式和新闻上下文信号,实验证明可有效提升预测性能。

Comments Accepted in the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06943 2026-07-09 cs.CV 新提交 79%

General Incomplete Multimodal Learning via Dynamic Quality Perception

通过动态质量感知进行通用不完全多模态学习

Xiangyu Meng, Shicai Wei

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态学习中模态间缺失和模态内退化共存问题,提出通用不完全多模态学习框架GIML,通过动态质量感知处理上述问题,引入噪声感知质量估计器和噪声语义解耦模块,经实验验证其有效性和通用性。

Comments Accepted by ECCV 2026. Corresponding author: Shicai Wei

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08336 2026-07-09 cs.CV 新提交 79%

Synesthesia via Direct Latent Augmentation:Bypassing the Decode-Encode Loop for Cross-Modal Distillation

超越原始信号:作为特权合成数据的未解码生成潜变量

Cristian Sbrolli, Nicolas Michel, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出直接潜变量增强(DLA)方法,利用未解码的生成潜变量作为特权信息,并通过多层显式模拟联觉(MESSy)将密集知识迁移到纯视觉学生模型,避免了解码-编码循环的低效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 73%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏