arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2606.25542 2026-07-09 cs.CV 新提交 83%

SAC$^2$-Net: Semantic Anchoring and Complementary-Consensus Fusion for Multimodal Micro-Expression Recognition

SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合

Xuepeng Zheng, Tong Chen, Chaoping Gui, Yingjuan Jia, Hanpu Wang, Yuhao Shan

机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新 81%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07016 2026-07-09 cs.LG cs.AI 新提交 79%

Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

用于蜂窝流量预测的具有峰值增强的多模态时空频率融合

Qingzhong Li, Yue Hu, Hui Ma, Yajun Zhang, Xinjun Pei, Ming Yan, Fei Xing

机构 * Xinjiang University(新疆大学) College of Geography and Remote Sensing Sciences, Xinjiang University(新疆大学地理与遥感科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对蜂窝网络流量预测难题,提出MSPF-Net框架,它集成外部上下文信息,含时空频率流量编码器、峰值增强模块等,能联合建模流量动态、突发模式和新闻上下文信号,实验证明可有效提升预测性能。

Comments Accepted in the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06943 2026-07-09 cs.CV 新提交 79%

General Incomplete Multimodal Learning via Dynamic Quality Perception

通过动态质量感知进行通用不完全多模态学习

Xiangyu Meng, Shicai Wei

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态学习中模态间缺失和模态内退化共存问题,提出通用不完全多模态学习框架GIML,通过动态质量感知处理上述问题,引入噪声感知质量估计器和噪声语义解耦模块,经实验验证其有效性和通用性。

Comments Accepted by ECCV 2026. Corresponding author: Shicai Wei

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08336 2026-07-09 cs.CV 新提交 79%

Synesthesia via Direct Latent Augmentation:Bypassing the Decode-Encode Loop for Cross-Modal Distillation

超越原始信号:作为特权合成数据的未解码生成潜变量

Cristian Sbrolli, Nicolas Michel, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出直接潜变量增强(DLA)方法,利用未解码的生成潜变量作为特权信息,并通过多层显式模拟联觉(MESSy)将密集知识迁移到纯视觉学生模型,避免了解码-编码循环的低效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 73%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2607.06651 2026-07-09 cs.LG 新提交 78%

Entropy-Guided Tensor Compression for Multimodal Federated Learning on Edge Devices

用于边缘设备上多模态联邦学习的熵引导张量压缩

Quoc Bao Phan, Tuy Tan Nguyen

机构 * FAMU-FSU College of Engineering, Florida State University(佛罗里达农工大学-佛罗里达州立大学工程学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对边缘设备上多模态联邦学习中客户端能力差异问题,提出熵引导的MESH-FL框架,通过截断奇异值分解估计频谱熵,自适应分配MPS压缩秩,实验表明该框架能高效压缩并提升准确率,减少传输数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07152 2026-07-09 math.OC physics.soc-ph 新提交 78%

Link-Based Multimodal Traffic Dynamics Model in Continuous-Time Framework

连续时间框架下基于链路的多模式交通动力学模型

Ning Xie, Lei Wei, Nikola Bešinović, Meng Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究提出连续时间框架下基于链路的多模式交通动力学模型M-LTM,通过移动瓶颈理论捕捉多模式交互,开发节点模型描述流量转移等,经案例研究验证其在网络交通分析管理中的预测能力与适用性,误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交 67%

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09140 2026-07-09 cs.LG cs.AI cs.CV 62%

Learning to Explore for Stochastic Gradient MCMC

为随机梯度MCMC学习探索

SeungHyun Kim, Seohyeon Jung, Seonghyeon Kim, Juho Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种元学习策略,使SGMCMC能够高效探索多模态后验分布,提升采样效率并优于传统SGMCMC方法。

Journal ref Proceedings of the 41st International Conference on Machine Learning, Proceedings of Machine Learning Research 235:24015-24039, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 57%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06778 2026-07-09 cs.HC 新提交 50%

Head, Gaze, or Finger? Comparing Object Selection Techniques in Augmented Reality for People with Low Vision

头部、注视还是手指?低视力人群在增强现实中对象选择技术的比较

Ruijia Chen, Tianyi Zhang, Sanbrita Mondal, Yukang Yan, Yuhang Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究低视力人群在增强现实中对象选择技术,通过混合方法研究,让20名低视力者和18名视力正常者用头部、注视、手指指向三种技术在两种场景选目标,发现不同技术优劣势及低视力者偏好,为其可访问AR交互技术提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05526 2026-07-09 astro-ph.SR 新提交 50%

Evolution of Non-Stationary Quasi-Periodic Pulsations in Solar Flares with Aditya-L1/HEL1OS and GOES

利用Aditya-L1/HEL1OS和GOES研究太阳耀斑中非平稳准周期脉动的演化

Srikar Paavan Tadepalli, Abhishekh Kumar Srivastava, K. Sankarasubramanian

专题命中 其他多模态 :multi-modal(abstract)

AI总结 该研究利用相位分辨方法,结合变分模态分解等技术,检测太阳耀斑硬X射线光变曲线中非平稳QPPs,通过交叉检验评估其与热和非热成分关系,还扩展到耀斑目录,确定QPPs特征及漂移情况,揭示非平稳性不同状态。

Comments 18 pages, 7 figures, Accepted for publication in Philosophical Transactions of the Royal Society A

详情

展开后加载摘要…

URL PDF HTML 收藏