arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2607.06651 2026-07-09 cs.LG 新提交 78%

Entropy-Guided Tensor Compression for Multimodal Federated Learning on Edge Devices

用于边缘设备上多模态联邦学习的熵引导张量压缩

Quoc Bao Phan, Tuy Tan Nguyen

机构 * FAMU-FSU College of Engineering, Florida State University(佛罗里达农工大学-佛罗里达州立大学工程学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对边缘设备上多模态联邦学习中客户端能力差异问题,提出熵引导的MESH-FL框架,通过截断奇异值分解估计频谱熵,自适应分配MPS压缩秩,实验表明该框架能高效压缩并提升准确率,减少传输数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07152 2026-07-09 math.OC physics.soc-ph 新提交 78%

Link-Based Multimodal Traffic Dynamics Model in Continuous-Time Framework

连续时间框架下基于链路的多模式交通动力学模型

Ning Xie, Lei Wei, Nikola Bešinović, Meng Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究提出连续时间框架下基于链路的多模式交通动力学模型M-LTM,通过移动瓶颈理论捕捉多模式交互,开发节点模型描述流量转移等,经案例研究验证其在网络交通分析管理中的预测能力与适用性,误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交 67%

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09140 2026-07-09 cs.LG cs.AI cs.CV 62%

Learning to Explore for Stochastic Gradient MCMC

为随机梯度MCMC学习探索

SeungHyun Kim, Seohyeon Jung, Seonghyeon Kim, Juho Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种元学习策略,使SGMCMC能够高效探索多模态后验分布,提升采样效率并优于传统SGMCMC方法。

Journal ref Proceedings of the 41st International Conference on Machine Learning, Proceedings of Machine Learning Research 235:24015-24039, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 57%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06778 2026-07-09 cs.HC 新提交 50%

Head, Gaze, or Finger? Comparing Object Selection Techniques in Augmented Reality for People with Low Vision

头部、注视还是手指?低视力人群在增强现实中对象选择技术的比较

Ruijia Chen, Tianyi Zhang, Sanbrita Mondal, Yukang Yan, Yuhang Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究低视力人群在增强现实中对象选择技术,通过混合方法研究,让20名低视力者和18名视力正常者用头部、注视、手指指向三种技术在两种场景选目标,发现不同技术优劣势及低视力者偏好,为其可访问AR交互技术提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05526 2026-07-09 astro-ph.SR 新提交 50%

Evolution of Non-Stationary Quasi-Periodic Pulsations in Solar Flares with Aditya-L1/HEL1OS and GOES

利用Aditya-L1/HEL1OS和GOES研究太阳耀斑中非平稳准周期脉动的演化

Srikar Paavan Tadepalli, Abhishekh Kumar Srivastava, K. Sankarasubramanian

专题命中 其他多模态 :multi-modal(abstract)

AI总结 该研究利用相位分辨方法,结合变分模态分解等技术,检测太阳耀斑硬X射线光变曲线中非平稳QPPs,通过交叉检验评估其与热和非热成分关系,还扩展到耀斑目录,确定QPPs特征及漂移情况,揭示非平稳性不同状态。

Comments 18 pages, 7 figures, Accepted for publication in Philosophical Transactions of the Royal Society A

详情

展开后加载摘要…

URL PDF HTML 收藏