arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-08 至 2026-07-08 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 93%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05978 2026-07-08 cs.CV cs.AI 新提交 84%

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

提出并关注:通过多令牌局部注意力实现无训练的多模态大语言模型接地置信度

Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez

机构 * Amazon(亚马逊)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型接地置信度问题,提出无训练的多令牌局部注意力(MTLA)方法,通过在声称区域内求和并跨预测令牌聚合恢复更强接地信号,在多模型家族和模态中提升了幻觉AUROC及零样本检测AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05906 2026-07-08 cs.CV 新提交 83%

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

高斯融合:迈向多模态3D高斯预训练

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

机构 * Wuhu HIT Robot Technology Research Institute Co., Ltd.(芜湖哈工大机器人技术研究院有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究提出GaussFusion多模态3D高斯预训练框架,通过跨模态语义对齐集成图像和文本监督,还提出高斯显著性引导的多尺度空洞掩码,实验表明该方法提高了高斯表示可迁移性,在ModelNet40和ScanObjectNN上有性能提升。

Comments 32 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05019 2026-07-08 cs.LG cs.CV 新提交 79%

Beyond Modality Fusion: Deep Ensembles for Multimodal Classification

超越模态融合:用于多模态分类的深度集成

Ilya Burenko, Dmitry Vetrov

机构 * ScaDS.AI, Technische Universität Dresden(ScaDS.AI,德累斯顿工业大学) Constructor University Bremen(不来梅建造者大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态分类,对比深度集成与模态融合网络,证明单模态网络深度集成可有效分类,提出选模型数量方法,还给出合成框架探索优化挑战,估计集成渐近性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 79%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05736 2026-07-08 cs.LG 新提交 78%

Multimodal Molecular Representation Learning with Graph Neural Networks, Deep & Cross Networks, and SMILES Embeddings

基于图神经网络、深度交叉网络和SMILES嵌入的多模态分子表示学习

Qiwei Han, Chi Zhou, Ruobing Wang, Zheng Ma

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对分子性质预测难题,提出三分支模块化融合神经网络,综合三种模态数据,经后期融合架构建立多模态潜在空间,在QM9基准测试中表现出色,降低误差,为高通量虚拟筛选提供高效模型。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28553 2026-07-08 cs.HC cs.CY cs.LG 版本更新 78%

Multimodal Analytics of Cybersecurity Crisis Preparation Exercises: What Predicts Success?

多模态分析网络安全危机准备演习:什么预测成功?

Conrad Borchers, Valdemar Švábenský, Sandesh K. Kafle, Kevin K. Tang, Jan Vykopal

机构 * Carnegie Mellon University(卡内基梅隆大学) Masaryk University, Faculty of Informatics(马萨里克大学信息学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究通过多模态追踪分析网络安全演习中的教学对齐,发现对齐度预测成功,而单纯Bloom分类无效。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026), see https://doi.org/10.1007/978-3-032-29760-0_47

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21664 2026-07-08 cs.CV 版本更新 77%

HumanOmni-Speaker: Identifying Who said What and When

HumanOmni-Speaker: 识别说话者说了什么以及何时

Detao Bai, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里云实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 71%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 多模态训练与对齐 :image-text(title)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21046 2026-07-08 cs.CV cs.AI 版本更新 62%

SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation

SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航

Wen Jiang, Kangyao Huang, Li Wang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hanfang Liang, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua University(清华大学) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Jianghan University(江汉大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03018 2026-07-08 cs.CV cs.SD 新提交 57%

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning

$C^3$ASD:多层次一致性驱动的表示学习

Jin Hong, Jisoo Park, Junseok Kwon

机构 * Chung-Ang University(中央大学)

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 cs.CV

AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24805 2026-07-08 cs.CV 新提交 57%

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo: 用于立体3D道路异常检测的高效双解码器Transformer

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出DDStereo,一种双解码器立体Transformer,通过轻量级解码器分支和紧凑视差特征提取器,实现实时开放集3D目标检测,在封闭和开放集协议下均达到最先进精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏