arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2603.24109 2026-03-26 eess.IV cs.AI cs.CV 84%

Comparative analysis of dual-form networks for live land monitoring using multi-modal satellite image time series

多模态卫星图像时间序列用于实时土地监测的双形式网络比较分析

Iris Dumeur, Jérémy Anger, Gabriele Facciolo

机构 * 1 Kayrros SAS 2 Universit\'e Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, 91190, Gif-sur-Yvette, France 3 Institut Universitaire de France

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了双形式注意力机制以提升多模态SITS分析效率,通过并行训练支持递归推理,针对时间不规则性和不一致性的挑战,提出基于实际获取日期计算token距离的方法,实验表明双形式机制在性能和效率上优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11380 2026-03-26 cs.CV 83%

DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding

DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解

Mingzhe Tao, Ruiping Liu, Junwei Zheng, Yufan Chen, Kedi Ying, M. Saquib Sarfraz, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。

Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 79%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23650 2026-03-26 cs.CV 79%

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

基础模型嵌入与混合情感:一种多模态融合方法用于BLEMORE挑战

Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

机构 * Department of Computational Linguistics, University of Zürich(苏黎世大学计算语言学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态融合方法,结合六个编码器家族进行后期概率融合,通过选择冻结的Wav2Vec2的语调编码层和Gemini Embedding 2.0,提升了混合情感识别的性能,最终在测试集上获得0.279的分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24024 2026-03-26 eess.SP 78%

Sensing-Assisted Adaptive Beam Probing with Calibrated Multimodal Priors and Uncertainty-Aware Scheduling

基于校准多模态先验和不确定性感知调度的传感辅助自适应波束探测

Abidemi Orimogunje, Vukan Ninkovic, Ognjen Kundacina, Hyunwoo Park, Sunwoo Kim, Dejan Vukobratovic, Evariste Twahirwa, Gaspard Gashema

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种传感辅助自适应探测策略,利用多模态传感数据校准波束先验,通过深度Q-集合预测波束奖励并结合置信度调度,减少训练开销并提高可靠性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 73%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24296 2026-03-26 cs.CV 57%

AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication

AMIF:具有内置认证的可授权医学图像融合模型

Jie Song, Jun Jia, Wei Sun, Wangqiu Zhou, Tao Tan, Guangtao Zhai

机构 * Macao Polytechnic University(澳门理工学院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AMIF,首个具有内置认证的医学图像融合模型,通过授权访问控制保护知识产权,防止推理泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24371 2026-03-26 physics.optics 50%

Shape-Dependent, Deep-Learning-Assisted Metamaterial Solid Immersion Lens (mSIL) Super-Resolution Imaging

形状依赖、深度学习辅助的超材料固体浸没透镜(mSIL)超分辨成像

Baidong Wu, Fiza Khan, Lingya Yu, Zengbo Wang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文比较了三种TiO2超材料固体浸没透镜几何结构,通过SEM分析发现超半球形透镜具有最深的浸没和最接近样品特征的接触,结合深度学习模型实现了SEM形态与光学成像响应的跨模态映射,电磁模拟证实了浸没深度与远场主波束强度的直接相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24265 2026-03-26 cs.LG 50%

DeepDTF: Dual-Branch Transformer Fusion for Multi-Omics Anticancer Drug Response Prediction

DeepDTF: 多组学抗癌症药物反应预测的双分支Transformer融合

Yuhan Zhao, Jacob Tennant, James Yang, Zhishan Guo, Young Whang, Ning Sui

机构 * Department of Computer Science(计算机科学系) North Carolina State University(北卡罗来纳州立大学) UNC School of Medicine(UNC医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 DeepDTF通过双分支Transformer融合框架,联合预测药物IC50对数和敏感性分类,有效整合多组学数据与化学结构信息,提升药物反应预测精度与生物解释性。

Comments 7 Pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏