arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2604.16377 2026-04-27 cs.CL cs.CY 83%

GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution

GoCoMA:超几何多模态表示融合用于大语言模型生成代码归因

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Bhavinkumar Vinodbhai Kuwar, Arun Balaji Buduru

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 GoCoMA通过超几何空间融合代码风格和二进制特征,提升大语言模型生成代码的归因准确性,在两个基准测试中优于单一模态和欧几里得多模态基线。

Comments Accepted to the International Conference on Multimedia & Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03248 2026-04-27 cs.LG cs.AI cs.CV physics.med-ph 81%

Multimodal Neural Operators for Real-Time Biomechanical Modelling of Traumatic Brain Injury

多模态神经算子用于创伤性脑损伤的实时生物力学建模

Anusha Agarwal, Dibakar Roy Sarkar, Somdatta Goswami

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态神经算子架构用于创伤性脑损伤的生物力学建模,通过融合体积解剖影像、人口特征和采集参数,预测全字段脑位移,验证了DeepONet在准确性、速度和参数量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28717 2026-04-27 eess.AS 79%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 eess.AS

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22177 2026-04-27 cs.CV 77%

Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities

单编码器遇见多编码器:在缺失模态下的脑肿瘤分割中的表示学习前融合

Peibo Song, Xiaotian Xue, Jinshuo Zhang, Zihao Wang, Jinhua Liu, Shujun Fu, Fangxun Bao, Si Yong Yeo

机构 * School of Mathematics, Shandong University(山东大学数学学院) GSFS, The University of Tokyo(东京大学GSFS) MedVisAI Lab(医学视觉人工智能实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UniME方法,通过两阶段异构架构在缺失模态下实现脑肿瘤分割,通过单编码器和多编码器的结合提升分割精度。

Comments CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV 57%

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21750 2026-04-27 cs.LG 50%

From Words to Amino Acids: Does the Curse of Depth Persist?

从词到氨基酸:深度诅咒是否依然存在?

Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡研究所人工智能部门) KTH Royal Institute of Technology(皇家理工学院) Institute of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) Google, Paradigms of Intelligence Team(谷歌,智能范式团队)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究蛋白质语言模型中深度效率问题,通过分析七种主流PLM家族,发现任务相关计算集中在部分层,其余层主要提供预测细化,这一趋势在序列和多模态模型中均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏