arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-13 至 2026-04-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2604.08579 2026-04-13 cs.LG cs.AI 88%

On the Spectral Geometry of Cross-Modal Representations: A Functional Map Diagnostic for Multimodal Alignment

关于跨模态表示的谱几何:一种用于多模态对齐的功能图诊断

Krisanu Sarkar

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文研究了基于功能图框架的跨模态对齐,发现尽管功能图在不同监督预算下表现不如Procrustes对齐,但揭示了多模态表示的结构特性,提出了三种诊断量以表征跨模态表示兼容性。

Comments Under review at ACMMM Brave New Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 79%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08971 2026-04-13 cs.LG 78%

Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference

感知-aware零样本剪枝与稀疏注意力用于高效多模态边缘推断

Yueyuan Sui, Payal Mohapatra, Doğaç Eldenk, Haodong Yang, Yiting Zhang, Haoyan Zhang, Qi Zhu, Stephen Xia

机构 * Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SentryFuse框架,通过模态感知的剪枝和稀疏注意力机制,在无需微调的情况下提升多模态边缘推断的效率与准确性,实现12.7%的平均精度提升和28.2%的内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09280 2026-04-13 eess.IV cs.CV 57%

AMO-ENE: Attention-based Multi-Omics Fusion Model for Outcome Prediction in Extra Nodal Extension and HPV-associated Oropharyngeal Cancer

AMO-ENE:基于注意力的多组学融合模型用于外周淋巴结扩展和人乳头瘤病毒相关口咽癌的预后预测

Gautier Hénique, William Le, Gabriel Dayan, Coralie Brodeur, Kristoff Nelson, Apostolos Christopoulos, Edith Filion, Phuc-Felix Nguyen-Tan, Laurent Letourneau-Guillon, Houda Bahig, Samuel Kadoury

机构 * Centre de recherche du CHUM (CRCHUM)(蒙特利尔大学医疗中心研究中心 (CRCHUM)) Centre Hospitalier de l’Université de Montréal (CHUM)(蒙特利尔大学医疗中心 (CHUM))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AMO-ENE模型,通过CT影像和临床数据自动检测外周淋巴结扩展并预测治疗预后,结合多模态特征提升预后预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08644 2026-04-13 cs.CL 57%

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08910 2026-04-13 cs.HC 50%

Lightweight and Generalizable Multi-Sensor Human Activity Recognition via Cascaded Fusion and Style-Augmented Decomposition

轻量且通用的多传感器人类活动识别:通过级联融合与风格增强分解

Wang Chenglong, Zhuo Yan, Ding Wenbo, Chen Xinlei

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种轻量且通用的多传感器人类活动识别框架,通过级联融合与风格增强分解提升效率与鲁棒性,实验表明在Realdisp和Skoda数据集上优于现有方法,计算开销降低超30%。

Comments 8 pages. arXiv admin note: text overlap with arXiv:2501.10917 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏