arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2601.19423 2026-05-01 cs.IR 78%

UniRec: Unified Multimodal Encoding for LLM-Based Recommendations

UniRec:基于LLM的推荐系统的统一多模态编码

Zijie Lei, Tao Feng, Zhigang Hua, Yan Xie, Guanyu Lin, Shuang Yang, Ge Liu, Jiaxuan You

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 UniRec通过统一多模态编码解决推荐系统中多模态信息的理解挑战,提出三元组表示和分层Q-Former结构,实现在多个基准测试中提升15%的性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07451 2026-05-01 cs.CV 74%

A Survey on Dynamic Neural Networks: from Computer Vision to Multi-modal Sensor Fusion

动态神经网络综述:从计算机视觉到多模态传感器融合

Fabio Montello, Ronja Güldenring, Simone Scardapane, Lazaros Nalpantidis

机构 * DTU Electrical and Photonics Engineering, Technical University of Denmark(丹麦技术大学电气与光子工程系) DIET Department, Sapienza University of Rome(罗马萨皮恩扎大学DIET系)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 本文综述了动态神经网络在计算机视觉中的应用,探讨了其在多模态传感器融合中的优势,提出了一种基于网络组件适应性的分类方法,并提供了相关研究的资源库。

Comments Under review at Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27559 2026-05-01 cs.CV cs.AI 73%

RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation

RIHA:报告-图像层次对齐用于放射学报告生成

Yucheng Chen, Yang Yu, Yufei Shi, Conghao Xiong, Xulei Yang, Si Yong Yeo

机构 * Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) MedVisAI Lab(医学影像人工智能实验室) Centre of AI in Medicine, Singapore(新加坡人工智能医学中心) Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学(深圳)) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RIHA框架,通过多级对齐提升放射学报告生成的准确性,引入视觉和文本特征金字塔及跨模态对齐模块,实验表明其在自然语言生成和临床效果上优于现有方法。

Comments Accepted by Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 62%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27105 2026-05-01 cs.CV 57%

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

通过双流Transformer实现双摄像头设置中互视与联合注意的自动检测

Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

机构 * AGH University(AGH大学) Jagiellonian University(雅盖隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出双流Transformer架构,用于从同步双摄像头记录中自动检测互视与联合注意,通过冻结的注视感知骨干网络和自定义令牌融合机制,有效提升了多摄像头实验室环境下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏