arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2512.14044 2026-05-01 cs.CV cs.AI 84%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27712 2026-05-01 cs.CV cs.CL 84%

Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention

具有语言信息的多模态融合用于越南语场景文本图像描述:数据集、图框架和语音注意力

Nhi Ngoc-Yen Nguyen, Anh-Duc Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering(信息科学与工程学院) University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HSTFG和PhonoSTFG框架,通过图拓扑分析发现跨模态边对场景文本融合有害,并构建首个大规模越南语场景文本描述数据集ViTextCaps,揭示52.8%词汇存在声调符号冲突风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27393 2026-05-01 cs.CL 83%

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

MiniCPM-o 4.5:迈向实时全双工多模态交互

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao

机构 * OpenBMB(开放大脑)

专题命中 图文多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 MiniCPM-o 4.5通过实时全双工多模态交互技术,解决多模态交互中感知与响应分离及被动响应的问题,实现更接近人类水平的多模态交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27674 2026-05-01 cs.CL cs.AI cs.CR cs.IR 81%

One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

一个单一的枢纽文本破坏CLIP:通过枢纽性揭示跨模态编码器的漏洞

Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai

机构 * NTT, Inc.(NTT公司) Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出方法识别枢纽嵌入及其对应文本,揭示跨模态编码器的漏洞,实验显示单一枢纽文本在图像描述评估中表现优异,暴露了编码器的缺陷。

Comments Accepted at ACL2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI 74%

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 57%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏