arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16806 2026-04-15 cs.CV 74%

MedGS: Gaussian Splatting for Multi-Modal 3D Medical Imaging

MedGS:用于多模态3D医学影像的高斯点散射

Kacper Marzol, Ignacy Kolton, Weronika Smolak-Dyżewska, Joanna Kaleta, Żaneta Świderska-Chadaj, Marcin Mazur, Mirosław Dziekiewicz, Tomasz Markiewicz, Przemysław Spurek

机构 * Jagiellonian University, Poland(雅盖隆大学,波兰) Warsaw University of Technology, Poland(华沙理工大学,波兰) IDEAS Research Institute, Poland(IDEAS研究所,波兰) Military Institute of Medicine, Poland(军事医学研究所,波兰)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出MedGS,一种利用内镜成像独特性质的3D重建框架,通过物理逼真重照明模型提升重建质量,实现更准确的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00181 2026-04-15 cs.CV cs.AI 62%

CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning

CamReasoner:通过结构化空间推理强化相机运动理解

Hang Wu, Yujun Cai, Zehao Li, Haonan Ge, Bowen Sun, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学) Ant Group(蚂蚁集团) University of Chinese Academy of Sciences(中国科学院大学) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CamReasoner通过结构化推理框架提升相机运动理解,采用O-T-A范式和大规模推理轨迹集,首次利用强化学习实现逻辑对齐,提升分类和VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 57%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01186 2026-04-15 cs.CV 57%

ASTRA: Let Arbitrary Subjects Transform in Video Editing

ASTRA: 让任意主体在视频编辑中变换

Fei Shen, Weihao Xu, Rui Yan, Dong Zhang, Xiangbo Shu, Jinhui Tang, Maocheng Zhao

机构 * NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与技术学院及人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ASTRA提出一种无需训练的视频编辑框架,通过多模态对齐模块和先验掩码重定位模块解决密集多主体场景中的注意力稀释和边界纠缠问题,实现精准操控与非目标区域的严格保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12145 2026-04-15 eess.AS cs.SD 57%

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词

Xiangyu Zhang, Benjamin John Southwell, Siqi Pan, Xinlei Niu, Beena Ahmed, Julien Epps

机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏