arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-17 至 2026-07-17 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 2 篇

2607.14935 2026-07-17 cs.CV 新提交 79%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16209 2026-07-17 cs.CV cs.LG 57%

VideoGAN-based Trajectory Proposal for Automated Vehicles

基于VideoGAN的自动车辆轨迹提案

Annajoyce Mariani, Kira Maag, Hanno Gottschalk

机构 * Technical University of Berlin(柏林技术大学) Heinrich-Heine-University(海因里希-海涅大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于VideoGAN的自动车辆轨迹生成方法,利用BEV视频训练生成对抗网络,以提高轨迹生成的准确性和现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏