arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-17 至 2026-07-17 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2607.14935 2026-07-17 cs.CV 新提交 83%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14968 2026-07-17 cs.CV 新提交 57%

Stitch-Inferencer: Enhance Endoscopic Video Segmentation and Tracking via Panoramic Reconstruction

Stitch-Inferencer:通过全景重建增强内窥镜视频分割和跟踪

Shunsuke Kikuchi, Atsushi Kouno, Hiroki Matsuzaki

机构 * Jmees Inc(Jmees公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对内窥镜视频理解中视野受限和遮挡问题,提出Stitch-Inferencer框架,用全景画布取代隐式特征记忆,跨帧拼接观察以扩大视野,让现有模型利用长程上下文,实验证明其能在保持实时性的同时提升分割和跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏