arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-02 至 2026-07-02 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2607.00858 2026-07-02 cs.CV cs.LG 新提交 79%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00375 2026-07-02 cs.CV 新提交 57%

LIST3R: Long-sequence Instance-aware 3D Reconstruction

LIST3R: 长序列实例感知三维重建

Jing Gao, Wei Wang, Feiran Wang, Yan Yan

机构 * Beijing Jiaotong University(北京交通大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出LIST3R框架,通过实例锚点组织长序列三维重建,将子序列局部观测整合为全局一致场景,在长序列基准上实现更优轨迹与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏