arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-01 至 2026-05-01 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2602.00607 2026-05-01 cs.MM cs.SD 79%

MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation

MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准

Yang-Hao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, Yi-Ming Cheng, Xuefeng Chen, Xian-Ling Mao, Yousheng Feng

机构 * Beijing Institute of Technology(北京理工大学) Shanghai University(上海大学) OpenNLP Lab(OpenNLP实验室) Beijing University of Technology(北京工业大学) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Inkeverse Group Limited(Inkeverse集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27711 2026-05-01 cs.RO 78%

ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control

ExoActor:作为可泛化的交互人形控制的外向视频生成

Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出ExoActor框架,利用大规模视频生成模型的泛化能力,通过第三人称视频生成统一接口建模交互动态,将任务指令和场景上下文转化为可执行的人形行为序列,展示了其在新场景中的泛化能力。

Comments Work in progress. Project page: https://baai-agents.github.io/ExoActor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 70%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27621 2026-05-01 cs.RO cs.CV 57%

Robot Learning from Human Videos: A Survey

从人类视频学习机器人:综述

Junyi Ma, Erhang Zhang, Haoran Yang, Ditao Li, Chenyang Xu, Guangming Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了通过人类视频学习机器人技能的方法,探讨了政策学习基础、人类视频接口、技能转移层次分类及数据基础,分析了挑战与未来研究方向。

Comments Paper list: https://github.com/IRMVLab/awesome-robot-learning-from-human-videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26571 2026-05-01 cs.CV cs.AI 57%

GVCC: Zero-Shot Video Compression via Codebook-Driven Stochastic Rectified Flow

GVCC:基于代码本驱动的随机修正流零样本视频压缩

Ziyue Zeng, Xun Su, Haoyuan Liu, Bingyu Lu, Yui Tatsumi, Hiroshi Watanabe

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 GVCC通过预训练视频生成模型直接作为解码器,在极低比特率下实现高质量视频重建,通过编码生成轨迹的随机创新信息,提升压缩效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏