arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-01 至 2026-05-01 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2604.25186 2026-05-01 cs.CV cs.CE cs.MM 62%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2602.00607 2026-05-01 cs.MM cs.SD 79%

MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation

MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准

Yang-Hao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, Yi-Ming Cheng, Xuefeng Chen, Xian-Ling Mao, Yousheng Feng

机构 * Beijing Institute of Technology(北京理工大学) Shanghai University(上海大学) OpenNLP Lab(OpenNLP实验室) Beijing University of Technology(北京工业大学) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Inkeverse Group Limited(Inkeverse集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27711 2026-05-01 cs.RO 78%

ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control

ExoActor:作为可泛化的交互人形控制的外向视频生成

Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出ExoActor框架,利用大规模视频生成模型的泛化能力,通过第三人称视频生成统一接口建模交互动态,将任务指令和场景上下文转化为可执行的人形行为序列,展示了其在新场景中的泛化能力。

Comments Work in progress. Project page: https://baai-agents.github.io/ExoActor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 70%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27621 2026-05-01 cs.RO cs.CV 57%

Robot Learning from Human Videos: A Survey

从人类视频学习机器人:综述

Junyi Ma, Erhang Zhang, Haoran Yang, Ditao Li, Chenyang Xu, Guangming Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了通过人类视频学习机器人技能的方法,探讨了政策学习基础、人类视频接口、技能转移层次分类及数据基础,分析了挑战与未来研究方向。

Comments Paper list: https://github.com/IRMVLab/awesome-robot-learning-from-human-videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26571 2026-05-01 cs.CV cs.AI 57%

GVCC: Zero-Shot Video Compression via Codebook-Driven Stochastic Rectified Flow

GVCC:基于代码本驱动的随机修正流零样本视频压缩

Ziyue Zeng, Xun Su, Haoyuan Liu, Bingyu Lu, Yui Tatsumi, Hiroshi Watanabe

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 GVCC通过预训练视频生成模型直接作为解码器,在极低比特率下实现高质量视频重建,通过编码生成轨迹的随机创新信息,提升压缩效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2604.27322 2026-05-01 cs.CV 57%

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE: 你只选择本质的标记以实现高效的DiT基于视频对象移除

Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Huawei Noah’s Ark Lab(华为诺亚实验室) NKIARI, Shenzhen Futian(深圳南山研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 YOSE通过引入BVI和DiffSim模块,实现了高效的DiT视频对象移除,通过动态选择关键标记和模拟扩散过程,使推理时间与遮挡区域线性相关,从而在70%的情况下达到2.5倍的加速,同时保持视觉质量。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27871 2026-05-01 cs.GR 50%

D-Rex : Diffusion Rendering for Relightable Expressive Avatars

D-Rex:基于扩散的可重新照明表达性人体虚拟角色

Timo Teufel, Xilong Zhou, Umar Iqbal, Jan Kautz, Marc Habermann, Vladislav Golyanik, Christian Theobalt

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 D-Rex提出一种人特定框架,实现真实感、可重新照明、表达性和可动画化的全身体虚拟角色,通过图像空间后处理实现与虚拟角色建模的解耦,优于基于物理的可重新照明虚拟角色基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-05-01 cs.LG cs.AI 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2601.06394 2026-05-01 cs.CV cs.AI 57%

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2604.28078 2026-05-01 cs.CV 57%

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他视频模型 1 篇

2604.27083 2026-05-01 cs.LG 50%

Co-Evolving Policy Distillation

共进化策略蒸馏

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院)

专题命中 其他视频模型 :video reasoning(abstract)

AI总结 本文提出CoPD,通过并行训练专家并引入OPD,在专家RLVR训练过程中实现双向知识传递,提升多模态推理能力,优于现有方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏