arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-20 至 2026-04-20 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2604.15911 2026-04-20 cs.CV 79%

Efficient Video Diffusion Models: Advancements and Challenges

高效视频扩散模型:进展与挑战

Shitong Shao, Lichen Bai, Pengfei Wan, James Kwok, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文综述了高效视频扩散模型的进展与挑战,分析了四种主要范式,探讨了减少函数调用次数和降低每步开销的核心目标,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19840 2026-04-20 cs.CV 77%

GenHSI: Controllable Generation of Human-Scene Interaction Videos

GenHSI: 可控生成人类-场景交互视频

Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 GenHSI提出一种无需训练的可控生成长人类-场景交互视频方法,通过剧本写作、预可视化和动画三阶段生成3D-aware视频,保留人物身份并提供合理交互。

详情

展开后加载摘要…

URL PDF HTML 收藏