arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-01 至 2026-04-01 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 57%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 57%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏