arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-23 至 2026-03-23 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2603.19613 2026-03-23 cs.CV 79%

OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis

OrbitNVS: 利用视频扩散先验进行新视角合成

Jinglin Liang, Zijian Zhou, Rui Huang, Shuangping Huang, Yichen Gong

机构 * South China University of Technology(华南理工大学) King's College London(伦敦大学国王学院) Agentic Labs, XGTech(Agentic实验室,XGTech) Pazhou Laboratory(Pazhou实验室)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 OrbitNVS将新视角合成重新定义为轨道视频生成任务,通过定制模型设计和训练策略,利用预训练视频生成模型的丰富视觉先验,提升几何和外观一致性,实验表明在GSO和OmniObject3D基准上表现优异。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19672 2026-03-23 cs.CV 70%

Making Video Models Adhere to User Intent with Minor Adjustments

通过小幅调整使视频模型符合用户意图

Daniel Ajisafe, Eric Hedlin, Helge Rhodin, Kwang Moo Yi

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过调整用户提供的边界框以提高视频生成质量和对控制输入的符合度,提出平滑掩码和注意力最大化目标,通过实验验证方法有效性。

Comments Project page and code: https://ubc-vision.github.io/MinorAdjustVideo/docs/webpage/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏