arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-31 至 2026-03-31 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 15 篇

2509.21309 2026-03-31 cs.CV 88%

NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics

NewtonGen: 通过神经牛顿动力学实现物理一致且可控的文本到视频生成

Yu Yuan, Xijun Wang, Tharindu Wickremasinghe, Zeeshan Nadir, Bole Ma, Stanley H. Chan

机构 * Purdue University(普渡大学) Samsung Research America(三星美国研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NewtonGen框架,结合数据驱动合成与可学习物理原理,通过可训练的神经牛顿动力学模型实现物理一致的视频生成,并提供精确的参数控制。

Comments Accepted by ICLR 2026. Camera-ready version. Project Page: https://yuyuanspace.com/NewtonGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 83%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 83%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 83%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV 83%

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27520 2026-03-31 cs.CV 83%

TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

TokenDial: 通过时空token偏移实现文本到视频的连续属性控制

Zhixuan Liu, Peter Schaldenbrand, Yijun Li, Long Mai, Aniruddha Mahapatra, Cusuh Ham, Jean Oh, Jui-Hsien Wang

机构 * Adobe Research(Adobe研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 TokenDial通过在中间时空视觉patch-token空间中添加偏移实现文本到视频生成模型的连续属性控制,通过调整偏移量实现外观和运动动态的可预测编辑,优于现有基线。

Comments Project page: https://tokendial.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 79%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09104 2026-03-31 cs.CV 79%

Training-free Motion Factorization for Compositional Video Generation

无需训练的运动因子分解用于组合视频生成

Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的运动因子分解框架,将复杂运动分解为静止、刚体和非刚体运动三类,通过规划先于生成的范式,提升视频生成中运动多样性的表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV 79%

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27469 2026-03-31 cs.LG cs.AI 78%

KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study

KV缓存量化用于自驱动视频生成:一项33种方法的实证研究

Suraj Ranganath, Vaishak Menon, Anish Patnaik

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文通过33种量化和缓存策略变体,研究自驱动视频生成中KV缓存压缩的影响,发现FlowCache启发的INT4软剪枝方法在压缩率和内存使用上表现优异,但高保真方法存在运行时或内存成本问题,需结合实际需求选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 57%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12057 2026-03-31 cs.CV cs.AI 57%

Coarse-Guided Visual Generation via Weighted h-Transform Sampling

通过加权h变换采样实现粗引导的视觉生成

Yanghao Wang, Ziqi Jiang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV 57%

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07455 2026-03-31 cs.CV cs.AI cs.CL cs.GR 57%

Image Generation Models: A Technical History

图像生成模型:技术史

Rouzbeh Shirvani

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏