arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 9 篇

2602.23956 2026-03-24 cs.CV 85%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 79%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11438 2026-03-24 cs.CV cs.AI 79%

Flowception: Temporally Expansive Flow Matching for Video Generation

Flowception:用于视频生成的时序扩展流匹配

Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen

机构 * FAIR at Meta Univ.\ Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Flowception提出了一种非自回归且可变长度的视频生成框架,通过交替插入离散帧与连续去噪帧学习概率路径,减少误差积累并提升长序列处理效率,实验显示其在FVD和VBench指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV 74%

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22091 2026-03-24 cs.CV 70%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 57%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15700 2026-03-24 cs.CV 57%

First Frame Is the Place to Go for Video Content Customization

视频内容定制中的首帧至关重要

Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) USC(南加州大学) MIT(麻省理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文揭示视频生成模型将首帧视为概念记忆缓冲区,通过少量训练示例实现鲁棒且通用的视频内容定制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV 57%

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19402 2026-03-24 cs.RO cs.CV cs.GR 57%

Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

Real2Edit2Real:通过3D控制界面生成机器人演示

Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北大AgiBot实验室) AgiBot

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Real2Edit2Real框架,通过3D可编辑性与2D视觉数据结合,减少重复数据收集,提升空间泛化能力,实验表明其数据效率提升显著。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏