arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-15 至 2026-05-15 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 12 篇

2510.20206 2026-05-15 cs.CV 88%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14988 2026-05-15 cs.CV 83%

Compositional Video Generation via Inference-Time Guidance

通过推理时间引导进行组合视频生成

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Gal Chechik, Lior Wolf

机构 * Tel-Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学) NVIDIA Research(NVIDIA研究)

专题命中 视频生成 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01725 2026-05-15 cs.CV cs.AI 83%

Motion-Aware Caching for Efficient Autoregressive Video Generation

面向运动的缓存机制用于高效的自回归视频生成

Jing Xu, Yuexiao Ma, Xuzhe Zheng, Xing Wang, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Songwei Liu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MotionCache,通过利用帧间差异作为轻量级像素运动特征代理,优化自回归视频生成中的缓存重用策略,实现6.28倍和1.64倍的速度提升,同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15199 2026-05-15 cs.CV cs.AI 79%

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

EntityBench:迈向实体一致的长程多次视频生成

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez

机构 * ByteDance(字节跳动) ByteDance Seed(字节跳动种子) Rice University(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 EntityBench通过140集(2491个镜头)的真实叙事媒体,构建了包含实体调度的评估基准,结合三支柱评估体系和fidelity gate,评估实体一致性。EntityMem作为基线方法,通过存储验证的实体视觉参考提升生成质量。

Comments Project page: https://catherine-r-he.github.io/EntityBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15182 2026-05-15 cs.CV 79%

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15116 2026-05-15 cs.CV 79%

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

DriveCtrl: 基于条件的仿真到现实驾驶视频生成

Haonan Zhao, Yiting Wang, Jingkun Chen, Valentina Donzella, Thomas Bashford-Rogers, Kurt Debattista

机构 * University of Warwick(沃里克大学) Northwestern Polytechnical University(西北工业大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14843 2026-05-15 cs.CV 79%

MechVerse: Evaluating Physical Motion Consistency in Video Generation Models

MechVerse:评估视频生成模型中物理运动一致性

Rahul Jain, Mayank Patel, Asim Unmesh, Karthik Ramani

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MechVerse通过机械一致的图像到视频生成基准,评估视频生成模型在物理运动一致性上的不足,发现现有模型在复杂耦合中表现不佳。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14487 2026-05-15 cs.CV cs.AI 79%

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

强制头部:通过头部异质性实现长自回归视频生成

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang

机构 * AGI Lab, Westlake University University of California at Merced StepFun

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Head Forcing框架,通过差异化分配KV缓存策略提升长视频生成质量,实现分钟级生成并支持多提示交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14269 2026-05-15 cs.CV cs.AI 79%

PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

PhyMotion: 结构化3D运动奖励用于物理基础的人体视频生成

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(UNC夏洛特希尔大学) FieldAI NTU Singapore(新加坡国立大学) AI2 Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PhyMotion,一种结构化的3D运动奖励机制,通过物理模拟器评估人体运动的物理可行性,提升视频生成中人体动作的真实感。

Comments First two authors contributed equally, website: https://phy-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14815 2026-05-15 cs.CV 70%

Probing into Camera Control of Video Models

探究视频模型的摄像机控制

Chen Hou, Christian Rupprecht

机构 * Visual Geometry Group University of Oxford(视觉几何组牛津大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过几何引导而非隐式映射实现摄像机控制,有效提升视频生成模型的几何表现力,并揭示了基础模型的摄像机控制偏见与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15196 2026-05-15 cs.CV cs.LG 57%

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

RefDecoder:通过条件视频解码增强视觉生成

Xiang Fan, Yuheng Wang, Bohan Fang, Zhongzheng Ren, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出RefDecoder,通过引入高保真参考图像信号提升视频生成质量,改进解码器结构以保持结构完整性,在多个基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI 57%

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏