arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-22 至 2026-05-22 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2605.17837 2026-05-22 cs.CV cs.AI 83%

Temporal Aware Pruning for Efficient Diffusion-based Video Generation

具有时间意识的剪枝用于高效扩散式视频生成

Sheng Li, Yang Sui, Junhao Ran, Bo Yuan, Yue Dai, Xulong Tang

机构 * University of Pittsburgh(匹兹堡大学) Illinois Institute of Technology(伊利诺伊理工学院) Rutgers University(罗格斯大学) Rice University(Rice大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TAPE,一种无需训练的时间感知剪枝方法,用于高效扩散式视频生成,通过时间平滑、层内token重选和时间步预算调度,提升生成效率并保持高质量视觉效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22818 2026-05-22 cs.CV 79%

MotiMotion: Motion-Controlled Video Generation with Visual Reasoning

MotiMotion: 基于视觉推理的运动控制视频生成

Lee Hsin-Ying, Hanwen Jiang, Yiqun Mei, Jing Shi, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔茨分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MotiMotion框架,通过将运动控制转化为推理生成问题,改进视频生成中因果关系和常识一致性,引入免训练视觉语言推理器和置信度感知控制方案,通过MotiBench基准测试验证其生成视频的合理性与交互性。

Comments ICML 2026. Project page: https://motimotion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08403 2026-05-22 cs.CV 79%

SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents

SPIRAL:通过反思规划代理实现自演化动作条件视频生成

Yu Yang, Yue Liao, Jianbiao Mei, Baisen Wang, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee

机构 * Zhejiang University(浙江大学) KnowledgeXLab at Shanghai AI Lab(上海人工智能实验室知识X实验室) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Tencent Youtu Lab(腾讯优设实验室) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SPIRAL框架,通过反思规划代理实现长时域动作条件视频生成,解决传统方法在长时间视频生成中的不足,通过闭环设计和自演化机制提升视频生成的一致性和准确性。

Comments 42 Pages, 21 Figures, Project page at https://yuyang-cloud.github.io/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05094 2026-05-22 cs.CV 79%

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

VChain:用于视频生成中推理的视觉思维链

Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu

机构 * eyeline-labs(Eyeline Labs)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出VChain,一种在视频生成中引入多模态模型视觉推理信号的新型推理时间视觉思维链框架,通过生成关键帧来指导预训练视频生成器的稀疏推理时间视觉状态适应,从而提升视频生成质量。

Comments ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15003 2026-05-22 cs.CV 79%

Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation

流之真相:面向图像到视频生成的主动时间鉴伪

Yuzhuo Chen, Zehua Ma, Han Fang, Hengyi Wang, Guanjie Wang, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security (School of Cyber Science and Technology, University of Science and Technology of China)(安徽省数字安全重点实验室(网络安全学院,中国科学技术大学))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向图像到视频生成的主动时间鉴伪方法,通过追踪像素在视频中的流动和变换,解决了传统空间鉴伪在时间维度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22563 2026-05-22 cs.CV 74%

Cell Phantom Video Generation in Elliptical Fourier Descriptor Domain

椭圆傅里叶描述符域中的细胞假体视频生成

Francesco Benedetto, Roberto Basla, Luca Magri, Giacomo Boracchi

机构 * Department of Electronics Information and Bioengineering(电子信息与生物工程系)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本研究提出了一种在椭圆傅里叶描述符(EFD)域中生成细胞假体视频的新框架,通过将细胞假体演变表示为多变量时间序列的EFD系数,引入了强先验知识,从而高效生成在时间上一致的视频,验证了在EFD空间建模时间演变能够生成生物合理性的假体视频,为合成标注数据生成提供了方法,减少了标注努力。

Comments 6 pages, Accepted at the International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22144 2026-05-22 cs.CV 57%

One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems

一句话,一出戏剧:通过多智能体系统实现个性化短剧生成

Yufei Shi, Weilong Yan, Naixuan Huang, Yucheng Chen, Chenyu Zhang, Tao He, Si Yong Yeo, Ming Li

机构 * MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室,李光前医学院,南洋理工大学) National University of Singapore(新加坡国立大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种多智能体框架,通过结构化中间模块和迭代优化,将用户的单句想法转化为完整短剧,解决了短剧生成中的叙事节奏、空间一致性及生产质量控制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏