arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2512.23953 2026-08-05 cs.CV 版本更新 86%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI 86%

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title);分类 cs.CV

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20470 2026-04-23 cs.CV 86%

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

动态Rad:面向长视频扩散的内容自适应稀疏注意力

Yongji Long, Shijun Liang, Jintao Li, Yun Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shenzhen Institute for Advanced Study, UESTC(深圳先进研究院) Computational Mathematics, Science, & Engineering at Michigan State University (MSU)(密歇根州立大学计算数学、科学与工程)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title);分类 cs.CV

AI总结 本文提出DynamicRad,通过引入双模式策略和语义运动路由器,实现长视频扩散中的高效稀疏注意力机制,提升推理速度并保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 86%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12691 2026-02-27 cs.GR cs.CV cs.LG 86%

Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration

自适应混合缓存用于高效文本到视频扩散模型加速

Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);video generation(abstract);分类 cs.CV

AI总结 本文提出MixCache,一种基于缓存的训练自由框架,通过自适应混合缓存策略提升视频DiT模型的生成效率和质量。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17550 2025-09-30 cs.CV 86%

T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models

Xiaoyu Ye, Songjie Cheng, Yongtao Wang, Yajiao Xiong, Yishen Li

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15314 2025-08-28 cs.CV cs.AI cs.CR 86%

VideoEraser: Concept Erasure in Text-to-Video Diffusion Models

Naen Xu, Jinghuai Zhang, Changjiang Li, Zhi Chen, Chunyi Zhou, Qingming Li, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

Comments To appear in the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17550 2025-04-10 cs.LG cs.MM cs.SD eess.AS 86%

A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title);分类 cs.MM

Comments IJCNN 2025. The source code is available: https://github.com/SonyResearch/SVG_baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19881 2025-03-26 cs.CV 86%

Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation

Tianhao Qi, Jianlong Yuan, Wanquan Feng, Shancheng Fang, Jiawei Liu, SiYu Zhou, Qian He, Hongtao Xie, Yongdong Zhang

专题命中 视频扩散模型 :video generation(title,abstract);long video(title);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13234 2025-02-20 cs.CV cs.AI cs.LG 86%

MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching

Yen-Siang Wu, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

Comments Project page: https://www.csie.ntu.edu.tw/~b09902097/motionmatcher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13405 2026-03-17 cs.CV eess.IV 86%

Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion

锚点强制:用于交互式流视频扩散的锚点记忆与三区域RoPE

Yang Yang, Tianyi Zhang, Wei Huang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo BlueImage Lab(vivo蓝影实验室) University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 本文提出锚点强制框架,通过锚点引导重置缓存和三区域RoPE解决交互式流视频生成中的质量退化和运动动态减弱问题,提升感知质量和运动指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18375 2025-08-06 cs.CV eess.IV 86%

Individual Content and Motion Dynamics Preserved Pruning for Video Diffusion Models

Yiming Wu, Zhenghao Chen, Huan Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) University of Newcastle(新castle大学) Westlake University(西湖大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15156 2024-12-20 cs.CV cs.CL cs.MM 86%

Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM

Yatai Ji, Jiacheng Zhang, Jie Wu, Shilong Zhang, Shoufa Chen, Chongjian GE, Peize Sun, Weifeng Chen, Wenqi Shao, Xuefeng Xiao, Weilin Huang, Ping Luo

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17005 2024-03-26 cs.CV cs.MM 86%

TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models

Zhongwei Zhang, Fuchen Long, Yingwei Pan, Zhaofan Qiu, Ting Yao, Yang Cao, Tao Mei

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments CVPR 2024; Project page: https://trip-i2v.github.io/TRIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12490 2023-12-21 cs.CV cs.AI cs.LG cs.MM 86%

InstructVideo: Instructing Video Diffusion Models with Human Feedback

Hangjie Yuan, Shiwei Zhang, Xiang Wang, Yujie Wei, Tao Feng, Yining Pan, Yingya Zhang, Ziwei Liu, Samuel Albanie, Dong Ni

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Project page: https://instructvideo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17985 2025-09-23 cs.GR 86%

VideoFrom3D: 3D Scene Video Generation via Complementary Image and Video Diffusion Models

Geonung Kim, Janghyeok Han, Sunghyun Cho

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(title)

Comments Project page: https://kimgeonung.github.io/VideoFrom3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03335 2026-08-05 cs.CV 新提交 85%

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎

Shanghao Liu, Renze Chen, Size Zheng, Yuanqiang Liu, Yun, Liang, Hailong Yang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对视频扩散Transformer推理开销过高的问题,提出无训练的SPADE稀疏注意力引擎,通过三部分设计实现注意力2.26x-3.40x、端到端推理1.49x-1.80x的加速且保持生成质量。

Comments Published in the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures, 3 tables

Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), 2026, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03012 2026-07-07 cs.CV cs.AI cs.LG 新提交 85%

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion

HyperVAttention:用于视频扩散的具有时空聚类的高效稀疏注意力

Dongyeun Lee, Amir Zandieh, Vahab Mirrokni, Junmo Kim, Insu Han

机构 * KAIST(韩国科学技术院) Google Research(谷歌研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对视频扩散中自注意力机制的二次复杂度问题,提出HyperVAttention框架,通过3D局部窗口聚类等方法解决聚类开销大及CTA利用率低的瓶颈,提升视频扩散中无训练稀疏注意力的质量和速度。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17257 2026-06-17 cs.CV cs.AI 新提交 85%

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

Pulling The REINS: 通过表示引导实现视频扩散模型的无训练安全对齐

Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

机构 * University of California, Riverside(加州大学河滨分校) YouTube (Google)(YouTube(谷歌))

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出REINS方法,在推理时通过线性方向引导视频扩散模型的内部表示,实现无训练的安全对齐,避免有害内容生成,且不降低通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16116 2026-05-27 cs.CV 85%

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0: 通过向量化时间步长适应解锁预训练视频扩散模型中的时间控制

Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究) Great Bay University(大湾大学) AI Technology Center, Tencent PCG(腾讯AI技术中心) Lingnan University(岭南大学) Hong Kong Centre for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出向量化时间步长适应(VTA)方法,在统一视频扩散框架中实现细粒度时间控制,零样本完成图像到视频生成、起止帧控制等任务,且不破坏基础模型能力。

Comments Code is open-sourced at https://github.com/Yaofang-Liu/Pusa-VidGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16579 2026-05-22 cs.CV cs.LG 85%

Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion

局部关注,线性记忆:线性注意力作为跨帧记忆用于自回归视频扩散

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出了一种名为ARL2的混合注意力模块,通过将二次跨帧注意力替换为固定大小的递归状态,解决了自回归视频扩散模型在长视频生成中的可扩展性瓶颈问题,实现了线性时间复杂度和常数内存消耗,同时提升了时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14136 2026-05-15 cs.CV 85%

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17825 2026-03-19 cs.CV 85%

Steering Video Diffusion Transformers with Massive Activations

通过大规模激活引导视频扩散变换器

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li

机构 * MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频扩散变换器中大规模激活的作用,提出STAS方法通过引导首帧和边界token的激活值提升视频生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08131 2026-03-10 cs.CV 85%

Real-Time Motion-Controllable Autoregressive Video Diffusion

实时可控的自回归视频扩散

Kesen Zhao, Jiaxin Shi, Beier Zhu, Junbao Zhou, Xiaolong Shen, Yuan Zhou, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Xmax.AI Ltd(Xmax.AI有限公司) Zhejiang University(浙江大学) Singapore Management University(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17247 2026-02-12 cs.CL cs.CV 85%

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15159 2026-01-01 cs.CV 85%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 85%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00996 2025-12-15 cs.CV 85%

Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models

具有时间推理的上下文微调用于视频扩散模型的多功能控制

Kinam Kim, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究中心)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。

Comments project page: https://kinam0252.github.io/TIC-FT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10825 2025-11-18 cs.CV 85%

OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Yuchi Huo, Rui Wang, Chi Zhang, Xuelong Li

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);video understanding(abstract);分类 cs.CV

Comments Accepted by AAAI 2026. Our project page: https://tele-ai.github.io/OmniVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12099 2025-11-18 cs.CV 85%

Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models

Tianle Cheng, Zeyan Zhang, Kaifeng Gao, Jun Xiao

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏