arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-21 至 2026-04-21 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 11 篇

2411.15115 2026-04-21 cs.CV cs.AI cs.CL 86%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02617 2026-04-21 cs.LG cs.AI cs.CV 86%

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

通过AI反馈提升文本到视频生成中动态物体交互

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang

机构 * Google DeepMind(谷歌DeepMind) The University of Tokyo(东京大学) Stanford University(斯坦福大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。

Comments Website: https://sites.google.com/view/aif-dynamic-t2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05489 2026-04-21 cs.AI cs.MA 86%

SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation

SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成

Chengyi Yang, Pengzhen Li, Jiayin Qi, Aimin Zhou, Ji Wu, Ji Liu

机构 * HiThink Research(HiThink研究院) East China Normal University(华东师范大学) Guangzhou University(广州大学) Tsinghua University(清华大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title)

AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 83%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09721 2026-04-21 cs.CV 83%

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

FrameDiT:基于矩阵注意力的扩散变换器用于高效视频生成

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能倡议,澳大利亚) FPT Smart Cloud, Vietnam(越南FPT智能云) Deakin University, Australia(德肯大学,澳大利亚)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Matrix Attention,通过将帧视为矩阵来处理视频生成中的时空动态,结合FrameDiT-G和FrameDiT-H模型,在保持效率的同时提升了视频质量和时间一致性。

Comments Code: https://github.com/minhkhoale/FrameDiT Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18348 2026-04-21 cs.CV cs.AI 79%

AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

AdaCluster:用于视频生成中稀疏注意力的自适应查询-键聚类

Haoyue Tan, Shengnan Wang, Yulin Qiao, Juncheng Zhang, Youhui Bai, Ping Gong, Zewen Jin, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Independent Researcher(独立研究员) University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散变换器的高推理延迟问题,提出AdaCluster框架,通过自适应聚类方法提升生成速度并保持精度。

Comments CVPR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19979 2026-04-21 cs.CV 79%

CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion

CamPVG:基于视图控制的全景视频生成与视图感知扩散

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, Cairong Zhao

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV 57%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17820 2026-04-21 cs.SE 50%

Raven: Rethinking Automated Assessment for Scratch Programs via Video-Grounded Evaluation

Raven: 通过视频基础评估重新思考Scratch程序的自动化评估

Donglin Li, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频生成 :video generation(abstract)

AI总结 Raven通过视频生成规则替代传统断言,实现Scratch程序的自动化评估,提升评估的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏