arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-18 至 2026-05-18 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 3 篇

2605.16003 2026-05-18 cs.CV 89%

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

回声驱动:一种用于交互式长视频生成的场景记忆框架

Mingqiang Wu, Weilun Feng, Zhefeng Zhang, Haotong Qin, Yuqi Li, Guoxin Fan, Xiaokun Liu, Zhulin An, Libo Huang, Yongjun Xu, Chuanguang Yang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) China University of Mining & Technology, Beijing(中国矿业大学(北京)) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York(纽约城市学院,纽约城市大学) Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00678 2026-05-18 cs.CV 79%

Pixel-to-4D: Camera-Controlled Image-to-Video Generation with Dynamic 3D Gaussians

像素到4D:通过动态3D高斯进行相机控制的图像到视频生成

Melonie de Almeida, Daniela Ivanova, Tong Shi, John H. Williamson, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种基于动态3D高斯的图像到视频生成框架,通过单次前向传递构建3D场景表示并采样合理物体运动,实现高效且可控的视频生成,实验表明其在多个数据集上均达到SOTA视频质量和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15725 2026-05-18 cs.CV cs.AI cs.RO 57%

DiLA: Disentangled Latent Action World Models

DiLA:解耦的潜在动作世界模型

Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu

机构 * Peking-Tsinghua Center for Life Sciences, Academy for Advanced Interdisciplinary Studies, IDG/McGovern Institute for Brain Research, Peking University(北京大学-清华生命科学中心,先进跨学科研究院,IDG/麦克戈文脑科学研究院,北京大学) Center of Quantitative Biology, Peking University(北京大学定量生物学中心) School of Psychological and Cognitive Sciences, Key Laboratory of Machine Perception (Ministry of Education), Peking University(心理与认知科学学院,机器感知重点实验室(教育部),北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DiLA通过内容-结构解耦解决动作抽象与生成保真度的平衡问题,实现高质量视频生成和动作迁移。

Comments Project Page: http://disentangled-latent-action-world-models.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏