arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-09 至 2026-03-09 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2603.06408 2026-03-09 cs.CV cs.AI cs.GR 83%

Physical Simulator In-the-Loop Video Generation

物理模拟器闭环视频生成

Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Singapore University of Technology and Design(新加坡科技设计大学) A*STAR(新加坡科技研究局) Google(谷歌) Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence(斯图加特视觉计算、交互与人工智能研究中心)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 PSIVG通过整合物理模拟器与扩散模型,生成符合物理规律的视频,提升生成视频的真实性和一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 71%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13669 2026-03-09 cs.CV cs.AI cs.LG 57%

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06048 2026-03-09 cs.CV 57%

GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection

GenHOI:面向对象一致性的手-物体交互方法,采用时间平衡和空间选择性的对象注入

Xuan Huang, Mochu Xiang, Zhelun Shen, Jinbo Wu, Chenming Wu, Chen Zhao, Kaisiyuan Wang, Hang Zhou, Shanshan Liu, Haocheng Feng, Wei He, Jingdong Wang

机构 * Department of Computer Vision Technology(VIS), Baidu Inc.(百度公司计算机视觉技术部) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 GenHOI通过时间平衡和空间选择性的对象注入方法,提升手-物体交互在现实场景中的生成一致性与保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR 57%

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06190 2026-03-09 cs.RO 50%

DreamToNav: Generalizable Navigation for Robots via Generative Video Planning

DreamToNav: 通过生成式视频规划实现通用机器人导航

Valerii Serpiva, Jeffrin Sam, Chidera Simon, Hajira Amjad, Iana Zhura, Artem Lykov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏