arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-03 至 2026-04-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2411.16804 2026-04-03 cs.CV 83%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 79%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 79%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏