arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-10 至 2026-04-10 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2604.07966 2026-04-10 cs.CV 83%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07402 2026-04-10 cs.LG eess.IV 83%

Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity

通过局部优化与表征连续性加速自回归视频生成模型训练

Yucheng Zhou, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 eess.IV

AI总结 本文提出局部优化与表征连续性方法,通过减少误差传播和提升生成视频一致性,使自回归视频生成模型训练效率提升一倍而不牺牲质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 79%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07721 2026-04-10 cs.MA 50%

Sima 1.0: A Collaborative Multi-Agent Framework for Documentary Video Production

Sima 1.0:一种用于纪录片视频制作的协作多智能体框架

Zhao Song

专题命中 视频生成 :video generation(abstract)

AI总结 Sima 1.0通过多智能体系统优化纪录片视频制作流程,将任务分解为11个步骤,利用人类操作基础创作和录制,AI代理处理编辑、字幕优化等任务,减少生产负担,提升制作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07517 2026-04-10 cs.RO 50%

Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations

抓取如梦:从生成的人类示范中模仿功能抓取

Chao Tang, Jiacheng Xu, Haofei Lu, Bolin Zou, Wenlong Dong, Hong Zhang, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习系) Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology(南方科技大学深圳市机器人视觉与感知重点实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出GraspDreamer方法,利用视觉生成模型合成的人类示范实现零样本功能抓取,通过隐含的通用先验知识和动作优化,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏