arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-05 至 2026-03-05 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2603.03505 2026-03-05 cs.CV cs.AI 86%

PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation

PhyPrompt:基于强化学习的物理合理文本到视频生成的提示优化

Shang Wu, Chenwei Xu, Zhuofan Xia, Weijian Li, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 PhyPrompt通过强化学习优化提示,提升文本到视频生成的物理合理性,优于GPT-4o和DeepSeek-V3,实现更高效的物理常识和语义忠实度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04291 2026-03-05 cs.CV cs.AI 79%

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03646 2026-03-05 cs.CV 74%

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡

Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan, Puneet Mathur, Varun Manjunatha, Daksh Dangi, Chien Nguyen, Nedim Lipka, Trung Bui, Krishna Kumar Singh, Ruiyi Zhang, Xiaolei Huang, Jaemin Cho, Yu Wang, Namyong Park, Zhengzhong Tu, Hongjie Chen, Hoda Eldardiry, Nesreen Ahmed, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

机构 * Adobe Research(Adobe研究院) KAUST(卡塔尔科技大学) University of Oregon(俄勒冈大学) University of Memphis(密苏里大学孟菲斯分校) Johns Hopkins University(约翰霍普金斯大学) Meta AI Texas A&M University(德克萨斯农工大学) Dolby Labs(杜比实验室) Virginia Tech(弗吉尼亚理工大学) Cisco(思科) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18573 2026-03-05 cs.CV cs.AI 74%

Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model

Kaleido:开源多主体参考视频生成模型

Zhenxing Zhang, Jiayan Teng, Zhuoyi Yang, Tiankun Cao, Cheng Wang, Xiaotao Gu, Jie Tang, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Kaleido通过改进的数据构建和参考旋转位置编码,提升了多主体参考视频生成的一致性、保真度和泛化能力。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏