arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-20 至 2026-04-20 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2603.11698 2026-04-20 cs.CV cs.AI cs.CL 88%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11804 2026-04-20 cs.CV 79%

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow:统一多模态条件以生成人-物体交互视频

Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang, Yichen Liu, Xin Gao, Cunjian Chen, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。

Comments Project page: https://correr-zhou.github.io/OmniShow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23421 2026-04-20 cs.CV 79%

DriveLaW:Unifying Planning and Video Generation in a Latent Driving World

DriveLaW:在潜在驾驶世界中统一规划与视频生成

Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DriveLaW通过统一视频生成与运动规划,提升自动驾驶中的预测与规划性能,实现视频生成与轨迹规划的一致性,取得新的state-of-the-art结果。

Comments 18 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17909 2026-04-20 cs.CV 57%

A Single Image and Multimodality Is All You Need for Novel View Synthesis

单张图像与多模态信息足矣实现新视角合成

Amirhosein Javadi, Chi-Shiang Gau, Konstantinos D. Polyzos, Tara Javidi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出利用稀疏多模态测距数据提升单图像新视角合成的几何一致性和视觉质量,通过多模态深度重建框架替代传统单目深度估计,增强扩散模型的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏