arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-16 至 2026-07-16 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2606.30248 2026-07-16 cs.CV cs.LG 版本更新 86%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13164 2026-07-16 cs.CL cs.CV cs.LG 新提交 83%

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

文本到手语:用于文本到手语视频生成的单 GPU 扩散基线

Ruize Xia

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究文本到手语视频生成,提出Text2Sign模型,结合冻结视觉语言文本编码器等技术,降低全视频注意力成本。在特定分割上有一定验证损失等结果,虽提示敏感性弱,但为单GPU研究提供了基线。

Journal ref IEEE Access, vol. 14, pp. 64003-64017, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13471 2026-07-16 cs.CV cs.MM cs.SD eess.AS eess.IV 新提交 82%

Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation

将音乐带入视野:音乐驱动的360°视频生成

Kai Hsu Tsai, Yong Wei Fu, Hung I Yang, Yu-Chih Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 【一句话总结】该研究针对音乐可视化问题,提出情感感知的音乐驱动360°视频生成流程,先预估歌曲情感轨迹,再转化为视觉引导,经SEGA框架生成关键帧,最后合成视频,能反映歌曲情感与结构。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13527 2026-07-16 cs.CV 新提交 79%

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

VGIF分数:视频生成中时空指令跟随的可解释性和诊断性评估

Songyu Xu, Xin Wang, Qiang Chen, Xinran Wang, Muxi Diao, Yuxuan Zhang, Kongming Liang, Rui Lin, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecommunications Group Co., Ltd.(中国电信集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究视频生成模型遵循长指令能力评估不足问题,提出VGIF-Score框架,含客观完成和主观满意度分支,能生成统一分数,在VGIF-Bench基准实验中对视频生成指令跟随提供可靠、可解释及有诊断作用的评估。

Comments Accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 79%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 70%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交 70%

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏