arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-24 至 2026-07-24 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2607.21027 2026-07-24 cs.CV 新提交 88%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);video diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交 85%

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21553 2026-07-24 cs.CV 新提交 83%

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21580 2026-07-24 cs.CV cs.AI 新提交 79%

GraphVid: Interactive Graph-Controllable Video Generation

GraphVid:交互式图可控视频生成

Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu, Adheesh Juvekar, Muntasir Waheed, Ismini Lourentzou

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究如何实现可控视频生成,提出基于图条件的GraphVid模型及相关数据集,通过结构化交互图实现灵活精确控制,相比其他方法在减少训练数据和参数的情况下,提升了视频生成的可控性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 79%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12304 2026-07-24 cs.SD cs.AI cs.MM eess.AS 版本更新 79%

OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu

机构 * The University of Hong Kong(香港大学) Shanda AI Research Tokyo(Shanda AI东京研究所) XIntelligence Technology Co., Limited(XIntelligence技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。

Comments code: https://github.com/OmniCustom-project/OmniCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09168 2026-07-24 cs.CV 版本更新 57%

ELT: Elastic Looped Transformers for Visual Generation

ELT:弹性循环变换器用于视觉生成

Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul, Aditya Kusupati

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ELT通过共享权重的循环变换块实现高效视觉生成,采用Intra-Loop Self Distillation提升训练效率,实现动态平衡计算成本与生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏