arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-18 至 2026-08-18 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18911 2026-08-18 cs.LG cs.AI cs.CV 版本更新 57%

Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching

重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer

Chang Zou, Shikang Zheng, Evelyn Zhang, Runlin Guo, Haohang Xu, Zhengyi Shi, Conghui He, Xuming Hu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Beihang University(北航) Huawei Technologies Ltd(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07546 2026-08-18 cs.CV 版本更新 57%

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

PickStyle:基于上下文-风格适配器的视频到视频风格迁移

Soroush Mehraban, Vida Adeli, Jacob Rommann, Kyryl Truskovskyi, Harrison Sanborn, Babak Taati, Cole Clifford

机构 * Pickford AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏