arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-06-30 至 2026-06-30 共收录 3
2606.28386 2026-06-30 cs.CV cs.AI

Data Provenance for Image Auto-Regressive Generation

图像自回归生成的数据溯源

Bihe Zhao, Louis Kerner, Michel Meintz, Tameem Bakr, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

AI总结 提出后验框架,利用自回归生成模型输出中的特征模式进行图像溯源,无需修改生成过程或输出,适用于无水印场景。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏