arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-09 至 2026-04-09 共收录 63 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2604.06662 2026-04-09 cs.CV cs.LG 70%

Towards Robust Content Watermarking Against Removal and Forgery Attacks

面向对抗性移除与伪造攻击的鲁棒内容水印技术

Yifan Zhu, Yihan Wang, Xiao-Shan Gao

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) University of Waterloo(滑铁卢大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。

Comments 14 pages, 5 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06285 2026-04-09 cs.CR cs.AI cs.CV 57%

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

利用双曲几何进行有害提示检测与净化

Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi, Antonio Emanuele Cinà, Fabio Roli

机构 * University of Genoa(热那亚大学) Sapienza University of Rome(罗马大学) University of Cagliari(卡利亚里大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。

Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2509.01986 2026-04-09 cs.CV cs.AI 83%

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑

Ziyun Zeng, David Junhao Zhang, Wei Li, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) TikTok

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。

Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07101 2026-04-09 cs.CV cs.AI cs.MM eess.IV 79%

SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation

SurFITR:用于监控图像伪造检测与定位的数据集

Qizhou Wang, Guansong Pang, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 SurFITR数据集旨在解决监控场景中伪造检测与定位的挑战,通过多模态LLM生成大量高质量伪造图像,提升检测模型在不同场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11703 2026-04-09 cs.LG 50%

EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering

EvoFlows:基于进化编辑的蛋白质工程流匹配

Nicolas Deutschmann, Constance Ferragu, Jonathan D. Ziegler, Shayan Aziznejad, Eli Bixby

机构 * Cradle Zürich, CH(Cradle 苏黎世,瑞士)

专题命中 图像编辑 :diffusion(abstract)

AI总结 EvoFlows通过编辑流学习蛋白质序列间的突变轨迹,实现可控的插入、删除和替换操作,生成与自然蛋白家族一致的变异体,优于现有方法。

Comments Accepted at Workshop on Foundation Models for Science: Real-World Impact and Science-First Design, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 48 篇

2511.19365 2026-04-09 cs.CV cs.AI 88%

DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

DeCo:频率解耦的像素扩散用于端到端图像生成

Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, Qi Tian

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nanjing University(南京大学) Huawei Inc.(华为公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 DeCo通过解耦高频与低频成分生成,提升像素扩散效率,实现更高效的端到端图像生成,实验表明其在ImageNet上取得优于其他模型的性能。

Comments Accepted to CVPR2026. Project Page: https://zehong-ma.github.io/DeCo. Code Repository: https://github.com/Zehong-Ma/DeCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06966 2026-04-09 cs.CV 86%

MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation

MAR-GRPO:用于AR-扩散混合图像生成的稳定GRPO

Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出稳定RL框架用于MAR,通过多轨迹期望减少梯度噪声,结合不确定性估计和一致性aware的token选择策略,提升图像生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06916 2026-04-09 cs.LG cs.AI cs.CV 83%

FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling

FP4探索,BF16训练:通过高效的回放缩放实现扩散强化学习

Yitong Li, Junsong Chen, Shuchen Xue, Pengcuo Zeren, Siyuan Fu, Dinghao Yang, Yangyang Tang, Junjie Bai, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达) HKU(香港大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Sol-RL框架,通过FP4量化与BF16训练结合,提升扩散模型的对齐性能,实现训练效率与精度的平衡,实验显示在多个指标上表现优异,训练收敛速度提升4.64倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06568 2026-04-09 eess.IV cs.CV 83%

A Noise Constrained Diffusion (NC-Diffusion) Framework for High Fidelity Image Compression

一种面向高保真图像压缩的噪声约束扩散(NC-Diffusion)框架

Zhenyu Du, Yanbo Gao, Shuai Li, Yiyang Li, Hui Yuan, Mao Ye

机构 * Shandong University(山东大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出噪声约束扩散框架,通过将量化噪声作为扩散过程中的噪声,提升压缩效率和图像保真度,同时引入自适应频域滤波模块和零样本引导增强方法,实验证明其优于现有方法。

Comments Accepted by IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO 83%

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14685 2026-04-09 cs.CV cs.AI 83%

DiffSketcher: Text Guided Vector Sketch Synthesis through Latent Diffusion Models

DiffSketcher: 通过潜在扩散模型实现文本引导的向量草图合成

Ximing Xing, Chuang Wang, Haitao Zhou, Jing Zhang, Qian Yu, Dong Xu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffSketcher,通过扩展的SDS损失优化贝塞尔曲线,实现从自然语言提示直接生成向量草图,提升生成质量与可控性。

Comments Accepted by NeurIPS 2023. Project page: https://ximinng.github.io/DiffSketcher-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02721 2026-04-09 cs.CV cs.MM 81%

Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion

通过视锥采样和流形扩散在VR中实现鲁棒的网格显著性真实值获取

Guoquan Zheng, Jie Hao, Huiyu Duan, Long Tang, Shuo Yang, Yucheng Zhu, Yongming Han, Liang Yuan, Patrick Le Callet, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Chemical Technology(北京化工大学) Nantes University(南特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种鲁棒框架,通过视锥采样和混合流形-欧几里得约束扩散算法,解决VR中3D网格显著性真实值获取的鲁棒性问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07026 2026-04-09 cs.CV 79%

Not all tokens contribute equally to diffusion learning

并非所有标记对扩散学习贡献相等

Guoqing Zhang, Lu Shi, Wanru Xu, Linna Zhang, Sen Wang, Fangfang Wang, Yigang Cen

机构 * School of Mechanical Engineering, Guizhou University, Guizhou, China(贵州大学机械工程学院) School of Information Science and Technology, Hangzhou Normal University, Zhejiang, China(杭州师范大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DARE框架,通过分布偏见缓解和空间一致性提升扩散模型的语义引导,解决训练数据长尾分布和交叉注意力空间对齐问题,提升文本到视频生成的准确性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05743 2026-04-09 cs.CV cs.AI 79%

On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors

扩散基图像压缩对位翻转错误的鲁棒性

Amit Vaisman, Gal Pomerants, Raz Lapid

机构 * Technion - Israel Institute of Technology(以色列理工学院) Deepkeep

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。

Comments Accepted at AIGENS @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26588 2026-04-09 cs.CV cs.LG 79%

From Synthetic Data to Real Restorations: Diffusion Model for Patient-specific Dental Crown Completion

从合成数据到真实修复:一种针对患者特定牙齿冠的扩散模型

Dávid Pukanec, Tibor Kubík, Michal Španěl

机构 * Department of Computer Graphics and Multimedia, Brno University of Technology, Czechia(捷克布尔诺科技大学计算机图形与多媒体系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ToothCraft模型,通过合成数据生成患者特定的牙齿冠修复,解决训练数据不足问题,实验显示其在IoU和CD指标上的优异表现。

Comments VISAPP 2026 Conference / CVPR Workshop GenRecon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26167 2026-04-09 cs.CV cs.CR 79%

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03468 2026-04-09 cs.CV 79%

D-Garment: Physically Grounded Latent Diffusion for Dynamic Garment Deformations

D-Garment:基于物理的潜在扩散模型用于动态服装变形

Antoine Dumoulin, Adnane Boukhayma, Laurence Boissieux, Bharath Bhushan Damodaran, Pierre Hellier, Stefanie Wuhrer

机构 * Inria Centre at the University Grenoble Alpes(格勒诺布尔阿尔卑斯大学Inria研究中心) Inria, University of Rennes, CNRS, IRISA-UMR 6074(雷恩大学Inria、CNRS、IRISA-UMR 6074) InterDigital Inc.(InterDigital公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D-Garment,通过基于物理的模拟器生成新数据,学习基于物理材料属性的3D生成模型,实现更准确的服装变形和动态皱纹模拟。

Comments 18 pages, 11 figures

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06627 2026-04-09 cs.CL 78%

DiffuMask: Diffusion Language Model for Token-level Prompt Pruning

DiffuMask: 用于令牌级提示压缩的扩散语言模型

Caleb Zheng, Jyotika Singh, Fang Tu, Weiyi Sun, Sujeeth Bharadwaj, Yassine Benajiba, Sujith Ravi, Eli Shlizerman, Dan Roth

机构 * University of Washington(华盛顿大学) Oracle AI(甲骨文人工智能)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiffuMask通过迭代掩码预测实现快速并行提示压缩,保留关键推理上下文,实现80%的提示长度缩减,同时保持或提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06598 2026-04-09 cs.RO cs.SY eess.SY 78%

Train-Small Deploy-Large: Leveraging Diffusion-Based Multi-Robot Planning

训练小型部署大型:利用基于扩散的多机器人规划

Siddharth Singh, Soumee Guha, Qing Chang, Scott Acton

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的多机器人路径规划方法,通过训练少量代理并有效扩展到更多代理,解决动态变化中的规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06260 2026-04-09 cs.LG cs.AI 78%

$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models

$S^3$:分层缩放搜索用于扩散语言模型的测试时间

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Asad Aali, Muhammad Usman Khanzada, Muhammad Usman Rafique, Zihao He, Emily Fox, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) University of Göttingen(哥廷根大学) Zoox Meta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出$S^3$方法,通过在去噪过程中重新分配计算资源提升生成质量,实验证明其在数学推理任务中表现最佳。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07162 2026-04-09 math.NA cs.NA 78%

Cut Finite Element Methods for Convection-Diffusion in Mixed-Dimensional Domains

用于混合维域的对流扩散问题的切割有限元方法

Erik Burman, Peter Hansbo, Mats G. Larson, Karl Larsson, Shantiram Mahata

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种切割有限元方法,用于混合维域中的对流扩散问题,通过混合维方向导数和散度算子抽象表达问题,采用固定背景网格和主动网格表示每个流形组件,证明了能量和L2范数的先验误差估计,并通过数值实验验证了收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11037 2026-04-09 cs.NE 78%

Diffusion-based Evolutionary Optimization for 3D Multi-Objective Molecular Generation

基于扩散的进化优化用于3D多目标分子生成

Ruiqing Sun, Dawei Feng, Sen Yang, Ronghang Wang, Huaiyuan Song, Bo Ding, Yijie Wang, Huaimin Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的进化分子优化框架DEMO,通过引入进化引导扩散和结构感知环境选择机制,解决复杂3D结构约束下的多目标分子生成问题,实现零样本下高多样性且化学有效的Pareto前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17289 2026-04-09 math.AP 78%

On the equilibrium solutions of electro-energy-reaction-diffusion systems

关于电-能-反应-扩散系统的平衡解

Katharina Hopf, Michael Kniely, Alexander Mielke

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究电-能-反应-扩散系统长期行为的平衡解,通过熵最大化问题探讨其存在性、唯一性和正则性,采用拉格朗日乘数法和变分法两种方法证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06870 2026-04-09 cs.CV 70%

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

RefineAnything: 多模态区域特定细化以实现完美局部细节

Dewei Zhou, You Li, Zongxin Yang, Yi Yang

机构 * RELER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室、人工智能研究所) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出区域特定图像细化方法,通过多模态扩散模型实现局部细节恢复,同时保持非编辑区域不变,引入边界一致性损失和Focus-and-Refine策略提升效果。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00635 2026-04-09 cs.CV 70%

Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack

被擦除,但未被遗忘:擦除的修正流变换器在概念攻击下仍不安全

Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) GigaAI National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ReFlux,首个针对最新修正流T2I框架评估概念擦除鲁棒性的攻击方法,通过反注意力优化和动态引导策略,验证了概念擦除在修正流变换器中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06413 2026-04-09 cs.LG 67%

ODE-free Neural Flow Matching for One-Step Generative Modeling

无微分方程的神经流匹配用于一步生成建模

Xiao Shou

机构 * Baylor University(贝勒大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 本文提出无微分方程的神经流匹配方法,通过直接学习传输映射实现一步生成,减少推断步骤,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06740 2026-04-09 cs.CV 57%

LiveStre4m: Feed-Forward Live Streaming of Novel Views from Unposed Multi-View Video

LiveStre4m: 从无姿态多视角视频中实时生成新视角的前馈直播

Pedro Quesado, Erkut Akdag, Yasaman Kashefbahrami, Willem Menu, Egor Bondarev

机构 * AIMSGroup, Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系AIMSGroup)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LiveStre4m方法,通过多视角视觉Transformer和扩散-Transformer插值模块实现实时新视角视频直播,无需姿态参数,每帧重建时间仅0.07秒,显著优于传统优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06489 2026-04-09 cs.HC cs.MM 57%

Language-Guided Multimodal Texture Authoring via Generative Models

基于生成模型的语言引导多模态纹理创作

Wanli Qian, Aiden Chang, Shihan Lu, Michael Gu, Heather Culbertson

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出一种语言驱动的多模态纹理创作系统,通过生成模型将自然语言提示转化为触觉和视觉纹理,实现触觉与视觉信号的语义一致性,提升创作效率与可解释性。

Comments 14 pages, 13 figures, accepted to IEEE Haptics Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏