arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-02 至 2026-06-02 共收录 258 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 194 篇

2602.05951 2026-06-02 cs.CV cs.AI cs.LG 77%

Better Source, Better Flow: Learning Condition-Dependent Source Distribution for Flow Matching

更好的源,更好的流:学习条件依赖的源分布用于流匹配

Junwan Kim, Jiho Park, Seonghu Jeon, Seungryong Kim

机构 * New York University(纽约大学) KAIST AI(韩国科学技术院人工智能实验室)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出在流匹配框架中学习条件依赖的源分布,通过方差正则化和源-目标方向对齐,显著提升文本到图像生成的速度和质量。

Comments Project Page: https://junwankimm.github.io/CSFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01315 2026-06-02 cs.CV 74%

DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images

DeblurNVS:基于几何潜在扩散的稀疏运动模糊图像新视角合成

Changyue Shi, Wangbo Yu, Chaoran Feng, Li Yuan

机构 * School of AI for Science, Peking University Shenzhen Graduate School(人工智能科学学院,北京大学深圳研究生院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出DeblurNVS框架,利用几何潜在扩散从稀疏运动模糊图像中直接合成高保真新视角,无需逐场景优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00583 2026-06-02 cs.CV cs.AI cs.LG cs.MM 73%

Improving Visual Representation Alignment Generation with GRPO

利用GRPO改进视觉表示对齐生成

Shentong Mo, Sukmin Yun

机构 * Carnegie Mellon University(卡内基梅隆大学) Hanyang University(翰阳大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 提出VRPO方法,通过强化学习将静态对齐损失替换为生成式表示策略优化目标,动态平衡表示一致性与生成质量,在扩散Transformer中实现更快的收敛和更高的图像保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05634 2026-06-02 cs.AI 71%

PECKER: A Precisely Efficient Critical Knowledge Erasure Recipe For Machine Unlearning in Diffusion Models

PECKER: 一种用于扩散模型机器遗忘的精确高效关键知识擦除方法

Zhiyong Ma, Zhitao Deng, Huan Tang, Jialin Chen, Zhijun Zheng, Zhengping Li, Qingyuan Chuai

机构 * Cao Tu Li(Guangzhou) Technology Co., Ltd, China(广州曹图利科技有限公司,中国) South China University of Technology, China(华南理工大学,中国) Guangzhou Xinhua University, China(广州新华大学,中国) Hong Kong Baptist University, HongKong(香港 Baptist 大学,香港)

专题命中 扩散模型 :diffusion(title)

AI总结 提出PECKER方法,通过显著性掩码优先更新关键参数,在蒸馏框架下实现高效机器遗忘,减少训练时间并保持遗忘效果。

Comments Accepted by ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18754 2026-06-02 physics.flu-dyn physics.app-ph physics.comp-ph physics.geo-ph 71%

Iterative bounds on effective transport for advection diffusion in periodic flow fields

周期流场中对流扩散有效输运的迭代界限

N. B. Murphy, D. Hallman, E. Cherkaev, J. Xin, K. M. Golden

专题命中 扩散模型 :diffusion(title)

AI总结 提出一种迭代方法,通过解析计算任意阶矩来获得空间和时空周期流中有效扩散率的严格上下界,并准确捕捉二维稳态细胞流的已知行为。

Comments 37 pages, 8 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02453 2026-06-02 cs.CV cs.AI 70%

Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior

初始化即半程:从引导势后验生成多样图像

Xiang Li, Dianbo Liu, Kenji Kawaguchi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Tokyo(东京大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对生成模型模式崩溃问题,提出从引导势后验中采样初始噪声的DivIn方法,利用朗之万动力学引导初始化远离崩溃区域,提升多样性且兼容扩散与流匹配模型。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01481 2026-06-02 cs.CV 70%

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

SafeGen-Bench: 图像条件文本到视频生成中的安全性基准测试

Yingzi Ma, Xiaogeng Liu, Yawen Zheng, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像条件文本到视频生成中安全文本和图像组合仍可能产生有害内容的问题,提出SafeGen-Bench基准,定义10个恶意类别并评估现有模型,发现当前模型难以避免生成恶意内容,且单模态护栏防御不足。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01086 2026-06-02 cs.LG cs.AI 67%

Strong Stochastic Flow Maps

强随机流映射

Sam McCallum, Zander W. Blasingame, Timothy Herschell, Niklas Rindtorff, Alexander Tong, James Foster

机构 * University of Bath(巴斯大学) AITHYRA

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出强随机流映射(SSFMs)框架,通过学习加性噪声SDE的强解映射,实现扩散模型的免模拟训练和少步采样,在图像生成和分子系统采样中优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00137 2026-06-02 cs.CV cs.GR 62%

Advances in Neural 3D Mesh Texturing: A Survey

神经3D网格纹理化进展:综述

Sai Raj Kishore Perla, Hao Zhang, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了神经3D网格纹理化的最新进展,涵盖纹理合成、迁移和补全方法,并提出了统一的分类体系。

Comments Eurographics STAR (Computer Graphics Forum), 2026. Project Page: https://sairajk.github.io/neural-mesh-texturing/

Journal ref Eurographics STAR (State of The Art Report), Computer Graphics Forum, Volume 45, Number 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00664 2026-06-02 cs.LG cs.AI cs.CV cs.HC cs.MM 62%

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

Avatar Forcing:用于自然对话的实时交互式头部化身生成

Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡国立大学) DeepAuto.ai

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出Avatar Forcing框架,通过扩散强制实现实时交互式头部化身生成,利用直接偏好优化进行无标签学习,在低延迟(约500ms)下生成富有表现力的反应动作。

Comments CVPR 2026. Project page: https://taekyungki.github.io/AvatarForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02577 2026-06-02 cs.RO cs.CV 57%

RoboDream: Compositional World Models for Scalable Robot Data Synthesis

RoboDream: 用于可扩展机器人数据合成的组合世界模型

Junjie Ye, Rong Xue, Basile Van Hoorick, Runhao Li, Harshitha Rajaprakash, Pavel Tokmakov, Muhammad Zubair Irshad, Vitor Guizilini, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种以具身为中心的组合世界模型,通过将轨迹执行与环境合成解耦,实现从新视角、新场景和新物体中合成逼真演示数据,并展示其在数据扩展和减少真实数据需求方面的有效性。

Comments Project page: https://junjieye.com/RoboDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02553 2026-06-02 cs.CV 57%

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

LongLive-RAG: 一种用于长视频生成的通用检索增强框架

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

机构 * NVIDIA USC(美国大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02510 2026-06-02 cs.CV cs.RO 57%

Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis

并非所有点都同等重要:不确定性感知的4D LiDAR场景合成

Xiang Xu, Alan Liang, Youquan Liu, Xian Sun, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * NUAA(南京航空航天大学) NUS(新加坡国立大学) FDU(福建工程学院) Duke(杜克大学) NTU(国立新加坡大学) NJUPT(南京理工大学泰州学院) SKL-TI(特种信息处理实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出U4D框架,利用空间不确定性引导LiDAR场景生成,通过熵图识别高不确定性区域并优先合成,再补全其余区域,实现高保真4D场景。

Comments CVPR 2026 E2E3D Workshop; GitHub at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02310 2026-06-02 cs.CV cs.LG 57%

Deep Learning for Remote Sensing to Improve Flood Inundation Mapping

深度学习用于遥感以改进洪水淹没制图

Yogesh Bhattarai, Vijay Chaudhary, Wai Lim Kim, Sanjib Sharma

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于去噪扩散概率模型和掩码扩散Transformer的云去除框架,用于洪水影像,以生成无云图像并保持水文一致性,提升洪水监测的可靠性。

Comments This paper has been selected as the top 10 student finalists in IGRASS 2026 paper competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02120 2026-06-02 cs.CV cs.AI cs.LG 57%

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

理解增强的模型协作用于长尾自我中心错误检测

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出理解增强的模型协作方法(UE-MCM),结合粗粒度视频理解与细粒度动作推理,通过双分支模型和自适应融合门检测自我中心视频中的错误,并优化长尾分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01652 2026-06-02 eess.SP cs.CV 57%

Physics-Aware Linearized ADMM and Its Unrolling

物理感知线性化ADMM及其展开

Satoshi Takabe, Shunta Arai, Tadashi Wadayama

机构 * Japan Society for the Promotion of Science (JST), CRONOS(日本学术振兴会(JST)、CRONOS)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对基于PDE测量过程的逆问题,提出物理感知线性化ADMM算法,通过子问题线性化实现高效更新,并利用深度展开训练内部参数,在光纤通信压缩感知和噪声各向异性扩散图像恢复中验证有效性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01620 2026-06-02 cs.CV 57%

Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

基于参考引导深度压缩VAE的流式说话人肖像视频实时生成

Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo

机构 * Microsoft Research(微软研究院) Microsoft AI(微软人工智能)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种结合因果视频VAE和自回归潜在去噪模型的流式说话人肖像视频生成框架,通过参考图像引导实现实时高质量生成。

Comments CVPR 2026 (Highlight) Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01493 2026-06-02 cs.CV 57%

Splatshot: 3D Face Avatar Generation from a Single Unconstrained Photo

Splatshot: 从单张非约束照片生成3D人脸头像

Hao Liang, Zhixuan Ge, Soumendu Majee, Joanna Li, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Rice University(里士大学) Samsung Research America(三星美国研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SplatShot,一种无需训练的方法,通过将3D高斯泼溅与扩散模型去噪过程耦合,从单张照片生成多视图一致的逼真3D人脸头像。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01399 2026-06-02 cs.CV 57%

PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion

PAI-Studio: 具有相机感知运动的电影级视频背景替换

Heyuan Gao, Bangxun Tang, Yiren Song, Guian Fang, Zijian He, Jie Yang, Mike Zheng Shou

机构 * Utopai Studios(Utopai工作室) Nanyang Technological University(南洋理工大学) University of California, Irvine(加州大学尔湾分校) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PAI-Studio,一种基于扩散变换器的视频合成任务,通过双向注意力机制统一处理前景动态与背景参考,实现运动一致的背景生成、高保真前景重光照和身份保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01361 2026-06-02 cs.CV 57%

Diamonds in the Sky: Pareidolic Animals in Clouds

天空中的钻石:云中的空想性动物

Miriam Horovicz, Yacov Hel-Or, Yael Moses

机构 * Reichman University, Israel(里奇曼大学,以色列)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散模型的方法,预测人们可能在云中感知到的空想性动物,并通过生成相似形状的动物图像和变形视频辅助识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01164 2026-06-02 cs.CV 57%

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

迈向交互式视频世界建模:前沿、挑战、基准与未来趋势

Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) Peking University(北京大学) University of Twente(埃因霍温理工大学) Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。

Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01021 2026-06-02 cs.CV 57%

Learning Neural Deformation Representation for 4D Dynamic Shape Generation

学习神经变形表示用于4D动态形状生成

Gyojin Han, Jiwan Hur, Jaehyun Choi, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种新的神经变形表示,结合条件神经符号距离场,设计解耦运动与形状潜在空间的4D表示架构,通过扩散模型生成高质量、高时间一致性的4D动态形状。

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01014 2026-06-02 cs.CV cs.AI 57%

Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

基于文本的三维人体运动编辑中的跨轴特征融合与关节运动差异预测

Gyojin Han, Junmo Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种跨轴特征融合架构和辅助任务,通过联合锚定变换器预测关节运动差异,实现文本驱动的三维人体运动编辑,在MotionFix数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00100 2026-06-02 cs.CV cs.AI 57%

CoilDrop-MRI: Self-supervised physics-guided MRI reconstruction with coil dropout

CoilDrop-MRI:基于线圈丢弃的自监督物理引导MRI重建

Tongxi Song, Ziyu Li, Zihan Li, Wen Zhong, Congyu Liao, Yang Yang, Hua Guo, Wenchuan Wu, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学生物医学工程系) Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford(牛津大学整合神经影像中心) Department of Radiology & Biomedical Imaging, University of California San Francisco(加州大学旧金山分校放射科与生物医学成像系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CoilDrop-MRI方法,通过在线圈维度进行丢弃并作为自监督训练目标,结合图像域和k空间域展开架构,实现无需全采样数据的并行MRI重建,在多站点、多场强、多模态数据集上性能优于现有自监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30855 2026-06-02 cs.CV 57%

Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation

Robust Dreamer: 用于动作控制AR视频生成的偏差感知潜在高斯记忆

Hanlin Chen, Jiaxin Wei, Xibin Song, Yifu Wang, Steve Wang, Hongdong Li, Pan Ji, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Technische Universität München(慕尼黑技术大学) Vertex Lab(Vertex实验室) Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Robust Dreamer框架,通过潜在高斯记忆和动态偏差存档解决自回归视频生成中的漂移问题,实现长程3D一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12377 2026-06-02 cs.CV 57%

Fast Image Super-Resolution via Consistency Rectified Flow

通过一致性修正流实现快速图像超分辨率

Jiaqi Xu, Wenbo Li, Haoze Sun, Fan Li, Zhixin Wang, Long Peng, Jingjing Ren, Haoran Yang, Xiaowei Hu, Renjing Pei, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) HKUST (GZ)(香港科技大学(广州)) South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出FlowSR方法,将超分辨率问题重构为从低分辨率到高分辨率图像的修正流,利用改进的一致性学习策略实现单步高质量超分辨率。

Comments Accepted by ICCV 2025; Code: https://github.com/jiaqixuac/FlowSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20176 2026-06-02 cs.CV 57%

LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis

LagerNVS:用于全神经实时新视角合成的潜在几何

Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Meta AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LagerNVS,一种基于3D感知潜在特征的编码器-解码器神经网络,通过显式3D监督预训练初始化编码器,结合轻量解码器和光度损失端到端训练,实现实时、泛化的新视角合成,在Re10k上达到31.4 PSNR。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: szymanowiczs.github.io/lagernvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06331 2026-06-02 cs.CV 57%

WorldCache: Accelerating World Models for Free via Heterogeneous Token Caching

WorldCache: 通过异构令牌缓存免费加速世界模型

Weilun Feng, Guoxin Fan, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Dingrui Wang, Longlong Liao, Michele Magno, Yongjun Xu, Chuanguang Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散世界模型中令牌异质性和非均匀时间动态导致的推理慢问题,提出基于曲率引导的异构令牌预测和混沌优先自适应跳过的缓存框架WorldCache,实现高达3.7倍加速并保持98%的推出质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05435 2026-06-02 cs.CV 57%

Stable Velocity: A Variance Perspective on Flow Matching

稳定速度:流匹配的方差视角

Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :text-to-image(abstract);分类 cs.CV

AI总结 针对流匹配中单样本条件速度导致的高方差训练目标,提出稳定速度框架,通过方差表征识别高低方差区域,并引入无偏方差缩减目标(StableVM)、方差感知表示对齐(VA-REPA)以及免微调加速采样(StableVS),在多个大规模模型上实现训练效率提升和超过2倍采样加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02507 2026-06-02 cond-mat.mtrl-sci cs.ET cs.LG physics.app-ph physics.comp-ph 50%

Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design

迈向自动发现:逆向材料设计中生成模型、多模态学习与闭环工作流综述

Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * Institute of Condensed Matter and Nanosciences, Université Catholique de Louvain(凝聚态与纳米科学研究所,比利时列日-努瓦尔桑大学) WEL Research Institute(WEL研究机构)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了逆向材料设计中生成晶体结构建模、多模态学习和闭环设计管道的最新进展,重点讨论了可行性约束与物理先验的施加方式、多模态融合策略以及多种逆向设计策略(如条件生成与潜在优化、贝叶斯优化、强化学习和主动学习),并指出了常见失败模式及基于分阶段报告的评估实践。

详情

展开后加载摘要…

URL PDF HTML 收藏