arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-27 至 2026-03-27 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2603.25181 2026-03-27 cs.CV 89%

VolDiT: Controllable Volumetric Medical Image Synthesis with Diffusion Transformers

VolDiT:基于扩散变换器的可控体积医学图像合成

Marvin Seyfarth, Salman Ul Hassan Dar, Yannik Frisch, Philipp Wild, Norbert Frey, Florian André, Sandy Engelhardt

机构 * Institute for Artificial Intelligence in Cardiovascular Medicine, Medical Faculty of Heidelberg University, Heidelberg University(海德堡大学医学院心血管医学人工智能研究所) Department of Cardiology, Angiology, Pneumology, Heidelberg University Hospital(海德堡大学医院心脏病学、血管学、肺病学系) DZHK (German Centre for Cardiovascular Research), Partner Site Heidelberg/Mannheim(德国心血管研究中心(DZHK)海德堡/曼海姆合作站点) University Medical Center of the Johannes Gutenberg-University Mainz(美因茨约翰内斯·古腾堡大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出VolDiT,首个纯变压器架构的3D扩散模型,通过体积块嵌入和全局自注意力实现3D数据处理,引入时间步门控控制适配器提升生成可控性,实验证明其在医学图像合成中具有更高的全局一致性与生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11605 2026-03-27 cs.CV cs.AI cs.LG 87%

Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers

可扩展的高分辨率像素空间图像合成与Hourglass扩散变换器

Katherine Crowson, Stefan Andreas Baumann, Alex Birch, Tanishq Mathew Abraham, Daniel Z. Kaplan, Enrico Shippole

机构 * Birchlabs, England, United Kingdom(英国英格兰Birchlabs实验室) Independent Researcher, Florida, United States(美国佛罗里达独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出Hourglass Diffusion Transformer,通过线性扩展像素数量实现高分辨率图像生成,无需传统高分辨率训练技术, 在ImageNet和FFHQ数据集上取得新突破。

Comments 20 pages, 13 figures, project page and code available at https://crowsonkb.github.io/hourglass-diffusion-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25194 2026-03-27 cs.CV 83%

CardioDiT: Latent Diffusion Transformers for 4D Cardiac MRI Synthesis

CardioDiT:用于4D心脏MRI合成的潜在扩散变换器

Marvin Seyfarth, Sarah Kaye Müller, Arman Ghanaat, Isabelle Ayx, Fabian Fastenrath, Philipp Wild, Alexander Hertel, Theano Papavassiliu, Salman Ul Hassan Dar, Sandy Engelhardt

机构 * Institute for Artificial Intelligence in Cardiovascular Medicine, Medical Faculty of Heidelberg University, Heidelberg University(海德堡大学医学院心血管医学人工智能研究所,海德堡大学) Department of Cardiology, Angiology, Pneumology, Heidelberg University Hospital(海德堡大学医院心脏病学、血管学、肺病学系) DZHK (German Centre for Cardiovascular Research), Partner Site Heidelberg/Mannheim(德国心血管研究中心(DZHK),海德堡/曼海姆合作站点) Department of Radiology and Nuclear Medicine, University Medical Center Mannheim(曼海姆大学医学中心放射学与核医学系) Section for Invasive Cardiology and Electrophysiology, I. Medical Department, Cardiology, Hemostasiology and Intensive Care, University Medical Centre Mannheim(曼海姆大学医学中心第一内科(心脏病学、止血学与重症监护)介入心脏病学与电生理学科) University Medical Center of the Johannes Gutenberg-University Mainz(美因茨约翰内斯·古腾堡大学医学中心) Department of Cardiology, Angiology, Hemostasis, and Medical Intensive Care, University Medical Centre Mannheim, Medical Faculty Mannheim, University of Heidelberg(海德堡大学曼海姆医学院曼海姆大学医学中心心脏病学、血管学、止血学与内科重症监护系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CardioDiT,一种基于扩散变换器的4D潜在扩散模型,用于合成短轴 cine CMR,通过联合建模空间和时间实现连续心脏动态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17900 2026-03-27 cs.CV cs.RO 83%

Diffusion Forcing for Multi-Agent Interaction Sequence Modeling

扩散力场用于多智能体交互序列建模

Vongani H. Maluleke, Kie Horiuchi, Lea Wilken, Evonne Ng, Jitendra Malik, Angjoo Kanazawa

机构 * Sony Group Corporation(索尼集团公司) Meta UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出MAGNet框架,通过灵活的条件和采样生成多智能体运动序列,支持多种交互任务,实现长序列生成和智能体间协调。

Comments Project page: https://von31.github.io/MAGNet/ ; Code: https://github.com/Von31/MAGNet-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23022 2026-03-27 cs.CV 83%

DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

DMAligner:通过扩散模型基于视角合成增强图像对齐

Xinglong Luo, Ao Luo, Zhengning Wang, Yueqi Yang, Chaoyu Feng, Lei Lei, Bing Zeng, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Qianyuan Laboratory(钱元实验室) Southwest Jiaotong University(西南交通大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DMAligner通过扩散模型基于视角合成的方法提升图像对齐效果,解决传统光流方法在遮挡和光照变化下的局限性,提出动态感知扩散训练和动态场景图像对齐数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15132 2026-03-27 cs.CV 79%

WiT: Waypoint Diffusion Transformers via Trajectory Conflict Navigation

WiT:通过轨迹冲突导航实现方式点扩散变换

Hainuo Wang, Mingjia Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WiT,通过分解连续向量场中的语义方式点,解决像素空间中的轨迹冲突问题,提升扩散生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02193 2026-03-27 cs.CV 79%

SSI-DM: Singularity Skipping Inversion of Diffusion Models

SSI-DM:扩散模型的奇点跳过反演

Chen Min, Enze Jiang, Jishen Peng, Zheng Ma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SSI-DM方法,通过在标准反演前添加小噪声跳过奇点,实现具有自然高斯性质的噪声反演,提升扩散模型的重建和插值性能。

Comments A complete revision is needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18822 2026-03-27 cs.CV 79%

DiP: Taming Diffusion Models in Pixel Space

DiP:在像素空间中驯服扩散模型

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiP提出一种高效的像素空间扩散框架,通过解耦生成过程为全局和局部阶段,结合Diffusion Transformer和轻量级Patch Detailer Head,在不依赖VAE的情况下实现高效生成,推理速度提升10倍,FID分数达1.79。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24938 2026-03-27 cs.CV 79%

Infinite Gaze Generation for Videos with Autoregressive Diffusion

视频无限 gaze 生成的自回归扩散模型

Jenna Kang, Colin Groth, Tong Wu, Finley Torrens, Patsorn Sangkloy, Gordon Wetzstein, Qi Sun

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种自回归扩散模型,用于生成任意长度视频的无限 horizon 原始 gaze,通过在 saliency-aware 视觉潜在空间中条件化,提升长程时空准确性和轨迹真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24764 2026-03-27 cs.CV cs.LG 79%

Synthetic Cardiac MRI Image Generation using Deep Generative Models

利用深度生成模型合成心脏MRI图像

Ishan Kumarasinghe, Dasuni Kawya, Madhura Edirisooriya, Isuri Devindi, Isuru Nawinne, Vajira Thambawita

机构 * Department of Computer Engineering(计算机工程系) University of Peradeniya(珀德尼亚大学) University of Maryland(马里兰大学) Department of Holistic Systems(整体系统系) SimulaMet Oslo, Norway(挪威奥斯陆)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文综述了通过深度生成模型生成合成心脏MRI图像的方法,探讨了在保真度、实用性和隐私方面现有技术的局限性,并强调了需要集成评估驱动框架以确保临床工作流程的可靠性。

Comments 12 pages, 2 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20951 2026-03-27 cs.CV cs.AI 79%

See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

查看并修复缺陷:通过代理数据合成使VLMs和扩散模型能够理解视觉缺陷

Jaehyun Park, Minyoung Ahn, Minkyu Kim, Jonghyun Lee, Jae-Gil Lee, Dongmin Park

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) KRAFTON

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ArtiAgent,通过代理数据合成生成真实与带缺陷图像对,有效减少视觉缺陷,提升模型对视觉缺陷的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25659 2026-03-27 cond-mat.quant-gas cond-mat.stat-mech 78%

Diffusion in interacting two-dimensional systems under a uniform magnetic field

二维相互作用系统在均匀磁场下的扩散

Łukasz Iwanek, Marcin Mierzejewski, Adam S. Sajna

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究二维费米子系统在均匀磁场下的扩散行为,发现强相互作用抑制磁场效应,而当相互作用与动能相当时,磁场显著降低扩散。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25462 2026-03-27 cs.RO cs.AI 78%

Temporally Decoupled Diffusion Planning for Autonomous Driving

时间解耦的扩散规划用于自动驾驶

Xiang Li, Bikun Wang, John Zhang, Jianjun Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出时间解耦扩散模型(TDDM),通过噪声掩码方法解决动态城市环境中即时安全与长期目标的平衡问题,改进轨迹生成并提升复杂场景下的规划性能。

Comments icaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06754 2026-03-27 physics.data-an hep-ex 78%

Learning the Standard Model Manifold: Bayesian Latent Diffusion for Collider Anomaly Detection

学习标准模型流形:基于贝叶斯潜在扩散的碰撞异常检测

Jigar Patel, Tommaso Dorigo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于贝叶斯潜在扩散模型的碰撞数据异常检测框架,结合概率编码与潜在空间扩散动力学,通过物理约束提升密度估计稳定性,通过实验验证其在LHC喷注数据中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21251 2026-03-27 cond-mat.soft 78%

Tracer Diffusion in Granular Suspensions: Testing the Enskog Kinetic Theory with DSMC and Molecular Dynamics

颗粒悬浮液中的示踪扩散:利用DSMC和分子动力学测试Enskog动力学理论

Antonio M. Puertas, Rubén Gómez González

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究颗粒气体中示踪粒子的扩散,结合DSMC和分子动力学模拟,验证Enskog动力学理论在不同摩擦参数和颗粒质量下的可靠性。

Comments 20 pages, 11 figures, to be published in Physical Review E

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24296 2026-03-27 cs.CL cs.AI 78%

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复

Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Squirrel Ai Learning(松鼠AI) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19897 2026-03-27 stat.ML cs.AI cs.LG 78%

The Information Dynamics of Generative Diffusion

生成扩散的信息动力学

Dejan Stancevic, Luca Ambrogioni

机构 * Donders Institute for Brain, Cognition and Behaviour(唐德斯脑、认知与行为研究所) Radboud University(拉德堡德大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从信息论、动力学和热力学角度探讨生成扩散模型,揭示生成带宽由分数函数发散率决定,通过轨迹分支和生成分岔现象,建立受控噪声诱导对称破缺过程。

Comments 25 pages

Journal ref Entropy 2026, 28(2), 195

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10431 2026-03-27 cs.LG stat.ML 78%

Continuous Diffusion for Mixed-Type Tabular Data

连续扩散用于混合类型表格数据

Markus Mueller, Kathrin Gruber, Dennis Fok

机构 * Econometric Institute, Erasmus University Rotterdam(伊拉斯姆斯大学鹿特丹分校经济计量研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CDTD模型,通过结合分数匹配与分数插值,统一连续和分类特征的噪声分布,提升混合类型表格数据生成性能。

Comments published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24810 2026-03-27 eess.AS 78%

Unified Diffusion Refinement for Multi-Channel Speech Enhancement and Separation

多通道语音增强与分离的统一扩散细化

Zhongweiyang Xu, Ashutosh Pandey, Juan Azcarreta, Zhaoheng Ni, Sanjeel Parekh, Buye Xu, Romit Roy Choudhury

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Uni-ArrayDPS,一种基于扩散的统一多通道语音增强与分离框架,通过语音扩散先验优化现有判别模型的非线性失真问题,无需额外训练即可跨任务和麦克风阵列泛化。

Comments Paper in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24620 2026-03-27 cs.NI eess.SP 78%

Scalable Air-to-Ground Wireless Channel Modeling Using Environmental Context and Generative Diffusion

基于环境上下文和生成扩散的可扩展空地无线信道建模

Jingyi Tian, Lin Cai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种环境感知的空地无线链路信道建模方法,利用真实环境数据和射线追踪技术确定链路的视距或非视距状态,并通过训练扩散模型实现高效预测,支持实时决策。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18865 2026-03-27 eess.SY cs.LG cs.SY 78%

RadioDiff-FS: Physics-Informed Manifold Alignment in Few-Shot Diffusion Models for High-Fidelity Radio Map Construction

RadioDiff-FS:用于高保真射频地图构建的物理指导的少量扩散模型 manifold 对齐

Xiucheng Wang, Zixuan Guo, Nan Cheng

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院) School of Physics, Xidian University(西安电子科技大学物理学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RadioDiff-FS通过物理指导的少量扩散模型实现高保真射频地图构建,通过理论分解和方向一致性损失提升泛化能力,在低数据情况下显著降低误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18087 2026-03-27 cs.AI 78%

Planned Diffusion

计划扩散

Daniel Israel, Tian Jin, Ellie Cheng, Guy Van den Broeck, Aditya Grover, Suvinay Subramanian, Michael Carbin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 计划扩散通过训练模型自主决定去噪顺序,实现并行生成,提升效率并保持质量,建立新的帕累托前沿。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14989 2026-03-27 q-bio.BM cs.AI cs.LG 78%

Constrained Diffusion for Protein Design with Hard Structural Constraints

具有硬结构约束的蛋白质设计扩散模型

Jacob K. Christopher, Austin Seamann, Jingyi Cui, Sagar Khare, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种受结构指导的蛋白质设计扩散框架,通过整合近可行性更新与ADMM分解,确保严格满足功能需求,同时保持立体化学和几何可行性,在复杂约束集下实现高效生成,取得最佳性能。

Comments Accepted at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19140 2026-03-27 cs.CE 78%

2D implementation of Kinetic-diffusion Monte Carlo in Eiron

在Eiron中实现二维的动能-扩散蒙特卡罗方法

Oskar Lappi, Emil Løvbak, Thijs Steel, Giovanni Samaey

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文首次将动能-扩散蒙特卡罗方法扩展到二维,并在Eiron粒子代码中实现,显著提高了高碰撞条件下模拟的效率。

Comments 9 pages, 4 figures, fixed minor textual errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03824 2026-03-27 math.OC 78%

A minimization principle behind the diffusion bridge of diurnal fish migration

日间鱼类迁徙扩散桥背后的最小化原理

H. Yoshioka

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文基于随机微分方程模型,通过最小化问题推导出日间鱼类数量的扩散桥,涉及退化扩散过程和时间依赖权重系数,应用于日本阿 Yu 鱼的幼体洄游事件分析。

Comments Updated on January 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03847 2026-03-27 hep-ph hep-ex physics.ins-det 78%

CaloScore v2: Single-shot Calorimeter Shower Simulation with Diffusion Models

CaloScore v2:基于扩散模型的单次 calorimeter 流与模拟

Vinicius Mikuni, Benjamin Nachman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文改进了CaloScore架构,通过优化扩散过程和渐进蒸馏技术,实现单次函数评估生成高质量样本,适用于真实环境下的快速模拟需求。

Comments 10 pages, 5 figures

Journal ref JINST 19 (2024) 02, P02001

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25124 2026-03-27 physics.flu-dyn physics.comp-ph 71%

A Reaction-Advection-Diffusion Model to describe Non-Uniformities in Colorimetric Sensing using Thin Porous Substrates

一种反应-对流-扩散模型用于描述利用薄多孔基质的比色传感中的非均匀性

Kulkarni Namratha, S. Pushpavanam

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出一种模型,研究多孔基质中质量传输和反应动力学对产物分布的影响,揭示了环状图案的形成机制及多孔基质对颜色均匀性和强度的影响。

Comments The manuscript has 35 pages, and 11 figures. The supplementary information has 8 pages, and 3 figures. Currently submitted to "Langmuir"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25734 2026-03-27 cs.CV 57%

Unleashing Guidance Without Classifiers for Human-Object Interaction Animation

释放无需分类器的人-物体交互动画

Ziyin Wang, Sirui Xu, Chuan Guo, Bing Zhou, Jiangshan Gong, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Snap Inc.(Snap公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LIGHT方法,通过数据驱动的方式生成真实的人-物体交互动画,利用去噪速度自身产生指导,无需手动设计先验。实验表明其在接触精度和动画生成方面优于传统方法。

Comments Project Page: http://ziyinwang1.github.io/LIGHT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 57%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25685 2026-03-27 cs.RO cs.CV 57%

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

持久的机器人世界模型:通过强化学习稳定多步 rollout

Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克理工大学,捷克信息学、机器人学与控制论研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过强化学习方法改进机器人世界模型,解决多步预测中误差累积问题,提出自回归rollout训练方案和多视角视觉反馈奖励,提升预测精度和稳定性,实现在DROID数据集上的state-of-the-art表现。

Comments 34 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏