arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-10 至 2026-03-10 共收录 146 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 105 篇

2603.06782 2026-03-10 cs.LG cs.AI physics.ao-ph physics.geo-ph 78%

Physics-Informed Diffusion Model for Generating Synthetic Extreme Rare Weather Events Data

用于生成合成极端罕见天气事件数据的物理信息扩散模型

Marawan Yakout, Tannistha Maiti, Monira Majhabeen, Tarry Singh

机构 * Department of Computer Science, University of London, London(伦敦大学计算机科学系) Deepkapha AI Lab, Assen, The Netherlands(Deepkapha AI实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于物理信息的扩散模型,用于生成极端罕见天气事件的合成数据,以解决数据稀缺和类别不平衡问题。

Comments 24 pages, 10 figures, 4 tables. Submitted to MDPI journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06780 2026-03-10 cs.LG cs.AI 78%

SpatialMAGIC: A Hybrid Framework Integrating Graph Diffusion and Spatial Attention for Spatial Transcriptomics Imputation

SpatialMAGIC: 一种融合图扩散与空间注意力的混合框架用于空间转录组学插值

Sayeem Bin Zaman, Fahim Hafiz, Riasat Azim

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SpatialMagic通过融合图扩散与空间注意力机制,提升空间转录组学数据插值精度,提高下游生物分析效果。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06743 2026-03-10 cs.LG cs.AI 78%

Stabilizing Reinforcement Learning for Diffusion Language Models

稳定扩散语言模型的强化学习

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang, Jiacheng Sun, Qiang Xu

机构 * Huawei Foundation Model Department(华为基础模型部门) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出StableDRL方法,针对扩散语言模型中的强化学习问题,通过无条件裁剪和自我归一化解决比率估计噪声导致的不稳定性,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06685 2026-03-10 cs.LG 78%

One step further with Monte-Carlo sampler to guide diffusion better

通过蒙特卡洛采样进一步改进扩散模型

Minsi Ren, Wenhao Deng, Ruiqi Feng, Tailin Wu

机构 * AI for Scientific Simulation and Discovery Lab, Westlake University(人工智能科学模拟与发现实验室,西湖大学)

专题命中 扩散模型 :diffusion(title);inpainting(abstract)

AI总结 通过引入蒙特卡洛采样改进扩散模型,提升生成质量与一致性。

Comments 16 pages, 7 figures, accepted at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06628 2026-03-10 q-bio.TO 78%

Weakly nonlinear analysis of a reaction-diffusion model for demyelinating lesions in Multiple Sclerosis

脱髓鞘病变在多发性硬化症中的反应-扩散模型的弱非线性分析

Romina Travaglini, Rossella Della Marca

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过弱非线性分析,探讨了多发性硬化症中脱髓鞘病变形成的机制,重点分析了免疫细胞行为和趋化反应对空间模式的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06617 2026-03-10 cs.LG cs.AI 78%

Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance

Evo:具有进化平衡的自回归-扩散大语言模型

Junde Wu, Minhao Hu, Jiayuan Zhu, Yuyuan Liu, Tianyi Zhang, Kang Li, Jingkun Chen, Jiazhen Pan, Min Xu, Yueming Jin

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Technical University of Munich(慕尼黑技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09437 2026-03-10 cs.LG cs.AI 78%

Diffusion-Guided Pretraining for Brain Graph Foundation Models

基于扩散的脑图基础模型预训练

Xinxu Wei, Rong Zhou, Lifang He, Yu Zhang

机构 * Department of Electrical and Computer Engineering, Lehigh University, Bethlehem, PA, USA(电气与计算机工程系,莱维大学) Department of Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(计算机科学与工程系,莱维大学) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学医学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的预训练框架,通过结构感知的掩码策略和拓扑感知的图级读出,提升脑图表示的鲁棒性和有效性。

Comments Paper has some mistakes

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07700 2026-03-10 cs.RO cs.SY eess.SY 78%

EB-MBD: Emerging-Barrier Model-Based Diffusion for Safe Trajectory Optimization in Highly Constrained Environments

EB-MBD:基于新兴障碍函数的模型驱动扩散用于在高度受限环境中安全轨迹优化

Raghav Mishra, Ian R. Manchester

机构 * Australian Robotic Inspection and Asset Management (ARIAM) Hub(澳大利亚机器人检测与资产管理系统(ARIAM)中心) Australian Centre for Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering, University of Sydney(悉尼大学航空航天、机械与机电工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 EB-MBD通过引入新兴障碍函数改进模型驱动扩散,以在高度受限环境中实现更安全的轨迹优化,减少计算时间并提高解决方案质量。

Comments Accepted to ICRA 2026. Code available at https://github.com/acfr/emerging_barrier_mbd

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04436 2026-03-10 cs.RO cs.SY eess.SY 78%

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

PAD-TRO: 用于直接轨迹优化的投影增强扩散模型

Jushan Chen, Santiago Paternain

机构 * Department of Electrical, Computer, and Systems Engineering, Rensselaer Polytechnic Institute(电气、计算机与系统工程系,罗切斯特理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PAD-TRO提出了一种基于模型的扩散方法,通过无梯度投影机制直接生成状态序列,实现了在四旋翼航点导航中零动态可行性误差和更高的成功率。

Comments Final manuscript. Accepted for publication at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05695 2026-03-10 cs.RO 78%

Hybrid Diffusion Policies with Projective Geometric Algebra for Efficient Robot Manipulation Learning

混合扩散策略与投影几何代数用于高效机器人操作学习

Xiatao Sun, Yuxuan Wang, Shuo Yang, Yinxing Chen, Daniel Rakita

机构 * Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Electrical and Systems Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出hPGA-DP混合扩散策略,利用投影几何代数提升机器人操作学习的效率和性能

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09889 2026-03-10 cs.RO 78%

Diffusion-SAFE: Diffusion-Native Human-to-Robot Driving Handover for Shared Autonomy

Diffusion-SAFE: 基于扩散模型的人机协同驾驶交接机制

Yunxin Fan, Monroe Kennedy

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Diffusion-SAFE通过基于扩散模型的闭环框架实现安全的人机协同驾驶交接,支持从演示中直接进行安全评估和计划生成,实验显示在模拟和真实赛车中均取得高交接成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01252 2026-03-10 cs.RO 78%

Diffusion Stabilizer Policy for Automated Surgical Robot Manipulations

扩散稳定策略用于自动化手术机器人操作

Chonlam Ho, Jianshu Hu, Lei Song, Hesheng Wang, Qi Dou, Yutong Ban

机构 * UM-SJTU Joint Intuitute(UM-SJTU联合学院) Shanghai Jiao Tong University(上海交通大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) Department of Automation(自动化系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散的策略学习框架,用于提升手术机器人在不完美或失败轨迹下的操作稳定性与鲁棒性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18281 2026-03-10 cs.IT cs.LG eess.SP math.IT 78%

GDM4MMIMO: Generative Diffusion Models for Massive MIMO Communications

GDM4MMIMO:用于大规模MIMO通信的生成扩散模型

Zhenzhou Jin, Li You, Huibin Zhou, Yuanshuo Wang, Xiaofeng Liu, Xinrui Gong, Xiqi Gao, Derrick Wing Kwan Ng, Xiang-Gen Xia

机构 * National Mobile Communications Research Laboratory, Southeast University, Nanjing 210096, China(南京东南大学国家移动通信研究实验室) Purple Mountain Laboratories, Nanjing 211100, China(南京紫金山实验室) Huawei Technologies Co., Ltd., Suzhou 215100, China(华为技术有限公司) School of Electrical Engineering and Telecommunications, University of New South Wales, Sydney, 2052, Australia(新南威尔士大学电子与电信学院) Department of Electrical and Computer Engineering, University of Delaware, Newark, DE 19716 USA(德克萨斯大学达勒姆分校电子与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用生成扩散模型(GDM)提升大规模MIMO通信中的信道状态信息(CSI)获取效率,探讨其在近场信道估计中的应用及未来研究方向。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 75%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23226 2026-03-10 quant-ph cond-mat.stat-mech 71%

Quantum diffusion for a quantum particle with a correlated Gaussian noise

量子粒子在相关高斯噪声下的扩散

Yun Jeong Kang, Sung Kyu Seo, Kyungsik Kim

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了由相关高斯噪声驱动的量子粒子的扩散行为,推导了联合概率密度函数的解析解并给出了均方动量和位移的显式表达式。

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17853 2026-03-10 math.PR math.AP 71%

Stability analysis of a branching diffusion solver for semilinear heat equations

关于半线性热方程分支扩散求解器的稳定性分析

Qiao Huang, Nicolas Privault

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了半线性热方程分支扩散求解器的稳定性,通过分析随机分支过程的可积性条件,证明了解的非爆炸性和弱解的唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08946 2026-03-10 cs.LG 67%

Improving Conditional VAE with Non-Volume Preserving transformations

通过非体积保持变换改进条件VAE

Tuhin Subhra De

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 本文通过非体积保持变换改进条件VAE,有效提升图像生成质量,FID降低4%,对数似然度提升7.6%。

Comments Independent Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07240 2026-03-10 cs.CV cs.GR 62%

FabricGen: Microstructure-Aware Woven Fabric Generation

FabricGen: 基于微结构的编织材料生成

Yingjie Tang, Di Luo, Zixiong Wang, Xiaoli Ling, jian Yang, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 FabricGen通过分解宏观纹理与微观编织模式,结合预训练扩散模型和专用语言模型,实现高质量编织材料的生成。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08703 2026-03-10 cs.CV 57%

HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising

HiAR:通过分层去噪实现高效的自回归长视频生成

Kai Zou, Dian Zheng, Hongbo Liu, Tiankai Hang, Bin Liu, Nenghai Yu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HiAR通过分层去噪框架在保持时间连续性的同时减少误差传播,实现高效长视频生成。

Comments Project page: https://jacky-hate.github.io/HiAR/ Code: https://github.com/Jacky-hate/HiAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03034 2026-03-10 cs.CV 57%

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07291 2026-03-10 cs.CV 57%

Virtual Try-On for Cultural Clothing: A Benchmarking Study

虚拟试穿用于文化服饰:一个基准研究

Muhammad Tausif Ul Islam, Shahir Awlad, Sameen Yeaser Adib, Md. Atiqur Rahman, Sabbir Ahmed, Md. Hasanul Kabir

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出BD-VITON数据集,专注于孟加拉国服饰,通过重新训练模型提升文化多样服饰的虚拟试穿性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06873 2026-03-10 cs.CV 57%

PICS: Pairwise Image Compositing with Spatial Interactions

PICS: 基于空间交互的图像配对合成

Hang Zhou, Xinxin Zuo, Sen Wang, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Concordia University(康科迪亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PICS通过自监督分解式方法,利用交互变换器和自适应α混合策略,实现高质量且稳定的图像配对合成,适用于多种场景。

Comments ICLR 2026. Project page: https://ryanhangzhou.github.io/pics/ , code: https://github.com/RyanHangZhou/PICS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06664 2026-03-10 cs.CV cs.AI 57%

Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index

通过全局时间索引的序列-并行3D位置编码加速视频生成推理

Chao Yuan, Pan Li

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 通过全局时间索引的序列-并行3D位置编码优化视频生成推理,实现亚秒首帧延迟和近实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06614 2026-03-10 cs.LG cs.CV 57%

Correlation Analysis of Generative Models

生成模型的相关性分析

Zhengguo Li, Chaobing Zheng, Wei Wang

机构 * VI Department\ for Infocomm Research A STAR, Singapore, 138632 Li\ School of ISE Wuhan University of Science School of CST Wuhan University of Science

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一的表示方法,用于分析生成模型中噪声数据与预测目标之间的相关性,以改进模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 57%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08342 2026-03-10 cs.RO 50%

PhaForce: Phase-Scheduled Visual-Force Policy Learning with Slow Planning and Fast Correction for Contact-Rich Manipulation

PhaForce: 基于慢规划与快修正的相位调度视觉-力政策学习用于接触密集 manipulation

Mingxin Wang, Zhirun Yue, Renhao Lu, Yizhe Li, Zihan Wang, Guoping Pan, Kangkang Dong, Jun Cheng, Yi Cheng, Houde Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 PhaForce 通过慢规划与快修正机制,实现接触密集 manipulation 中力与视觉的协同控制,提升任务成功率与接触质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08255 2026-03-10 cs.RO cs.LG 50%

FlowTouch: View-Invariant Visuo-Tactile Prediction

FlowTouch: 视点不变的视觉-触觉预测

Seongjin Bien, Carlo Kneissl, Tobias Jülg, Frank Fundel, Thomas Ressler-Antal, Florian Walter, Björn Ommer, Gitta Kutyniok, Wolfram Burgard

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(乌尔姆技术大学计算机科学与人工智能系) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

专题命中 扩散模型 :image generation(abstract)

AI总结 FlowTouch通过利用物体的局部3D网格实现视点不变的视觉-触觉预测,有效弥补仿真与现实之间的差距,并提升抓取稳定性预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22555 2026-03-10 cs.LG cs.AI 50%

Autoregressive Visual Decoding from EEG Signals

从EEG信号进行自回归视觉解码

Sicheng Dai, Hongwang Xiao, Shan Yu, Qiwei Ye

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启智技术国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 AVDE通过自回归生成框架和对比学习提升EEG信号的视觉解码效率,实现高效且可解释的脑机接口应用。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16723 2026-03-10 math.AP 50%

Divergence-free drifts decrease concentration

无散漂移场降低集中度

Elias Hess-Childs, Renaud Raquépas, Keefer Rowan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了无散漂移场对对流-扩散方程解集中度的影响,发现其能降低绝对连续性模量,且在特定条件下导致解的方差、熵和$L^p$范数变化。

Comments 24 pages

Journal ref Journal of Functional Analysis 290(7):111314 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09787 2026-03-10 cs.LG cs.AI stat.CO stat.ML 50%

BNEM: A Boltzmann Sampler Based on Bootstrapped Noised Energy Matching

BNEM:基于Bootstrap噪声能量匹配的玻尔兹曼采样器

RuiKang OuYang, Bo Qiang, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 BNEM通过基于噪声能量匹配的Bootstrap技术,在分子动力学等应用中实现高效且鲁棒的采样性能。

Comments Camera-ready version for TMLR (03/2026)

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏