arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-17 至 2026-06-17 共收录 56 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 48 篇

2606.17432 2026-06-17 cs.GR cs.CV 新提交 84%

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

Duy-Dat Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15236 2026-06-17 cs.CV 新提交 83%

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

展示信号,隐藏噪声:像素空间扩散的频谱强制

Weichen Fan, Haiwen Diao, Penghao Wu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出频谱强制方法,通过在像素空间扩散模型中对噪声输入施加时变低通滤波器,引导模型关注信号频带,提升训练效率和生成质量。

Comments Code link: https://github.com/WeichenFan/Spectral_Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17378 2026-06-17 cs.DC 新提交 82%

RISE: Relay Inference and Online Scheduling for Efficient Edge-Device Collaborative Diffusion Model Services

RISE: 面向高效边缘-设备协同扩散模型服务的接力推理与在线调度

Zilan Huang, Zhiqing Tang, Hanshuai Cui, Tian Wang, Yuan Wu, Weijia Jia, Wei Zhao

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 提出RISE方法,通过训练无关的接力机制利用模型家族共享潜空间,将边缘大模型与设备小模型结合,并采用上下文感知调度器优化质量与延迟权衡。

Comments to be published in IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17675 2026-06-17 cs.CV 新提交 79%

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

我们真的需要扩散吗?用于配对医学图像翻译的快速U-Net

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

机构 * Institute of Artificial Intelligence, Ulm University(乌尔姆大学人工智能研究所) Institute of Orthopaedic Research and Biomechanics, Centre for Trauma Research, University Hospital Ulm(乌尔姆大学医院创伤研究中心骨科研究与生物力学研究所) AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(乌尔姆应用科学大学传感器数据分析人工智能研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较轻量级4级U-Net与去噪扩散概率模型(DDPM)在从T2加权MRI估计脂肪分数任务上的性能,发现U-Net在精度和速度上均优于DDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17521 2026-06-17 cs.MM 新提交 79%

DiffPC: Diffusion-Based Projector Photometric Compensation

DiffPC: 基于扩散的投影仪光度补偿

Yuxi Wang, Haibin Ling, Bingyao Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出一种基于扩散模型的光度补偿方法,将投影失真建模为环境相关加性噪声,通过扩散模型逐步去噪生成补偿图像,并设计融合光度与内容特征的噪声估计网络,在未知场景中取得更优视觉表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17342 2026-06-17 cs.CV 新提交 79%

Learning a Maximum Entropy Model for Visual Textures using Diffusion

使用扩散学习视觉纹理的最大熵模型

Xinyuan Zhao, Eero P. Simoncelli

机构 * New York University(纽约大学) Flatiron Institute(熨斗研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散模型无监督学习最大熵模型统计量的纹理建模方法,仅用512个统计量即可生成质量优于或媲美当前最优模型(约177k统计量)的纹理图像,并实现平滑插值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17257 2026-06-17 cs.CV cs.AI 新提交 79%

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

Pulling The REINS: 通过表示引导实现视频扩散模型的无训练安全对齐

Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

机构 * University of California, Riverside(加州大学河滨分校) YouTube (Google)(YouTube(谷歌))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出REINS方法,在推理时通过线性方向引导视频扩散模型的内部表示,实现无训练的安全对齐,避免有害内容生成,且不降低通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15614 2026-06-17 cs.CV 新提交 79%

Variational Test-time Optimization for Diffusion Synchronization

扩散同步的变分测试时优化

Hyunsoo Lee, Farrin Marouf Sofian, Kushagra Pandey, Stephan Mandt

机构 * Seoul National University(首尔大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于最优控制的变分测试时优化框架,通过优化控制变量引导多轨迹协同生成,无需额外训练即可提升扩散同步性能。

Comments Preprint. Project website: https://hleephilip.github.io/SyncVC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18186 2026-06-17 cs.LG cs.AI 新提交 78%

Kolmogorov Regression for Robust Diffusion Policies

用于鲁棒扩散策略的Kolmogorov回归

Lekan Molu

机构 * Bala Cynwyd, PA 19004(巴拉辛威德, PA 19004)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出后向Kolmogorov方程将扩散策略提升至Cameron-Martin空间,用确定性边界值PDE问题替代随机分数匹配,通过精度加权损失和残差诊断实现收敛保证、轨迹规则化和无奖励故障检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18066 2026-06-17 cs.LG 新提交 78%

NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment

NoiseTilt: 噪声倾斜反向核用于扩散奖励对齐

Jisung Hwang, Yunhong Min, Jaihoon Kim, I-Chao Shen, Minhyuk Sung

机构 * KAIST(韩国科学技术院) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出噪声倾斜反向核(NTRK),通过将奖励梯度注入噪声项实现奖励引导采样,保持预训练反向核不变,每步仅需单样本,在奖励对齐任务中超越现有方法且不损失样本质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18022 2026-06-17 cs.LG 新提交 78%

Recursive Scaling in Masked Diffusion Models

掩码扩散模型中的递归缩放

Alba Carballo-Castro, Julianna Piskorz, Paulius Rauba, Mihaela van der Schaar, Pascal Frossard

机构 * LTS4, EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院LTS4实验室) University of Cambridge, Cambridge, UK(英国剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出递归掩码扩散模型(R-MDMs),通过在每个扩散步骤中重复应用同一去噪变换器增加递归深度,实现参数高效缩放,在数独和倒计时等结构化生成任务中,以更少参数匹配非递归基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17982 2026-06-17 cs.RO 新提交 78%

LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation

LAGO策略:面向平滑操作的延迟感知异步扩散策略与目标导向无碰撞规划

Guowei Shi, Xupeng Xie, Yiming Luo, Jian Guo, Jun Ma, Boyu Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出LAGO策略,通过延迟感知条件引导和时空轨迹优化,解决异步扩散策略的间断和碰撞问题,实现平滑安全的操作。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17566 2026-06-17 cs.DC cs.LG 新提交 78%

AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

AoiZora: 面向扩散变换器推理的拓扑感知自动并行优化

Kaijian Wang, Yuanyuan Xu, Fanjiang Ye, Ye Cao, Jingwei Zuo, T. S. Eugene Ng, Yarong Mu, Yuke Wang

机构 * Rice University(里士大学) Independent Researcher(独立研究者) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散变换器推理中的低延迟需求,提出AoiZora编译器,通过拓扑感知的物理布局优化自动并行策略,在TPU子片上实现高达1.42倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17192 2026-06-17 cs.LG 新提交 78%

Constrained Diffusion Models with Primal-Dual Inference

约束扩散模型与原始-对偶推理

Samar Hadou, Yigit Berkay Uslu, Alejandro Ribeiro

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出原始-对偶推理(PDI)方法,通过联合推断最优原始分布和其对偶变量,在扩散模型反向过程中交替去噪与对偶上升,实现平均约束下的熵正则化优化问题采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17175 2026-06-17 cs.CL 新提交 78%

Self-Generated Error Training for Token Editing in Diffusion Language Models

扩散语言模型中令牌编辑的自生成错误训练

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对LLaDA2.1中令牌编辑的训练-推理不匹配问题,提出自生成T2T方法,通过无梯度草稿传递和自生成错误监督,提升编辑准确率并减少编辑强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17808 2026-06-17 physics.geo-ph 新提交 78%

Incorporating wave physical priors into diffusion models: A novel approach to seismic resolution enhancement

将波动物理先验融入扩散模型:一种提高地震分辨率的新方法

Huanhuan Tang, Shijun Cheng, Weijian Mao, Haoran Zhang, Yingying Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出物理引导的自监督扩散模型(PG-SSDM),通过自监督训练、地震卷积模型硬约束和不确定性量化,无需配对高分辨率标签即可提升地震数据分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17252 2026-06-17 cond-mat.dis-nn cond-mat.stat-mech 新提交 78%

Stochastic Thermodynamics of Score Matching in Diffusion Models

扩散模型中分数匹配的随机热力学

Xuehao Ding, H. T. Quan, Yuhai Tu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出扩散模型的随机热力学框架,定义时间不对称熵产生(TAEP)并证明其满足精确涨落定理,揭示Hyvärinen隐式分数匹配核作为TAEP的涨落分量,平均TAEP与分数匹配目标成正比,并量化采样不均匀性和数据流形覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15777 2026-06-17 math.AP 新提交 78%

Length-constrained and length-penalised curve diffusion flows of planar curves inside cones

锥内平面曲线的长度约束和长度惩罚曲线扩散流

Mashniah A. Gazwani, James A. McCoy

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究锥内满足广义Neumann边界条件的平面曲线在三种四阶非线性曲线扩散流下的长时间行为,证明在小曲率振荡且远离锥顶时,解全局存在并指数收敛到以锥顶为中心的圆弧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15531 2026-06-17 cs.LG cs.CR 新提交 78%

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

贪婪坐标扩散:通过扩散引导实现有效且语义一致的对抗攻击

Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出贪婪坐标扩散方法,利用扩散模型引导生成语义连贯的对抗样本,在保持自然性的同时实现高攻击成功率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08810 2026-06-17 cs.CL cs.LG 新提交 78%

Continuous Language Diffusion as a Decoder-Interface Problem

连续语言扩散作为解码器-接口问题

Zhicheng Du, Lan Ma

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院, 清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究连续扩散语言模型如何从高斯噪声生成流畅文本,提出解码器-盆地机制,并设计诊断协议揭示标量指标隐藏的失败,通过接口相图解释令牌恢复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17606 2026-06-17 cs.CV 新提交 74%

Flux-Guard: Facial Identity Protection using diffusion models

Flux-Guard:使用扩散模型的面部身份保护

Jie Wang, Tao Wang, Ru Zhang, Jianyi Liu

机构 * School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出Flux-Guard框架,通过流轨迹控制和潜在空间对抗优化,在统一生成过程中实现面部编辑与隐私保护,有效提升对跨域人脸识别模型的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18183 2026-06-17 stat.ML cs.LG math.PR 新提交 71%

A Diffusion Approximation for Temporal-Difference Learning with Linear Features under Markovian Noise

马尔可夫噪声下线性特征时序差分学习的扩散近似

M. Forzo, E. Monzio Compagnoni, A. Russo, A. Pacchiano

机构 * Technical University of Munich (TUM), Munich, Germany(慕尼黑技术大学) University of Basel, Basel, Switzerland(巴塞尔大学) Boston University, Boston, USA(波士顿大学)

专题命中 扩散模型 :diffusion(title)

AI总结 针对线性TD(0)在马尔可夫噪声下的随机波动,提出随机微分方程近似模型,揭示投影Bellman算子收缩动力学与马尔可夫采样影响的区别,解释常数步长误差下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17090 2026-06-17 cs.PL cs.AI cs.MS 新提交 67%

ANEForge: Python for direct computation on the Apple Neural Engine

ANEForge: 用于直接在Apple Neural Engine上进行计算的Python工具

Spencer H. Bryngelson

机构 * School of Computational Science \& Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 ANEForge是一个Python包,通过编译惰性张量图直接编程Apple Neural Engine,无需CoreML,支持推理和训练,性能接近引擎硬件极限。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18243 2026-06-17 cs.CV cs.GR cs.RO 新提交 62%

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

MOCHI: 协作人-物交互的运动增强

Jiye Lee, Yonghun Choi, Jungdam Won

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对多人-物交互数据中手物接触错位、运动抖动和手指细节缺失等问题,提出两阶段框架MOCHI,先通过优化生成物理合理的手部抓取,再基于扩散模型优化全身运动,有效增强噪声数据。

Comments SIGGRAPH 2026 Journal (ACM TOG); Project page: https://jiyewise.github.io/projects/MOCHI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17601 2026-06-17 cs.CV 新提交 57%

Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting

测试时训练用于鲁棒文本引导的开放词汇目标计数

Hao-Yuan Ma, Yuda Zou, Li Zhang, Yongchao Xu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Dual-TTT框架,通过测试时训练轻量去噪模块,提升文本引导开放词汇目标计数在恶劣条件下的鲁棒性,无需修改原模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17584 2026-06-17 cs.CV cs.LG 新提交 57%

Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness

基于轨迹直线度的整流流根选择不动点反演

Semin Kim, Jihwan Yoon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出SelFix方法,通过选择使逆轨迹更直的不动点解,在整流流中实现精确反演,提升图像重建和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17408 2026-06-17 cs.RO cs.CV cs.LG 新提交 57%

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

动作生成应从何处开始?面向生成式机器人策略的可学习源先验

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei

机构 * Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LeaP,用轻量MLP预测基于本体感知的对角高斯分布作为动作生成源先验,替代标准高斯分布,在15个RoboTwin任务中平均成功率81.6%,优于基线方法6.5-25.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17379 2026-06-17 cs.CV cs.AI eess.IV 新提交 57%

MeiBRD: Meta-Learning Intraoperative Biomechanical Residual Deformation

MeiBRD:元学习术中生物力学残余变形

Casey Meisenzahl, Jon Heiselman, Michael Holtz, Yubo Ye, Michael Miga, Linwei Wang

机构 * Rochester Institute of Technology(罗切斯特理工学院) Vanderbilt University(范德堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出混合配准框架,利用稀疏术中对应点自适应生物力学先验,通过图神经扩散函数学习残余变形,结合元学习从术中样本中快速适应,在肝脏体模上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17310 2026-06-17 cs.CV 新提交 57%

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues

SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍

Suttisak Wizadwongsa, Hyelin Nam, Supasorn Suwajanakorn, Jeong Joon Park

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) VISTEC, Thailand(泰国威斯泰克科学技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17684 2026-06-17 stat.ML cs.CY cs.LG 新提交 50%

Geometrical fairness in graph neural networks

图神经网络中的几何公平性

Arturo Pérez-Peralta, Sandra Benítez-Peña, Blas Kolic, Rosa E. Lillo

机构 * Department of Statistics, University Carlos III of Madrid, Spain(马德里卡斯蒂利亚-拉曼恰大学统计系) uc3m-Santander Big Data Institute(uc3m-桑坦德大数据研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对图神经网络中公平性问题,通过修改拉普拉斯算子引入多种互补变换(子空间投影、频谱调整、频率滤波)来缓解偏差,理论分析并实验验证了公平性提升与竞争性能。

Comments 32 pages, 21 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏