arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-12 至 2026-06-12 共收录 88 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 67 篇

2606.13433 2026-06-12 stat.ME 新提交 71%

Smoothed-KL Reweighting: A Principled Account and Matching Rule for SNR-Based Diffusion Training

平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则

Lei Li

专题命中 扩散模型 :diffusion(title)

AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13191 2026-06-12 cs.LG 新提交 67%

The Geometry of Phase Transitions in Generative Dynamics via Projection Caustics

生成动力学中相变的几何:投影焦散视角

Ryosuke Sakamoto, Kotaro Sakamoto

机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交 62%

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01538 2026-06-12 cs.GR cs.CV cs.LG 版本更新 62%

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

MPMWorlds: 用于推断和外推物理动力学的物质点法模拟

Žiga Kovačič, Kevin Ellis

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。

Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 57%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13432 2026-06-12 cs.CV cs.AI 新提交 57%

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

OmniDirector: 无需配对数据的通用多镜头相机克隆

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13364 2026-06-12 cs.LG cs.CV 新提交 57%

VideoMDM: Towards 3D Human Motion Generation From 2D Supervision

VideoMDM: 从2D监督走向3D人体运动生成

Amir Mann, Gal Michael Harari, Merav Keidar, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoMDM框架,利用单目视频的2D姿态通过扩散模型学习3D运动先验,使用深度加权的2D重投影损失近似3D监督,在HumanML3D上接近全3D监督性能。

Comments https://videomdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13035 2026-06-12 cs.CV cs.AI 新提交 57%

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment

TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法

Yu Meng, Xiangyang Luo, Letian Li, Wenyuan Jiang, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04260 2026-06-12 cs.CV cs.AI 版本更新 57%

Proto-LeakNet: Towards Signal-Leak Aware Attribution in Synthetic Human Face Imagery

Proto-LeakNet:面向合成人脸图像中信号泄漏感知的归因方法

Claudio Giusti, Luca Guarnera, Sebastiano Battiato

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Catania(卡塔尼亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Proto-LeakNet,利用扩散模型中的信号泄漏痕迹,结合闭集分类与密度开集评估,实现可解释的生成器归因,在闭集上训练后对未见生成器也有效。

Comments 44 pages, 27 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12612 2026-06-12 q-fin.PM 新提交 50%

The Mathematics of Heuristic Portfolio Optimization (HPO)

启发式投资组合优化(HPO)的数学原理

Miquel Noguer i Alonso

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出启发式投资组合优化(HPO)框架,将Markowitz解投影到稳定规则类,通过隐含收益原理推导启发式最优性集,并建立与强化学习投资组合优化(RLPO)的联系,提供可测试的统计条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13637 2026-06-12 cs.LG 新提交 50%

The Stable Recovery Manifold: Geometric Principles Governing Recoverability in Continual Learning

稳定恢复流形:持续学习中可恢复性的几何原理

Ayushman Trivedi, Bhavika Melwani

机构 * ResNet-18 Split CIFAR-100

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过分析Split CIFAR-100上ResNet-18的顺序学习,发现遗忘知识在表示重组后仍可紧凑解码,提出稳定恢复流形假说,表明灾难性遗忘主要是可访问性和流形对齐问题。

Comments 9 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13426 2026-06-12 cs.LG stat.ML 新提交 50%

Accelerating Speculative Diffusions via Block Verification

通过块验证加速推测性扩散

Alexander Soen, Hisham Husain, Valentin De Bortoli, Arnaud Doucet

机构 * KTH(皇家理工学院) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种针对扩散模型的推测性采样方案,通过块验证提高草稿接受率,无需训练的Free Drafter实现高达6.3%的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13355 2026-06-12 cs.RO cs.AI 新提交 50%

Real-Time Execution with Autoregressive Policies

基于自回归策略的实时执行

Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) Seoul National University(首尔大学) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过异步推理和约束解码实现自回归策略的实时执行,在保证低延迟的同时提升任务完成速度,实验表明其性能优于流匹配策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12997 2026-06-12 cs.LG stat.ML 新提交 50%

Reliability of Probabilistic Emulation of Physical Systems

物理系统概率仿真的可靠性

Sam F. Greenbury, Radka Jersakova, Paolo Conti, Marjan Famili, Christopher Iliffe Sprague, Edwin Brown, Jason D. McEwen

机构 * The Alan Turing Institute(艾伦·图灵研究所) Autodesk Research(欧特克研究院) PhysicsX Orbital University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 比较生成模型与CRPS训练集成在物理系统概率仿真中的可靠性,发现CRPS集成在覆盖率和推理速度上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12965 2026-06-12 cs.RO 新提交 50%

EmbodiSteer: Steering Embodiment-Agnostic Visuomotor Policies with Joint-Space Guidance for Zero-Shot Cross-Embodiment Deployment

EmbodiSteer: 用关节空间引导的具身无关视觉运动策略实现零样本跨具身部署

Shihefeng Wang, Kangchen Lv, Mingrui Yu, Xiang Li

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出EmbodiSteer框架,通过前向运动学和雅可比更新将推理时的扩散采样提升到目标机器人关节空间,并加入全身碰撞感知引导,实现零样本、具身感知的部署,在模拟和物理机器人上显著降低碰撞率并提高任务成功率。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12748 2026-06-12 cs.CL 新提交 50%

Agent-based models for the evolution of morphological alternation patterns

基于智能体的形态交替模式演化模型

Aravinth Kulanthaivelu, Richard Sproat

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过多智能体模拟,研究形态交替(如go/went)的涌现机制,发现无标度社交网络和随机采纳策略能产生更真实的形态模式。

Comments 51 + 37 pages. 31 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12690 2026-06-12 cs.RO cs.AI 新提交 50%

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型

Xin Zhou, Cong Miao

机构 * Astronex Robotics Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12494 2026-06-12 cs.LG 新提交 50%

Net-Ev$^2$: A Generative Simulator for Network Event Evolution

Net-Ev$^2$:网络事件演化的生成式模拟器

Guangyu Wang, Zhaonan Wang

机构 * NYU Shanghai(上海纽约大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出Net-Ev$^2$,一种结合事件线索与网络拓扑的生成式模拟器,通过结构引导掩码预训练和拓扑感知扩散过程模拟网络事件演化,在多个道路网络数据集上达到最优性能。

Comments Accepted by KDD 2026 Research Track

Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12875 2026-06-12 math.OC 新提交 50%

Randomized Optimal Switching Problem and Related Mirror Descent Flow

随机化最优切换问题与相关镜像下降流

Yuchao Dong

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对最优切换问题,提出随机化框架并引入KL散度正则化,证明正则化值函数是椭圆HJB系统的唯一光滑解,给出最优Gibbs策略的显式形式,并建立镜像下降流算法及收敛误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13034 2026-06-12 quant-ph 新提交 50%

A Quantum Algorithm for Random Number Generation

一种用于随机数生成的量子算法

Aastha Kataria, Devansh Desai, Ashwini Dalvi, Sagar Korde, Abhijeet Pasi, Irfan N A Siddavatam, Sudhir Ranjan Jain

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种量子随机数生成算法,通过量子傅里叶变换、受控相位旋转和Grover扩散算子实现二次加速,混合时间达到O(√(n log n)),并在IBM超导硬件上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03747 2026-06-12 physics.app-ph 版本更新 50%

Generalized Virtual-Wave Theory for Photothermal Coherence Tomography under Arbitrary Excitation Toward Non-Contact Industrial Inspection of Composite Materials

面向复合材料非接触工业检测的光热相干层析成像广义虚拟波理论

Pengfei Zhu, Julien Lecompagnon, Philipp Daniel Hirsch, Mathias Ziegler

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出广义虚拟波光热层析框架,将扩散-波变换推广到任意边界激励,通过ADMM或截断SVD求解逆问题,实现热扩散场到波场的转换,提升复合材料缺陷检测的深度定位和层析重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13646 2026-06-12 nucl-th hep-ph 新提交 50%

Observable Dependence of Viscous Corrections in QGP: Heavy Quarks and Dileptons in Chapman--Enskog Theory

QGP中黏性修正的可观测依赖性:Chapman-Enskog理论中的重夸克和双轻子

Lakshmi J. Naik, P. Parvathi, Nachiketa Sarkar, V. Sreekanth

专题命中 扩散模型 :diffusion(abstract)

AI总结 首次使用梯度展开至二阶的黏性修正计算重夸克输运和热双轻子产生,发现Chapman-Enskog修正显著抑制拖曳力并影响动量扩散,且不同可观测量对动量空间不同区域敏感。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13617 2026-06-12 cond-mat.soft cond-mat.stat-mech 新提交 50%

Geometric formulation of state-dependent Langevin dynamics using scalar free energy

使用标量自由能的状态依赖朗之万动力学的几何表述

Kento Yasuda, Zhongqiang Xiong, Zhanglin Hou, Kenta Ishimoto, Xinpeng Xu, Shigeyuki Komura

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过引入标量自由能并将扩散张量作为构型空间的度量,提出了几何一致的朗之万方程,明确了坐标协变性,并展示了在坐标变换、几何约束和投影等例子中的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13114 2026-06-12 cond-mat.mtrl-sci physics.app-ph 新提交 50%

Disentangling the origin of degradation in perovskite solar cells via optical imaging and Bayesian inference

通过光学成像和贝叶斯推断解析钙钛矿太阳能电池降解的起源

Akash Dasgupta, Robert D. J. Oliver, Manuel Kober-Czerny, Charlie H. G. Nicholls, Xueli Cao, Yen-Hung Lin, Alexandra J. Ramadan, Henry J. Snaith

专题命中 扩散模型 :diffusion(abstract)

AI总结 结合光致发光成像与漂移扩散模拟,利用贝叶斯推断生成重组参数图,区分降解发生在空穴/电子传输层界面或体相,并验证氨基硅烷钝化处理抑制界面降解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12932 2026-06-12 cond-mat.mtrl-sci 新提交 50%

Conditional spinodal decomposition in Li-Mg anodes for lithium metal batteries

锂金属电池中Li-Mg负极的条件调幅分解

Leonardo Shoji Aota, Aubin Leray, Yuqi Liu, Frederic de Geuser, Chanwon Jung, Shyam Katnagallu, Tim M. Schwarz, Alisson Kwiatkowski da Silva, Júlio César Pereira dos Santos, Eric Marchezini Mazzer, Poonam Yadav, Christoph Freysoldt, Frank Stein, Yug Joshi, Se-Ho Kim, Dierk Raabe, Baptiste Gault

专题命中 扩散模型 :diffusion(abstract)

AI总结 发现Li-Mg负极中形成有序B2相与β-BCC相发生条件调幅分解,产生均匀互连的富锂β-BCC和贫锂B2相,前者提供快速锂扩散路径,抑制高电流密度下枝晶形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12553 2026-06-12 cond-mat.mtrl-sci 新提交 50%

Hierarchical Interdiffusion Kinetics in Nanoscale Ni/Al Multilayers

纳米Ni/Al多层膜中的层级互扩散动力学

S. S. Riegler, I. Gallino, N. J. Peter, A. Tarasov, T. Meyer, J. Schmauch, C. Pauly, Y. H. Sauni Camposano, H. Bartsch, R. Busch, R. Schwaiger, P. Schaaf, J. Arlt

专题命中 扩散模型 :diffusion(abstract)

AI总结 结合快速差示扫描量热法和扫描透射电镜,揭示了纳米Ni/Al多层膜中层级互扩散动力学:低温下Ni沿Al晶界扩散,高温下从晶界向晶内扩散,晶界是控制反应起始的关键微结构参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11767 2026-06-12 cs.RO cs.AI 新提交 50%

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning

通过真实到仿真到真实触觉策略学习的盲操作灵巧抓取

Shengcheng Luo, Xiyan Huang, Zhe Xu, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种结合Real2Sim触觉校准、布局感知触觉编码器和触觉条件扩散策略的框架,实现仅依赖触觉的灵巧手盲抓取,在真实机器人上对20个物体达到27%成功率。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12107 2026-06-12 cond-mat.mtrl-sci 新提交 50%

Direct nanoscale observation of melting and solute redistribution in a hypoeutectic Al-Cu alloy with $\it{in\ situ}$ STEM

原位STEM直接纳米尺度观察亚共晶Al-Cu合金的熔化和溶质再分布

Martin Hasenburger, Rostislav Daniel, Phillip Dumitraschkewitz, Thomas M. Kremmer, Matheus A. Tunes, Stefan Pogatscher

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用原位STEM加热技术,纳米尺度观察亚共晶Al-Cu合金的熔化过程,发现晶界优先形成共晶液相,Al2Cu相先熔化,液态Cu长距离再分布导致富Al边缘和Cu富集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04009 2026-06-12 stat.ML cs.AI cs.LG 版本更新 50%

Counterfactual Explanations for Deep Two-Sample Testing

深度双样本检验的反事实解释

Wei-Cheng Lai, Marco Simnacher, Christoph Lippert

机构 * Hasso-Plattner-Institute, University of Potsdam(波茨坦大学洪堡-劳恩堡研究所) Hasso Plattner Institute for Digital Health at Mount Sinai Icahn School of Medicine at Mount Sinai(辛辛那提医学院洪堡数字健康研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对深度双样本检验,提出基于扩散自编码器和MMD优化的反事实解释框架,生成样本级编辑以揭示驱动假设拒绝的特征。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02133 2026-06-12 cs.LG cs.AI 版本更新 50%

Variational Learning for Insertion-based Generation

基于插入生成的变分学习

Yangtian Zhang, Zhe Wang, Arthur Gretton, Rex Ying, David van Dijk, Michalis K. Titsias, Jiaxin Shi

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出插入过程(IP)模型,通过排列变分推断联合学习插入位置、内容和终止条件,支持变长生成并提升非自回归序列建模质量。

详情

展开后加载摘要…

URL PDF HTML 收藏