arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-13 至 2026-07-13 共收录 27 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 23 篇

2607.09067 2026-07-13 cs.CV 新提交 85%

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

探索用于对比表示学习的扩散去噪动力学

Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO Data61(联邦科学与工业研究组织数据61实验室) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何让预训练扩散模型的去噪动力学适应判别表示学习,提出D³CL方法,通过结合对比目标与去噪重建损失,利用LoRA更新保持轻量级,实验证明该方法能使重建与对比目标互补,是高效参数适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08794 2026-07-13 cs.GR cs.AI 新提交 85%

Multi-Conditioned Diffusion Synthesis of Sand Boils for Low-Resource Earthen-Levee Inspection

用于低资源土堤检查的砂沸多条件扩散合成

Padam Jung Thapa, Abdullah Bin Naeem, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Department of Computer Science, Louisiana State University New Orleans(路易斯安那州立大学新奥尔良分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.GR

AI总结 针对土堤砂沸像素级检测因注释稀缺受限的问题,提出基于扩散的合成管道,用多分支ControlNet堆栈等技术生成合成图像,经评估各预设利弊后发布标签可靠预设,为低资源土堤检查提供合成图像,限于图像质量等方面,代码等可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 79%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09587 2026-07-13 cs.RO 新提交 78%

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

CoDiMAD:基于扩散的特权蒸馏用于无通信多机器人协调

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Peking University(北京大学) National Innovation Institute of Defense Technology(国防科技创新研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究无通信多机器人协调问题,提出CoDiMAD三阶段框架,先训练特权预言机,再构建数据集,最后将预言机蒸馏到学生智能体中,通过扩散反向过程采样动作,实验证明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09277 2026-07-13 cs.LG 新提交 78%

Autoregressive latent diffusion for 3D molecule generation

用于3D分子生成的自回归潜扩散

Federico Ottomano, Gaopeng Ren, Yingzhen Li, Kim E. Jelfs, Alex M. Ganose

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究3D分子生成问题,提出KRONOS潜自回归扩散框架,联合建模分子图拓扑和几何,引入混合训练策略。实验表明其在自回归方法中无条件生成性能领先,与扩散模型竞争,单一架构可支持两种生成范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09134 2026-07-13 cs.SD cs.AI eess.AS eess.SP 新提交 78%

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

ReGen:用于高效波形扩散模型的分层多提示表示生成

Sang-Hoon Lee, Ha-Yeong Choi

机构 * Department of Artificial Intelligence, Ajou University, Suwon, Korea(人工智能系,全州大学) KT Corp., Seoul, Korea(KT公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散训练中中间表示正则化问题,提出ReGen框架联合估计向量场,引入GFM提高泛化能力。在波形扩散模型及文本到语音模型上验证,提升了波形生成质量、语音清晰度等,实现高效训练与采样。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09108 2026-07-13 cs.LG 新提交 78%

Quantum Circuits in Diffusion Models: A Fair-Comparison Study and a Mechanistic Analysis of Angle-Embedding Failures

扩散模型中的量子电路:角度嵌入失败的公平比较研究与机理分析

Jaeuk Kim, Sanghoon Yoo

机构 * NextITS Co., Ltd.(NextITS有限公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究变分量子电路与扩散模型集成,通过多实验发现量子核心在FID上与经典控制相当但未证明参数效率优势,还识别出基于分数的NCSN的结构故障及角度嵌入失败问题,提供了公平比较协议和机理说明。

Comments 13 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08930 2026-07-13 cs.LG 新提交 78%

BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving

BlockServe:用于高吞吐量扩散语言模型服务的块粒度连续批处理

Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Shanghao Li, Zihe Song, Philip S. Yu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型服务的收敛异质性问题,提出BlockServe框架,集成块粒度调度、混合状态执行及计算感知准入控制器,在五个基准测试中实现高吞吐量,确立块粒度调度为高吞吐量离线dLLM推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09401 2026-07-13 physics.med-ph 新提交 78%

Two observables of one wall: how surface relaxivity can bias the diffusion intra-axonal fraction and the myelin water fraction

一壁的两个可观测值:表面弛豫率如何影响轴突内扩散分数和髓磷脂水分数

Rutger H. J. Fick

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究表面弛豫率对轴突内扩散分数和髓磷脂水分数的影响,推导有髓圆柱体表面速率封闭形式并验证,量化偏差,发现生理白质中表面弛豫率使轴突内信号加权过高,还揭示了相关物理原理及不同偏差特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09525 2026-07-13 nlin.PS physics.chem-ph 新提交 78%

Chemical Frequency Combs in Reaction-Diffusion Oscillators

反应扩散振荡器中的化学频率梳

Krishnesh Krishnakumar Nair, Madhurendra Mishra, Zhen Qi, Adarsh Ganesan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究振荡化学反应中频率梳的产生,利用布鲁塞尔振子模型推导霍普夫分岔条件,模拟发现目标波模式有频率梳结构,改变参数仍成立,通过实验验证,证明反应扩散化学是产生频率梳的新平台。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09288 2026-07-13 hep-ph hep-ex hep-lat nucl-ex nucl-th 新提交 78%

Diffusion Monte Carlo study of deuteron-like fully light hexaquarks

氘核状全轻六夸克的扩散蒙特卡罗研究

M. C. Gordillo, J. Segovia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在组分夸克模型中对全轻六夸克进行扩散蒙特卡罗研究,考虑紧凑和重子 - 重子状排列,发现紧凑六夸克态不受青睐,部分重子 - 重子状构型接近阈值且有类似分子态结构,一种构型类似氘核,能量略超阈值。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09193 2026-07-13 cs.CV 新提交 57%

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

YeTI:仅需两张噪声图像即可生成真实世界的sRGB噪声

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对真实世界sRGB图像去噪难题,提出YeTI框架,仅从同一场景两张噪声图像学习,利用重构自编码器和条件扩散Transformer分离场景与噪声特征,生成逼真噪声,经实验验证其有效性及在下游去噪任务中的实用价值。

Comments Accepted to ECCV 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09125 2026-07-13 cs.CV 新提交 57%

4D Human-Scene Reconstruction from Low-Overlap Captures

从低重叠度捕获中进行4D人体场景重建

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。

Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09081 2026-07-13 cs.CV 新提交 57%

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

用于动作分割数据集压缩的自适应潜在轨迹锚定

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对动作分割数据集压缩问题,提出利用去噪扩散隐式模型,将动作段表示为噪声流形中由稀疏潜在点锚定连续轨迹的方法,并引入自适应分配机制。实验表明,该框架显著优于现有方法,在保持低压缩率时实现与真实数据训练相当的性能。

Comments 16 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09446 2026-07-13 cs.CE cs.CG 新提交 50%

Topology-Preserving Mesh Adaptation for Sharp-Interface Multiphase PFEM

用于尖锐界面多相粒子有限元法的拓扑保持网格自适应

Félix Ruyffelaere, Michel Henry, Jonathan Lambrechts, Jean-François Remacle

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究基于粒子有限元法模拟多相流时界面跟踪的问题,提出动态网格自适应策略,为离散界面段分配空节点圆盘解耦界面物理与网格大小,经基准测试验证其能力、准确性、可扩展性及几何通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09039 2026-07-13 cs.LG q-bio.QM 新提交 50%

Variable-Length Generative Protein Design via Generalized Poisson Flow

通过广义泊松流进行可变长度生成蛋白质设计

Chaoran Cheng, Zhanghan Ni, Yanru Qu, Yuxin Chen, Ruihan Guo, Jiajun Fan, Ge Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对蛋白质设计中可变长度生成的关键问题,引入广义泊松流(GPFlow)框架,通过最小化负对数似然学习速率函数,经多模态评估验证其可变长度生成质量,在多种设计任务中表现出色,提升了蛋白质设计的灵活性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 50%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08781 2026-07-13 cs.LG cs.AI q-bio.QM 新提交 50%

Reward Transport: Property Control in Flow Matching via Noise-Space Alignment

奖励传输:通过噪声空间对齐在流匹配中进行属性控制

Kehan Guo, Yili Shen, Yujun Zhou, Yue Huang, Chujie Gao, Shiyi Du, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过奖励传输在流匹配中实现属性控制,训练时用最优传输耦合将噪声空间坐标与分子奖励对齐,推理时改变坐标引导生成分布,实验表明可对logP和QED进行有效控制,且该接口与其他方法互补,明确了耦合级对齐不存在的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08942 2026-07-13 eess.SY cs.RO cs.SY math.OC 新提交 50%

Adaptive MPPI with Online Disturbance Covariance Estimation: Provable Stability Tightening via Spatial Smoothing

具有在线干扰协方差估计的自适应MPPI:通过空间平滑实现可证明的稳定收紧

Hyung-Jin Yoon, Hunmin Kim

机构 * Department of Mechanical and Nuclear Engineering, Tennessee Technological University(机械与核工程系,田纳西技术大学) School of Engineering, Department of Electrical and Computer Engineering, Mercer University(工程学院,电气与计算机工程系,梅尔基大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究具有未知、空间变化且时变干扰协方差的非线性系统的MPPI控制,提出带空间扩散的协方差估计器,证明有限时域误差界,代入MPPI采样分布得自适应稳定证书,结果表明自适应控制器能实现更紧稳定界,数值实验验证效果。

Comments 19 pages. Companion papers: arXiv:2607.04006 and arXiv:2607.06945. Simulation code: https://github.com/LCAS-Lab/mppi-noise-covariance-estimation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09352 2026-07-13 hep-ex 新提交 50%

Constraints on Sub-MeV Dark Matter from Solar Reflection with DAMIC-M

来自 DAMIC - M 太阳反射的亚 MeV 暗物质的约束

K. Aggarwal, I. Arnquist, N. Avalos, X. Bertou, N. Castello-Mor, C. Centeno-Lorca, A. E. Chavarria, A. R. Chriss, J. Cuevas-Zepeda, A. Dastgheibi-Fard, C. De Dominicis, O. Deligny, J. Duarte-Campderros, E. Estrada, R. Gaıor, E. -L. Gkougkousis, T. Hossbach, L. Iddir, B. J. Kavanagh, B. Kilminster, I. Lawson, A. Letessier-Selvon, H. Lin, P. Loaiza, A. Lopez-Virto, R. Lou, H. Lumengo-Kidimbu, S. Munagavalasa, J. Noonan, D. Norcini, S. Paul, P. Perez-Cobo, P. Privitera, P. Robmann, B. Roach, D. Rosenmerkel, M. Settimo, R. Smida, M. Traina, R. Vilar, R. Yajur, D. Venegas-Vargas, C. Zhu, Y. Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用 DAMIC - M 探测器约 1.3 kg - 天数据,通过分析低能电子反冲空间扩散特征,给出太阳反射暗物质在重介质和超轻介质基准下暗物质 - 电子散射截面 90%置信水平上限,探测了相关参数空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09427 2026-07-13 cond-mat.str-el cond-mat.quant-gas hep-th 新提交 50%

Effective theories for many-body systems with nonuniform symmetries

具有非均匀对称性的多体系统的有效理论

Aleksander Głódkowski

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究具有非均匀对称性的多体系统,开发统一框架,通过附加场理解其效应,导致运动学约束重塑红外动力学,在对称破缺系统和有限温度下有新表现,产生新物理现象。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09484 2026-07-13 astro-ph.CO 新提交 50%

Turbulent Transport of Galactic Magnetic Fields into Cosmic Voids: Insights from IllustrisTNG

银河系磁场向宇宙空洞的湍流输运:来自IllustrisTNG的见解

Yuri Yamashita, Hiroyuki Tashiro, Kiyotomo Ichiki

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究银河系磁场在膨胀宇宙中的扩散,通过分析IllustrisTNG模拟数据集估算湍流磁扩散率,得出当今磁屏蔽长度约7 Mpc,发现其在空洞磁化中作用比之前估计更重要。

Comments 12 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08642 2026-07-13 cs.CL 新提交 50%

DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

DominoTree:使用Domino进行条件树结构草稿的推测性解码

Saw S. Lin, Jyh-Shing Roger Jang

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。

Comments 23 pages, 2 figures, 11 tables. Code: https://github.com/slin-zhq/Domino-Tree

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2607.08879 2026-07-13 cs.CV 新提交 70%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09362 2026-07-13 cs.CV cs.AI 新提交 57%

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park

机构 * NXN Labs(NXN实验室) KAIST(韩国科学技术院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 研究旨在解决虚拟试穿中用户对服装穿着方式控制不足的问题。提出通过VIP - SAM解决视觉实例提示分割,引入CtrlVTON可控框架,将试穿转为图像编辑问题并添加分割掩码控制布局。二者在各自任务达先进水平,CtrlVTON能更忠实地遵循用户布局且保证服装逼真度。

Comments 13 + 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 57%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 1 篇

2607.09336 2026-07-13 cs.LG cs.AI cs.RO 新提交 50%

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

用于高效离线强化学习的捷径轨迹规划

Guanquan Wang, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对离线强化学习中轨迹规划器的问题,提出捷径轨迹规划(STP)框架,将捷径模型作为轨迹生成器,单阶段训练条件捷径轨迹模型,支持可调推理,用增强可行性感知校正的评论家选候选计划,在多任务基准测试中性能强且简化训练管道。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏