arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-09 至 2026-04-09 共收录 63 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 48 篇

2604.07329 2026-04-09 cs.CV 57%

Distilling Photon-Counting CT into Routine Chest CT through Clinically Validated Degradation Modeling

通过临床验证的退化建模将光子计数CT转化为常规胸部CT

Junqi Liu, Xinze Zhou, Wenxuan Li, Scott Ye, Arkadiusz Sitek, Xiaofeng Yang, Yucheng Tang, Daguang Xu, Kai Ding, Kang Wang, Yang Yang, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of California, San Francisco(加州大学旧金山分校) Harvard Medical School(哈佛医学院) Emory University(埃默里大学) Nvidia(英伟达) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SUMI方法,利用高质光子计数CT作为参考,通过建模真实退化过程,将低质常规CT提升至高质量图像,实现了在胸部CT中的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07250 2026-04-09 cs.CV 57%

Geo-EVS: Geometry-Conditioned Extrapolative View Synthesis for Autonomous Driving

Geo-EVS:基于几何条件的外推视图合成用于自动驾驶

Yatong Lan, Rongkui Tang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动国家重点实验室) School of Science, Minzu University(中央民族大学理学院) Chongqing Changan Automobile Co., Ltd.(重庆长安汽车股份有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Geo-EVS通过几何条件化框架提升自动驾驶中稀疏视图合成的几何精度,尤其在高角度和低覆盖率场景中表现优异,并改进下游3D检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07154 2026-04-09 cs.CV cs.AI 57%

Bridging MRI and PET physiology: Untangling complementarity through orthogonal representations

弥合MRI与PET生理学:通过正交表示解构互补性

Sonja Adomeit, Kartikay Tehlan, Lukas Förner, Katharina Weisser, Helen Scholtiseek, David Kaufmann, Julie Steinestel, Constantin Lapa, Thomas Kröncke, Thomas Wendler

机构 * Dept. of diagnostic and interventional Radiology and Neuroradiology, University Hospital Augsburg, Germany(德国奥格斯堡大学医院诊断与介入放射学及神经放射学系) Digital Medicine, University Hospital Augsburg, Germany(德国奥格斯堡大学医院数字医学) Chair for Computer Aided Medical Procedures and Augmented Reality, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗流程与增强现实教席) Bavarian Center for Cancer Research (BZKF) Augsburg, Germany(德国奥格斯堡巴伐利亚癌症研究中心) Dept. of Nuclear Medicine, University Hospital Augsburg, Germany(德国奥格斯堡大学医院核医学系) Dept. of Urology, University Hospital Augsburg, Germany(德国奥格斯堡大学医院泌尿外科) Center for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(德国奥格斯堡大学高级分析与预测科学中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种子空间分解框架,通过正交子空间分离重构多模态融合,区分共享信息与模态特有信息,揭示PSMA PET信号中不可由MRI生理描述恢复的部分。

Comments The code is available at https://github.com/SonjaA14/inrmri2pet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07082 2026-04-09 physics.comp-ph cs.NA math.NA 50%

Granular mixing and flow dynamics in horizontal stirred bed reactors

水平搅拌床反应器中的颗粒混合与流动动力学

Sahar Pourandi, Igor Ostanin, Thomas Weinhart

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究水平搅拌床反应器中旋转速度和填充水平对颗粒流动和混合的影响,通过离散元模拟分析轴向和横截面混合行为及轴向扩散系数,揭示旋转速度与填充水平对混合、循环和扩散的平衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06778 2026-04-09 cs.RO 50%

RichMap: A Reachability Map Balancing Precision, Efficiency, and Flexibility for Rich Robot Manipulation Tasks

RichMap: 一种平衡精度、效率和灵活性的可达性地图用于丰富的机器人操作任务

Yupu Lu, Yuxiang Ma, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出RichMap,一种高精度可达性地图表示,通过优化传统网格结构,在保持结构灵活性的同时实现接近紧凑地图形式的性能,通过理论容量界和异步流水线实现高效构建,并在多个指标上验证其高预测精度和低误报率。

Comments Accepted by WAFR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06743 2026-04-09 cond-mat.mes-hall physics.data-an 50%

Resolving Single-Peptide Phosphorylation Dynamics in Plasmonic Nanopores using Physics-Informed Bi-Path Model

利用物理指导的双路径模型解析等离子体纳米孔中单肽磷酸化动态

Mulusew W. Yaltaye, Yingqi Zhao, Kuo Zhan, Vahid Farrahi, Jian-An Huang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种物理指导的深度学习框架,用于解码单分子表面增强拉曼光谱的动力学并识别单肽后翻译修饰。通过结合时序编码和多实例学习,该方法在强背景干扰和随机信号波动下实现了高保真检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06475 2026-04-09 cs.LG cs.NA math.NA 50%

AE-ViT: Stable Long-Horizon Parametric Partial Differential Equations Modeling

AE-ViT: 稳定长时域参数化偏微分方程建模

Iva Mikuš, Boris Muha, Domagoj Vlah

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出AE-ViT模型,结合卷积编码器、Transformer和解码器,通过多阶段参数注入和坐标通道注入提升参数条件,实现多场预测,降低 rollout 错误约5倍。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06391 2026-04-09 cs.LG cs.AI 50%

Toward a universal foundation model for graph-structured data

迈向图结构数据的通用基础模型

Sakib Mostafa, Lei Xing, Md. Tauhidul Islam

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种通用图基础模型,通过学习可迁移的结构表示,提升跨领域图数据分析能力,在生物医学领域表现优异。

Comments 19 pages, 5 figures, 12 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06366 2026-04-09 cs.LG stat.ML 50%

Stochastic Gradient Descent in the Saddle-to-Saddle Regime of Deep Linear Networks

深度线性网络中鞍点到鞍点区域的随机梯度下降

Guillaume Corlouer, Avi Semler, Alexander Strang, Alexander Gietelink Oldenziel

机构 * Moirai University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) Iliad

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究深度线性网络中随机梯度下降在鞍点到鞍点区域的动力学,推导出各模式下的随机微分方程分解,并分析SGD噪声对特征学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06330 2026-04-09 cs.CL 50%

STDec: Spatio-Temporal Stability Guided Decoding for dLLMs

STDec:基于时空稳定性的解码方法用于dLLMs

Yuzhe Chen, Jiale Cao, Xuyang Liu, Jin Xie, Aiping Yang, Yanwei Pang

机构 * Tianjin University(天津大学) Sichuan University(四川大学) Chongqing University(重庆大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 STDec通过结合空间和时间稳定性,改进dLLM解码,提升吞吐量并保持性能。

Comments Homepage: https://yzchen02.github.io/STDec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06313 2026-04-09 physics.optics 50%

Too Big, Too Small, Too $O_2$: The Pandoro Effect from Oxygen Gradients in Tomographic Volumetric Additive Manufacturing

太大、太小、太$O_2$:来自氧梯度的潘多罗效应在体积分层增材制造中的表现

Riccardo Rizzo, Felix Wechsler, Qianyi Zhang, Christophe Moser

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了体积分层增材制造中因氧梯度导致的潘多罗效应,提出多级策略通过光化学优化模型和工艺干预抑制该现象,提升生物打印的可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28253 2026-04-09 cs.LG cs.AI 50%

MR-ImagenTime: Multi-Resolution Time Series Generation through Dual Image Representations

MR-ImagenTime: 通过双图像表示进行多分辨率时间序列生成

Xianyong Xu, Yuanjun Zuo, Zhihong Huang, Yihan Qin, Haoxian Xu, Leilei Du, Haotian Wang

机构 * State Grid Hunan Electric Power Company Limited Research Institute & Hunan Province Engineering Technology Research Center of Electric Power Multimodal Perception and Edge Intelligence(国网湖南省电力有限公司电力科学研究院 & 湖南省电力多模态感知与边缘智能工程技术研究中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出MR-CDM框架,结合多分辨率趋势分解、自适应嵌入机制和多尺度条件扩散过程,有效提升时间序列预测性能,实验表明在四个真实数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05924 2026-04-09 cond-mat.quant-gas quant-ph 50%

An Approach to Probing Particles and Quasi-particles in the Condensed Bose-Hubbard Model

在凝聚 Bose- Hubbard 模型中探测粒子和准粒子的方法

Huy Nguyen, Yu-Xin Wang, Jacob M. Taylor

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了相位对比成像测量参数对冷原子系统中观测结果和系统回作用的影响,揭示了探测裸粒子或准粒子动力学的 regime,并探索了选择性测量准粒子模式的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21146 2026-04-09 math.PR 50%

Boundary behavior of continuous-state interacting multi-type branching processes with immigration

连续态互作多型分支过程与移民的边界行为

Peng Jin, Jiaqi Zhou

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究连续态互作多型分支过程与移民(CIMBI过程)的边界行为,分析其在不同移民率和扩散噪声下是否触及边界,探讨边界接触的概率条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14733 2026-04-09 physics.flu-dyn 50%

Long-Time Asymptotics of Passive Scalar Transport in Periodically Modulated Channels

长时渐进行为的被动标量输运在周期性调制通道中

Lingyun Ding

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究周期性调制通道中被动标量输运的长时渐进行为,通过Floquet-Bloch型特征函数展开推导标量场渐近展开,并估计其有效时间尺度,扩展了Taylor扩散理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12325 2026-04-09 cond-mat.soft cond-mat.stat-mech 50%

Transport of molecules via polymerization in chemical gradients

通过聚合在化学梯度中运输分子

Shashank Ravichandir, Bhavesh Valecha, Pietro Luigi Muzzeddu, Jens-Uwe Sommer, Abhinav Sharma

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用活性载体聚合实现分子定向运输,通过化学梯度产生有效漂移,推导出有效福克-计划克方程,研究活性单元排列对稳态和动态行为的影响及优化方法。

Journal ref (Communication) Soft Matter, 2025, 21, 1835-1840

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07275 2026-04-09 math.PR 50%

Some probabilistic properties and time-changed versions of a renewal process based on Mittag-Leffler waiting times

一些基于 Mittag-Leffler 等待时间的再生过程的概率性质及其时间改变版本

Mostafizar Khandakar, Bratati Pal

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于 Mittag-Leffler 等待时间的再生过程的概率性质及其时间改变版本,探讨了其分布特性、极限行为及在破产理论中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07110 2026-04-09 cond-mat.mtrl-sci 50%

Towards viable H$_2$ storage in Ca decorated low-dimensional materials with insights from reference quantum Monte Carlo

迈向具有钙修饰低维材料的可行氢气存储方法:来自参考量子蒙特卡罗研究的见解

Yasmine S. Al-Hamdani, Dario Alfè, Andrea Zen

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过量子蒙特卡罗方法和密度泛函近似,探讨钙修饰低维材料中氢气的吸附性能,发现钙锚定在碳纳米管和硼掺杂石墨烯上可提升氢吸附能,达到可行存储窗口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07103 2026-04-09 math.NA cs.NA physics.flu-dyn 50%

A new high-order finite-volume advection scheme on spherical Voronoi grids and a comparative study in a mimetic finite-volume moist shallow-water model

一种基于球面Voronoi网格的高阶有限体积输运方案及在拟蒙特卡洛有限体积湿浅水模型中的比较研究

Luan F. Santos, Jeferson B. Granjeiro, Pedro S. Peixoto

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于k-精确重建方法的高阶输运方案,用于球面网格,并在湿浅水模型中与其他方案进行比较,验证其在球面网格上的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03214 2026-04-09 quant-ph 50%

Nelson's Stochastic Mechanics: Measurement, Nonlocality, and the Classical Limit

奈尔的随机力学:测量、非局域性与经典极限

Partha Ghose

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了奈尔随机力学作为非相对论量子力学的随机基础,强调其在解释测量、非局域性和经典极限方面的独特贡献。

Comments 6 pages, no figures; additional supporting paras added

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08028 2026-04-09 stat.ML cs.LG 50%

Computational bottlenecks for denoising diffusions

去噪扩散中的计算瓶颈

Andrea Montanari, Viet Vu

机构 * Department of Statistics and Department of Mathematics, Stanford University(斯坦福大学统计系与数学系) Department of Statistics, Stanford University(斯坦福大学统计系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨了是否所有可采样的分布都能通过扩散过程采样,发现某些分布虽易采样但扩散过程的漂移项难以计算。

Comments 51 pages; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11063 2026-04-09 physics.flu-dyn astro-ph.IM astro-ph.SR cs.NA math.NA 50%

Spectral Difference method with a posteriori limiting: II- Application to low Mach number flows

具有后验限制的谱差方法:II-应用于低马赫数流动

D. A. Velasco-Romero, R. Teyssier

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种高阶谱差方法,用于解决恒星对流中的低马赫数流动和微小扰动问题,通过改进的HLLC解算器和平衡方案,展示了其在捕捉小振幅波动方面的有效性。

Comments 16 pages, 11 figures, Published in MNRAS

Journal ref Monthly Notices of the Royal Astronomical Society, Volume 537, Issue 3, March 2025, Pages 2387, 2402

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10106 2026-04-09 cond-mat.stat-mech cond-mat.soft 50%

Motility-Induced Pinning in Flocking System with Discrete Symmetry

运动诱导钉扎在具有离散对称性的编队系统中

Chul-Ung Woo, Jae Dong Noh

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了在具有离散对称性的自驱动粒子系统中,运动诱导钉扎相变现象,通过蒙特卡洛模拟发现中间对齐相互作用强度下,极序呈现短程空间和时间特性,界面因粒子运动而钉扎,提出解析理论解释钉扎界面生长动态。

Comments 8 pages with 4 figures. Supplementary videos may be available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2604.04746 2026-04-09 cs.CV 83%

Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning

以笔触而非像素思考:通过交错推理实现过程驱动的图像生成

Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang, Weifeng Chen, Markos Georgopoulos, Felix Juefei-Xu, Yuxiang Bao, Julian McAuley, Manling Li, Zecheng He

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of California, San Diego(加州大学圣迭戈分校) Worcester Polytechnic Institute(伍斯特理工学院) Northwestern University(西北大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出过程驱动的图像生成方法,通过交错推理轨迹分解合成过程,通过文本规划、视觉草图、文本反思和视觉细化四个阶段,使生成过程显式、可解释且可监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21714 2026-04-09 cs.CV 57%

AstraNav-World: World Model for Foresight Control and Consistency

AstraNav-World:面向前瞻性控制与一致性的世界模型

Jintao Chen, Junjun Hu, Haochen Bai, Minghua Luo, Xinda Xue, Botao Ren, Chengyu Bai, Shichao Xie, Ziyi Chen, Fei Liu, Zedong Chu, Xiaolong Wu, Mu Xu, Shanghang Zhang

机构 * Amap Alibaba(高德阿里巴巴)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AstraNav-World,通过统一的概率框架联合推理未来视觉状态与动作序列,提升开放动态环境中的导航轨迹精度与成功率,实验表明其在真实场景中具备零样本适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09646 2026-04-09 cs.CV 57%

VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物交互视频

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt

机构 * MPI for Informatics, SIC(马克斯·普朗克信息学研究所,SIC) VIA Center(VIA中心) Google(谷歌)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 VHOI通过运动稠密化将稀疏轨迹转化为HOI掩码序列,再通过视频扩散模型生成可控的人-物交互视频,提出了一种新颖的HOI-aware运动表示,增强了模型对真实交互动态的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2604.06989 2026-04-09 cs.CV cs.AI 79%

Generative Phomosaic with Structure-Aligned and Personalized Diffusion

生成式光拼图:结构对齐与个性化扩散

Jaeyoung Chung, Hyunjin Son, Kyoung Mu Lee

机构 * Seoul National University(首尔大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出首个生成式光拼图方法,通过扩散生成技术实现结构对齐和个性化拼图,克服传统方法在多样性和结构一致性上的限制。

Comments Project page: https://robot0321.github.io/GenerativePhotomosaic/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06327 2026-04-09 cs.SD cs.AI 50%

A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech

一种用于合成语音中说话人漂移检测的新型自动框架

Jia-Hong Huang, Seulgi Kim, Yi Chieh Liu, Yixian Shen, Hongyi Zhu, Prayag Tiwari, Stevan Rudinac, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Georgia Institute of Technology(佐治亚理工学院) Halmstad University(哈尔姆斯塔德大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出一种自动框架,通过将说话人漂移检测转化为语音层面的二元分类任务,利用余弦相似度和大语言模型进行检测,建立了说话人漂移作为独立研究问题的理论基础。

Comments The paper has been accepted by the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2604.07210 2026-04-09 cs.CV 77%

VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis

VersaVogue: 视觉专家协作与偏好对齐的统一时尚合成

Jian Yu, Fei Shen, Cong Wang, Yi Xin, Si Shen, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanjing Forestry University(南京林业大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VersaVogue框架,通过 trait-routing attention 模块和自动化多视角偏好优化管道,实现多条件可控的时尚合成,提升视觉真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19121 2026-04-09 cs.CV cs.AI 57%

MSG Score: Automated Video Verification for Reliable Multi-Scene Generation

MSG Score: 多场景生成的自动化视频验证

Daewon Yoon, Hyeongseok Lee, Wonsik Shin, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSG Score用于评估长视频生成的叙事和视觉一致性,结合Implicit Insight Distillation解决评估与推理速度的平衡,实现可靠且可扩展的视频生成。

Comments 8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏