arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-03 至 2026-04-03 共收录 65 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 48 篇

2604.01552 2026-04-03 cs.LG 71%

ZEUS: Accelerating Diffusion Models with Only Second-Order Predictor

ZEUS:仅使用二阶预测器加速扩散模型

Yixiao Wang, Ting Jiang, Zishan Shao, Hancheng Ye, Jingwei Sun, Mingyuan Ma, Jianyi Zhang, Yiran Chen, Hai Li

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Computer Science, Duke University(杜克大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系)

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29807 2026-04-03 cs.MS cs.NA math.NA 71%

BioNetFlux: A Python Framework for Reaction--Diffusion--Chemotaxis Simulations on One-Dimensional Network Geometries

BioNetFlux:一种用于在一线性网络几何上进行反应-扩散-趋化模拟的Python框架

Silvia Bertoluzza

专题命中 扩散模型 :diffusion(title)

AI总结 BioNetFlux采用混合不连续伽辽金方法,用于在一线性多弧网络上模拟耦合的偏微分方程系统,适用于微流控器官芯片、血管网络和体外细胞迁移实验中的生物运输现象研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 70%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01826 2026-04-03 cs.CV 70%

SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

SafeRoPE: 针对Rectified Flow Transformers中安全生成的头部嵌入旋转

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SafeRoPE,通过头部嵌入旋转和风险评分抑制MMDiT生成中的危险内容,保持生成质量。

Comments CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02105 2026-04-03 eess.IV cs.CV 57%

DenOiS: Dual-Domain Denoising of Observation and Solution in Ultrasound Image Reconstruction

DenOiS:超声图像重建中观测与解的双域去噪

Can Deniz Bezek, Orcun Goksel

机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息技术系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DenOiS通过双域去噪提升超声图像重建质量,结合观测修正与扩散基PnP方法,在模拟训练中实现高保真重建,适用于定量超声成像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17585 2026-04-03 eess.IV cs.CV cs.LG 57%

SkinGenBench: Generative Model and Preprocessing Effects for Synthetic Dermoscopic Augmentation in Melanoma Diagnosis

SkinGenBench: 生成模型与预处理对合成皮肤镜增强在黑色素瘤诊断中的影响

N. A. Adarsh Pritam, Jeba Shiney O, Sanyam Jain

机构 * Alliance School of Advanced Computing, Alliance University, India(印度联盟大学高级计算学院) Department of Computer Science and Communication, Østfold University College, 1783 Halden, Norway(挪威东福尔大学学院计算机科学与传播系) Department of Dentistry and Oral Health, Aarhus University, 8000 Aarhus, Denmark(丹麦奥胡斯大学牙科与口腔健康系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SkinGenBench,研究预处理复杂性与生成模型选择对合成皮肤镜图像增强及黑色素瘤诊断的影响,通过评估StyleGAN2-ADA和DDPMs生成模型在不同预处理下的性能,发现生成模型架构对图像质量和诊断效果影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01994 2026-04-03 cs.CV 57%

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

Resonance4D: 频域运动监督用于预设-free 物理参数学习的4D动态物理场景模拟

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang

机构 * Xidian University(西安电子科技大学) Jimei University(集美大学) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Resonance4D通过结合3D高斯散射与物质点方法,提出轻量且物理表达的监督策略,解决动态一致性问题,减少训练成本和内存开销,实现高保真的4D物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01964 2026-04-03 cs.CV 57%

Automated Prostate Gland Segmentation in MRI Using nnU-Net

使用nnU-Net进行MRI中前列腺的自动分割

Pablo Rodriguez-Belenguer, Gloria Ribas, Javier Aquerreta Escribano, Rafael Moreno-Calatayud, Leonor Cerda-Alberich, Luis Marti-Bonmati

机构 * Biomedical Imaging Research Group (GIBI230), Instituto de Investigación Sanitaria La Fe, Valencia, Spain(生物医学影像研究组(GIBI230),拉菲健康研究所,巴伦西亚,西班牙)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于nnU-Net的深度学习方法,利用多模态MRI数据实现前列腺自动分割,通过交叉验证和外部验证显示其高精度和泛化能力,优于通用工具。

Comments 9 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV 57%

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 57%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02271 2026-04-03 cond-mat.soft cond-mat.stat-mech 50%

The "Intensity" Countoscope: Measuring particle dynamics in real space from microscopy images

强度计数镜:从显微图像中测量粒子动力学

Sophie Hermann, Seyed Saman Banarooei, Adam Carter, Carlos A. Silvera Batista, Sophie Marbach

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种新的实空间方法,通过分析显微图像中虚拟观察框内的强度波动,揭示了强度均方变化随时间的变化规律,并应用于稀释胶体悬浮液中提取扩散系数。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28764 2026-04-03 cs.LG cs.AI math.DG q-bio.NC 50%

Geometry-aware similarity metrics for neural representations on Riemannian and statistical manifolds

基于几何的相似度度量用于Riemannian和统计流形上的神经表示

N Alex Cayco-Gajic, Arthur Pellegrino

机构 * Département d’Etudes Cognitives, École Normale Supérieure – PSL(认知研究系,巴黎高等师范学院 – 巴黎文理研究大学) Gatsby Unit, University College London(盖茨比计算神经科学单元,伦敦大学学院) Département d’Informatique, École Normale Supérieure – PSL(计算机科学系,巴黎高等师范学院 – 巴黎文理研究大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出MSA方法,利用Riemannian几何工具比较神经表示的内在几何,用于解纠缠深度网络特征、比较非线性动态和研究扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08549 2026-04-03 physics.ins-det hep-ex 50%

A journey to ITACA: Ion Tracking with Ammonium Cations Apparatus

走向ITACA:离子跟踪与铵离子装置

J. J. Gómez-Cadenas, L. Arazi, M. Elorza, Z. Freixa, F. Monrabal, A. Pazos, J. Renner, S. R. Soleti, S. Torelli

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过引入铵离子成像技术,提升气体氙电致发光时间投影室对单电子与双电子轨迹的区分能力,从而有效抑制背景,提高0νββ衰变探测的发现潜力。

Comments 17 pages, 14 figures

Journal ref Eur. Phys. J. C 86, 320 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01990 2026-04-03 q-bio.QM 50%

Evaluating Deep Surrogate Models for Knee Joint Contact Mechanics Under Input-Limited Conditions

评估在输入受限条件下用于膝关节接触力学的深度替代模型

Zhengye Pan, Jianwei Zuo, Jiajia Luo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在输入受限条件下不同替代模型在膝关节接触力学中的性能,发现混合模型在全输入条件下表现最佳,但在输入受限时需根据任务需求选择最优模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01815 2026-04-03 astro-ph.HE 50%

The impact of the eROSITA bubbles on Galactic cosmic-ray transport

eROSITA气泡对银河宇宙射线输运的影响

Benedikt Schroer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出银河射流而非微观散射特性导致射线能谱变硬,通过现象学模型显示 advective 流边界可复现二次到一次比值的300 GV硬化,与AMS-02数据和多波段约束一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01812 2026-04-03 math.AP 50%

Morphoelastic Growth in the Presence of Nutrients at Small Strains

营养存在下小应变的形态弹性生长模型

Helmut Abels, Julian Blawid, Georg Dolzmann

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究营养物质吸收驱动的形态弹性生长,通过弹性应力和营养浓度的耦合方程,建立小应变下的生长模型并证明解的存在性和唯一性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01602 2026-04-03 econ.GN q-fin.EC 50%

Persistent geographical biases in global scientific collaboration and citations

全球科学合作与引用中的持久地理偏见

Leyan Wu, Yong Huang, Wei Lu, Akrati Saxena, Vincent Traag

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分析合作与引用两种渠道,发现地理距离对合作的限制效应增强,而引用流动对空间接近不敏感,揭示全球科学中的结构性地理与国家偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01566 2026-04-03 cond-mat.mtrl-sci 50%

Abrupt crystallization from shock-compressed CaSiO3 glass

冲击压缩CaSiO3玻璃的突然结晶

A. Amouretti, K. Nonaka, X. Liu, Y. Hironaka, H. Huang, R. Kodama, K. Lawler, K. Miyanishi, H. Nakamura, C. Schwartz, Y. Seto, K. Sueda, Y. Wu, M. Yabashi, T. Yabuuchi, N. Ozaki

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过100GPa下原位时间分辨X射线衍射,发现CaSiO3玻璃在极端压力下快速结晶,核化时间1.69±0.10ns,最终晶粒尺寸约20nm,表明扩散控制转变,同时释放波可能影响核化过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01481 2026-04-03 cs.LG cs.AI 50%

DISCO-TAB: A Hierarchical Reinforcement Learning Framework for Privacy-Preserving Synthesis of Complex Clinical Data

DISCO-TAB:一种用于隐私保护合成复杂临床数据的分层强化学习框架

Arshia Ilaty, Hossein Shirazi, Amir Rahmani, Hajar Homayouni

机构 * Computational Science Research Center, San Diego State University(圣地亚哥州立大学计算科学研究中心) School of Nursing and Department of Computer Science, University of California, Irvine(加州大学尔湾分校护理学院与计算机科学系) Fowler College of Business, San Diego State University(圣地亚哥州立大学福勒商学院) Department of Computer Science, San Diego State University(圣地亚哥州立大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出DISCO-TAB框架,结合微调LLM与多目标判别器,通过强化学习优化,解决临床数据生成中的复杂依赖和类别不平衡问题,提升合成数据的临床有效性与统计真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01357 2026-04-03 math.AP q-bio.CB 50%

Cell Migration Boundary Motion in Drosophila Egg Chambers: A Combined Phase Field and Chemoattractant Model

果蝇卵泡中细胞迁移边界运动:一种结合相场和趋化因子模型

Naghmeh Akhavan, Alexander George, Michelle Starz-Gaiano, Bradford E. Peercy

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过相场与趋化因子模型,揭示果蝇卵泡中边细胞迁移受趋化因子分布和组织几何结构的影响,展示信号定位与几何结构共同调控迁移方向性和速度。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01335 2026-04-03 cs.CE cs.LG 50%

Bias Inheritance in Neural-Symbolic Discovery of Constitutive Closures Under Function-Class Mismatch

神经符号发现中因式类不匹配下的偏置继承

Hanbing Liang, Ze Tao, Fujun Liu

机构 * Nanophotonics and Biophotonics Key Laboratory of Jilin Province, School of Physics, Changchun University of Science and Technology(吉林省纳米光子学与生物光子学重点实验室,物理学院,长春理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在非线性反应扩散系统中利用数据驱动方法发现构成闭合关系的鲁棒性,提出三阶段神经符号框架,揭示了因式类不匹配下偏置继承机制,强调了初始数值反问题对神经符号建模的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01294 2026-04-03 astro-ph.GA 50%

Tree-ring structure of Galactic bar resonance in N-body simulations

银河棒共振的年轮结构:N体模拟研究

Rimpei Chiba, Michiko Fujii, Junichi Baba, John Dubinski, Ralph Schönrich

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过N体模拟研究银河棒共振的相空间结构,发现即使在存在扰动的情况下,年轮结构仍能保持,表明棒的自转减慢与暗物质晕有关。

Comments 21 pages, 14 figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01247 2026-04-03 cs.SD eess.AS 50%

Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS

结合掩码语言建模与跨模态对比学习的语调感知语音合成

Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov, Nikita Vasiliev, Mikhail Gorodnichev, Grach Mkrtchian

机构 * MTUCI(莫斯科电信与信息技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于扩散模型的语音合成中多阶段预训练对语调建模的影响,通过掩码语言建模与混合音素对比学习相结合,提升了生成质量与感知指标。

Comments This paper has been submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00394 2026-04-03 cs.LG cs.AI 50%

Deep Networks Favor Simple Data

深度网络偏好简单数据

Weyl Lu, Chenjie Hao, Yubei Chen

机构 * UC Davis, USA(美国加州大学戴维斯分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究发现深度网络在不同模型中均倾向于高密度的简单数据,通过引入两种密度估计方法,验证了简单数据在测试集和OOD对中均获得更高估计密度。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2604.01361 2026-04-03 cs.CV 79%

IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation

IGLOSS:面向激光雷达开放词汇语义分割的图像生成

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,用于3D汽车激光雷达数据的零样本开放词汇语义分割。通过文本生成图像创建原型,利用2D视觉基础模型提取3D网络特征,实现点云标注,方法在nuScenes和SemanticKITTI上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10720 2026-04-03 cs.LG 67%

Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality

超越黑箱:通过因果最小性在生成模型中实现可识别的解释与控制

Lingjing Kong, Shaoan Xie, Guangyi Chen, Yuewen Sun, Xiangchen Song, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过因果最小性原则,在生成模型中建立可解释性基础,提出层级选择模型框架,实现对生成模型的可控性与解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02222 2026-04-03 cs.CV 57%

SCALE: Semantic- and Confidence-Aware Conditional Variational Autoencoder for Zero-shot Skeleton-based Action Recognition

SCALE:语义和置信度感知的条件变分自编码器用于零样本骨骼动作识别

Soroush Oraki, Feng Ding, Jie Liang

机构 * School of Engineering Science, Simon Fraser University(西蒙菲莎大学工程科学学院) School of Information Science and Technology, Eastern Institute of Technology(东方理工信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SCALE通过语义和置信度感知的条件变分自编码器,解决零样本骨骼动作识别中的语义混淆和细粒度动态问题,提升未见过类的识别性能。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06499 2026-04-03 cs.CV cs.AI 57%

ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis

ExGes:基于音频驱动的 gesture 合成中的 expressive 人类运动检索与调节

Xukun Zhou, Fengxin Li, Ming Chen, Yan Zhou, Pengfei Wan, Di Zhang, Yeying Jin, Zhaoxin Fan, Hongyan Liu, Jun He

机构 * Renmin University(中国人民大学) Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ExGes框架,通过运动库构建、运动检索模块和精度控制模块,提升音频驱动手势合成的表达性和与音频语义的一致性,实验表明其在Fréchet Gesture Distance和运动多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01364 2026-04-03 math.AP 50%

Nonlocal-to-local convergence of the $p$-Biharmonic evolution equation with the Dirichlet boundary condition

Kehan Shi, Yi Ran

专题命中 可控生成 :inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏