arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-15 至 2026-04-15 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2604.08386 2026-04-15 cond-mat.stat-mech math-ph math.MP physics.soc-ph 50%

Harmonic morphisms and dynamical invariants in network renormalization

调和映射与网络重整化中的动力学不变量

Francesco Maria Guadagnuolo, Marco Nurisso, Federica Galluzzi, Antoine Allard, Giovanni Petri

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过调和映射理论,在网络重整化中实现动力学内容的精确保留,揭示不同方法的动力学指纹及物理假设,发现拉普拉斯重整化在特定尺度下可实现精确调和映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00179 2026-04-15 physics.chem-ph cs.AI cs.LG 50%

Generative Modeling Enables Molecular Structure Retrieval from Coulomb Explosion Imaging

生成建模使分子结构从库仑爆炸成像中检索

Xiang Li, Till Jahnke, Rebecca Boll, Jiaqi Han, Minkai Xu, Michael Meyer, Maria Novella Piancastelli, Daniel Rolles, Artem Rudenko, Florian Trinter, Thomas J. A. Wolf, Jana B. Thayer, James P. Cryan, Stefano Ermon, Phay J. Ho

机构 * Linac Coherent Light Source(线相干光源) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) European XFEL(欧洲自由电子激光) Max-Planck-Institut für Kernphysik(马克斯·普朗克核物理研究所) Department of Computer Science(计算机科学系) Sorbonne Université, CNRS(索邦大学,CNRS) J. R. Macdonald Laboratory, Department of Physics(J.R. Macdonald实验室,物理系) Fritz-Haber-Institut der Max-Planck-Gesellschaft(马克斯·普朗克学会弗里茨-哈伯研究所) Stanford PULSE Institute(斯坦福PULSE研究所) Argonne National Laboratory(阿贡国家实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用生成模型解决分子结构从离子动量分布中非线性逆问题,实现亚埃精度的结构重建。

Journal ref Nat Commun 17, 3430 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18146 2026-04-15 nlin.PS math.DS 50%

Global Bifurcations and Pattern Formation in Target-Offender-Guardian Crime Models

全局分岔与目标-犯人-守卫犯罪模型中的模式形成

Madi Yerlanov, Qi Wang, Nancy Rodriguez

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了一个反应-对流-扩散模型,用于捕捉城市犯罪与警务互动。通过Crandall-Rabinowitz分岔理论和谱分析,确定了稳态和Hopf分岔的条件,揭示了警务强度临界阈值对空间均匀平衡态稳定性的影响,产生持续异质热点或犯罪-警务周期性波动。

Comments 22 figures, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05682 2026-04-15 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Unified Statistical Theory of Heat Conduction in Nonuniform Media

非均匀介质中热传导的统一统计理论

Yi Zeng, Jianjun Dong

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于Zwanzig投影算子方法推导了热传导的因果双点时空核,统一描述了时间记忆、空间非局域性和材料异质性,并通过不同极限恢复经典扩散、非局部传输和流体动力学模型。

Comments 35 pages, 6 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13571 2026-04-15 cs.SI cs.LG 50%

Influence Strength Estimation in Hyperbolic Space for Social Influence Maximization

在超几何空间中估计影响力强度以实现社会影响力最大化

Hongliang Qiao, Shanshan Feng, Min Zhou, Xutao Li, Yunming Ye, Fan Li, Shuo Shang, Yew-Soon Ong

机构 * The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shenzhen Key Laboratory of Internet Information Collaboration(深圳互联网信息协同重点实验室) University of Electronic Science and Technology of China(电子科技大学) Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出HIM方法,利用超几何表示学习估计用户潜在影响力传播,通过超几何用户表示模块和自适应种子选择模块,提升影响力最大化问题的性能。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.01040 2026-04-15 math.PR math-ph math.MP 50%

5/6-Superdiffusion of energy for coupled charged harmonic oscillators in a magnetic field

六分之五超扩散的能量分布:磁场所耦合带电谐振子系统

Keiji Saito, Makiko Sasada, Hayate Suda

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究磁场所耦合带电谐振子在小随机扰动下的能量分布演化,证明其遵循线性声波玻尔兹曼方程,并证明其分数扩散方程解的极限。

Comments 27 pages

Journal ref Commun. Math. Phys. 372-1 (2019), 151-182

详情

展开后加载摘要…

URL PDF HTML 收藏
0910.3994 2026-04-15 math.PR math-ph math.MP 50%

Hydrodynamic limit for two-species exclusion processes

双物种排斥过程的水动力极限

Makiko Sasada

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究双物种排斥过程的水动力极限,证明在扩散尺度下粒子密度收敛于非线性扩散方程解,并给出有限体积内生成元的谱间隙下界。

Comments 28 pages

Journal ref Stoch. Proc. Appl. 120(2010), 494-521

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2604.12969 2026-04-15 cs.CV 79%

AbdomenGen: Sequential Volume-Conditioned Diffusion Framework for Abdominal Anatomy Generation

AbdomenGen:用于腹部解剖生成的序列体积条件扩散框架

Yubraj Bhandari, Lavsen Dahal, Paul Segars, Joseph Y. Lo

机构 * Center for Virtual Imaging Trials, Dept. of Radiology, Duke University School of Medicine(虚拟成像试验中心,放射科,杜克大学医学部) Dept. of Electrical and Computer Engineering, Pratt School of Engineering, Duke University(电气与计算机工程系,普拉特工程学院,杜克大学) Dept. of Physics, Trinity School of Arts and Sciences, Duke University(物理系,特里尼蒂艺术与科学学院,杜克大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 AbdomenGen提出了一种序列体积条件扩散框架,通过Volume Control Scalar实现可控的腹部解剖生成,实现了高几何保真度和多器官解耦调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12622 2026-04-15 cs.CV cs.AI cs.NI 70%

Efficient Semantic Image Communication for Traffic Monitoring at the Edge

边缘交通监控中的高效语义图像通信

Damir Assylbek, Nurmukhammed Aitymbetov, Marko Ristin, Dimitrios Zorbas

机构 * Nazarbayev University, School of Engineering & Digital Sciences(纳扎尔拜耶夫大学工程与数字科学学院) Zurich University of Applied Sciences (ZHAW)(苏黎世应用科学大学(ZHAW))

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出MMSD和SAMR两种语义图像通信管道,通过压缩和加密实现高效传输,同时保持视觉信息。MMSD用语义表示替代原始图像,SAMR通过语义重要性选择性抑制区域,两者均采用边缘轻量处理与服务器重计算的异构架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13028 2026-04-15 cs.CV 57%

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

融合反演建模生成多样且能引起温度变化的城区植被模式

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga

机构 * Computer Science(计算机科学) Forestry and Natural Resources(林业与自然资源)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出融合预测正模与扩散基生成反模的反演框架,用于生成多样且符合特定温度目标的城区植被模式,解决传统方法在数据稀少时无法捕捉模糊性的不足。

Comments Accepted to the CVPR 2026 EarthVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12322 2026-04-15 cs.CV 57%

Self-Adversarial One Step Generation via Condition Shifting

通过条件位移实现自对抗一步生成

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin

机构 * Westlake University(西拉丘学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出APEX框架,通过条件位移内生提取对抗信号,实现无需外部判别器的一步生成,提升生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 57%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 可控生成 :image generation(abstract);分类 cs.MM

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11843 2026-04-15 cs.CV 57%

UniMark: Unified Adaptive Multi-bit Watermarking for Autoregressive Image Generators

UniMark: 为自回归图像生成器设计的统一自适应多比特水印方案

Yigit Yilmaz, Elena Petrova, Mehmet Kaya, Lucia Rossi, Amir Rahman

机构 * Bandırma Onyedi Eylül University(班迪马奥克西迪埃普大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniMark提出一种无需训练的统一水印框架,解决自回归图像生成中水印嵌入能力弱、安全性和通用性差的问题,通过自适应语义分组、块级多比特编码和统一令牌替换接口实现高质量图像保护和多比特信息传输。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12153 2026-04-15 math.OC 50%

Nonlinear Stochastic Optimal Control and Optimal Stopping using the Fokker-Planck Transformation

非线性随机最优控制与最优停止的福克-计划克变换

Akan Selim, Siddhartha Ganguly, Ali Pakniyat, Panagiotis Tsiotras

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种非线性随机最优控制与最优停止的理论框架,通过建立扩散过程的密度确定性表示,推导出确定性特征动力学,复现随机系统的边际规律,并利用Stein型恒等式展示分布动态规划方程与分布随机Hamilton-Jacobi-Bellman公式的相同二阶微分算子。

Comments 40 pages, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2604.12270 2026-04-15 cs.CV 83%

DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos

DreamStereo: 向HD视频的实时立体修复迈进

Yuan Huang, Sijie Zhao, Jing Cheng, Hao Xu, Shaohui Jiao

机构 * ByteDance(字节跳动)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出DreamStereo,通过梯度感知视差扭曲、视差双投影和稀疏感知立体修复三个组件,解决立体修复中的数据稀缺和计算冗余问题,实现HD视频25FPS的实时处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12251 2026-04-15 cs.CV 57%

ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models

ArtifactWorld: 通过视频生成模型扩展3D高斯散射体修复

Xinliang Wang, Yifeng Shi, Zhenyu Wu

机构 * Ke Holdings Inc.(凯控股公司) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ArtifactWorld框架,通过系统数据扩展和双模型范式解决3DGS修复问题,利用视频扩散骨干网络和Artifact-Aware Triplet Fusion机制提升稀疏视图合成和3D重建性能。

Comments The second author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2604.12281 2026-04-15 cs.CV cs.AI 57%

MAST: Mask-Guided Attention Mass Allocation for Training-Free Multi-Style Transfer

MAST:基于掩码的注意力质量分配用于无训练多风格迁移

Dongkyung Kang, Jaeyeon Hwang, Junseo Park, Minji Kang, Yeryeong Lee, Beomseok Ko, Hanyoung Roh, Jeongmin Shin, Hyeryung Jang

机构 * Division of Computer Science and Artificial Intelligence, Dongguk University(计算机科学与人工智能系,东国大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MAST提出一种无训练框架,通过布局保留查询锚定、注意力质量分配、温度缩放和细节注入模块,实现多风格迁移中无边界伪影和结构一致性的保持。

Comments 16 pages, 16 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2604.12163 2026-04-15 cs.CV 85%

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image:稀疏MoE用于图像生成

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

机构 * Nucleus AI Team(Nucleus AI 团队)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11626 2026-04-15 cs.AI cs.LG 50%

RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time

RationalRewards: 基于理性反馈的视觉生成推理奖励

Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Alibaba(阿里巴巴)

专题命中 图像生成评测 :text-to-image(abstract)

AI总结 RationalRewards通过显式多维反馈提升视觉生成模型,训练时提供可解释奖励,测试时通过生成-反馈-优化循环改进输出,无需参数更新。

Comments Project Page: https://tiger-ai-lab.github.io/RationalRewards/ ; Code, Dataset, Models are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24626 2026-04-15 q-bio.GN cs.LG stat.ML 50%

A Large-Scale Comparative Analysis of Imputation Methods for Single-Cell RNA Sequencing Data

单细胞RNA测序数据中插补方法的大规模比较分析

Yuichiro Iwashita, Ahtisham Fazeel Abbasi, Koichi Kise, Andreas Dengel, Muhammad Nabeel Asim

机构 * RPTU University Kaiserslautern-Landau, Department of Computer Science(莱茵-瓦尔登堡大学凯撒斯劳滕-兰道分校计算机科学系) German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Graduate School of Informatics, Osaka Metropolitan University(大阪 Metropolitan 大学信息研究生院) intelligentX GmbH (intelligentX.com)(intelligentX GmbH(intelligentX.com))

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文通过对比15种单细胞RNA测序数据插补方法,发现传统方法在基因表达恢复上优于深度学习方法,但生物可解释性差异显著,强调了任务特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2604.12463 2026-04-15 cs.CV cs.AI 57%

Euler-inspired Decoupling Neural Operator for Efficient Pansharpening

受欧拉启发的解耦神经算子用于高效全色增强

Anqi Zhu, Mengting Ma, Yizhen Jiang, Xiangdong Li, Kai Zheng, Jiaxin Li, Wei Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Computer Science and Technology , Chongqing University of Post and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EDNO框架,通过欧拉公式将特征转换为极坐标系统,实现显式-隐式交互机制,提升全色增强的效率与性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23026 2026-04-15 cs.AI cs.RO 50%

Mixed-Density Diffuser: Efficient Planning with Non-Uniform Temporal Resolution

混合密度扩散器:非均匀时间分辨率下的高效规划

Crimson Stambaugh, Rajesh P. N. Rao

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, USA(保罗·G·艾伦计算机科学与工程学院,华盛顿大学,西雅图,美国)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出混合密度扩散器,通过可调超参数实现规划时间分辨率的非均匀分布,提升在D4RL任务中的规划效率与性能。

Comments European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2604.12318 2026-04-15 cs.CV 57%

Cell Instance Segmentation via Multi-Task Image-to-Image Schrödinger Bridge

基于多任务图像到图像Schrödinger桥的细胞实例分割

Hayato Inoue, Shota Harada, Shumpei Takezaki, Ryoma Bise

机构 * Dept. of Information Science and Technology(信息科学与技术系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出基于Schrödinger桥的多任务图像到图像生成框架,通过反向距离图实现边界感知监督,无需预训练或后处理即可在PanNuke和MoNuSeg数据集上实现竞争性或优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏