arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-18 至 2026-05-18 共收录 95 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 75 篇

2605.14344 2026-05-18 cs.AI 50%

CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

CrystalReasoner: 基于推理和强化学习的性质条件晶体结构生成

Yuyang Wu, Stefano Falletta, Delia McGrath, Sherry Yang

机构 * Tsinghua University(清华大学) Radical AI New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 CrystalReasoner通过引入物理先验和强化学习,实现从自然语言指令生成稳定且具有特定性质的晶体结构,提升了生成精度和科学合理性。

Comments Our work is available at https://crystalreasoner.github.io/, with code at https://github.com/wyy603/CrystalReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11429 2026-05-18 math.OC 50%

From Schrodinger Bridge to Optimal Transport over Sub-Riemannian Manifolds

从施罗德inger桥到子黎曼流形上的最优运输

Daniel Owusu Adu, Karthik Elamvazhuthi, Bahman Gharesifard

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究在水平束约束下重塑概率分布的最小能耗方式,提出通过引入熵正则化得到连续可计算的施罗德inger桥问题,并在子黎曼流形上获得退化扩散过程,最终提出一种Sinkhorn型算法用于求解施罗德inger势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20821 2026-05-18 cond-mat.dis-nn cond-mat.stat-mech 50%

Autonomous Emergence of Hamiltonian in Deep Generative Models

深度生成模型中哈密顿量的自主涌现

Wenjie Xi, Wei-Qiang Chen

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨深度生成模型是否能自主推导物理规律,通过构建代数框架提取隐含相互作用,验证生成模型能自主恢复自旋系统微观哈密顿量参数。

Comments 9 pages, 4 figures, find code in: https://github.com/WJXI/emergent-Hamiltonian-from-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09631 2026-05-18 cs.DC cs.AI 50%

Hardware Utilization and Inference Performance of Edge Object Detection Under Fault Injection

边缘目标检测在故障注入下的硬件利用与推断性能

Faezeh Pasandideh, Mehdi Azarafza, Achim Rettberg

机构 * Hamm-Lippstadt University of Applied Sciences (HSHL)(哈姆-利普施塔特应用科学大学(HSHL))

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过故障注入测试评估了TensorRT优化的YOLO模型在边缘平台上的硬件行为,发现其在资源降级下保持稳定性能,为边缘推断可靠性提供硬件层面的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24550 2026-05-18 cs.LG cs.SD 50%

Training-Free Multimodal Guidance for Video to Audio Generation

无需训练的多模态引导用于视频到音频生成

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecomm., Sapienza University of Rome, Italy(信息工程、电子与电信系,罗马大学萨皮恩扎)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出无需训练的多模态引导机制,用于视频到音频扩散生成,通过模态嵌入跨度强制视频、音频和文本的一致对齐,提升生成质量与多模态对齐效果。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00867 2026-05-18 physics.comp-ph 50%

Self-supervised neural operator for solving partial differential equations

自监督神经算子用于求解偏微分方程

Wen You, Shaoqian Zhou, Xuhui Meng

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出自监督神经算子,通过无需数值求解器生成高质量训练数据,高效求解偏微分方程,且轻量微调进一步提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15255 2026-05-18 physics.flu-dyn 50%

Mixing Fronts in Smooth Chaotic Flows

光滑混沌流中混合前沿

Heyman Joris, Le Borgne Tanguy, Lester Daniel

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究光滑混沌流中混合前沿的标量波动,提出理论框架描述其演化,推导出浓度方差的闭合表达式,适用于不同皮克数范围的模拟结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13216 2026-05-18 math.NA cs.NA 50%

On a linear DG approximation of chemotaxis models with damping gradient nonlinearities

关于具有阻尼梯度非线性项的趋化模型线性DG近似

Daniel Acosta-Soba, Alessandro Columbu, J. Rafael Rodríguez-Galván

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种新的线性、正性保持的迎风不连续Galerkin方法,用于求解具有阻尼梯度非线性项的趋化模型,通过数值实验验证了该方法能有效防止趋化崩溃。

Comments 20 pages, 7 figures

Journal ref Mathematical Analysis and Approximation of PDE-Chemotaxis Models. ECM 2024. SEMA SIMAI Springer Series, vol 43. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13767 2026-05-18 cond-mat.stat-mech cond-mat.str-el hep-th quant-ph 50%

Hot band sound

热带声

Vir B. Bulchandani, David A. Huse

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过调控粒子相互作用,使高温下混沌费米子晶格模型从过阻尼扩散转为欠阻尼的热带声,展示高温度下单带中强相互作用非积分系统中电荷密度声波的欠阻尼特性。

Comments v3: 6+6 pages, 6 figures. Text revised for clarity, references added, kinetic theory refined to predict an infinite set of quasiconserved modes. Title differs from published version

Journal ref Phys. Rev. B 113, 195410 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15634 2026-05-18 math.AP 50%

Sharp threshold for a one-dimensional thin film equation in the supercritical case

一维薄膜方程在超临界情况下的尖锐阈值

Shen Bian

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了一维薄膜方程中聚集与排斥的竞争效应,证明了在超临界情况下,存在唯一的非负径向递减稳态解,并通过自由能分析确定了有限时间爆破的临界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15557 2026-05-18 cs.CL cs.LG 50%

When Latent Geometry Is Not Enough: Draft-Conditioned Latent Refinement for Non-Autoregressive Text Generation

当潜在几何不足以:非自回归文本生成的草稿条件潜在细化

De Shuai Zhang

机构 * Technical Report v1, May 2026(技术报告v1,2026年5月)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过草稿条件潜在细化模型提升非自回归文本生成效果,发现潜在几何本身不足以保证生成质量,需结合解码器可读性与结构保持。

Comments 17 pages, 1 figure, 6 tables. Technical Report v1. Stage 1 complete; Stage 2 ongoing Code: https://github.com/saslifat-gif/structured-latent-text-refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15501 2026-05-18 math.PR math.AP 50%

Well-posedness of the obstacle problem for generalized Dean-Kawasaki equation

广义Dean-Kawasaki方程障碍问题的适定性

Ruoyang Liu, Rangrang Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究由相关保守噪声驱动的广义Dean-Kawasaki方程障碍问题,通过动能解的存在性、唯一性和L^1稳定性建立,结合动能特征的Skorokhod条件和障碍项的反射测度描述,扩展了随机偏微分方程障碍问题理论至退化方程类。

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15451 2026-05-18 physics.flu-dyn 50%

On the fundamental solution for viscous internal waves and Brinkman flows. Part 1. Two dimensions

关于粘性内波和Brinkman流的基本解。第一部分:二维情况

Saikumar Bheemarasetty, Stefan G. Llewellyn Smith

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了均匀分层介质中单色内波和各向异性Brinkman流的粘性扩散基本解,通过单积分形式给出,适用于边界积分方法,并推导了远场渐进行为,揭示了Prandtl数影响下的波场特性及各向异性流体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03548 2026-05-18 cs.LG cs.AI 50%

PerFlow: Physics-Embedded Rectified Flow for Efficient Reconstruction and Uncertainty Quantification of Spatiotemporal Dynamics

PerFlow:嵌入物理的修正流用于高效重建和时空动态的不确定性量化

Hao Zhou, Rui Zhang, Han Wan, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 PerFlow通过分离观测条件与物理约束,利用修正流动态实现无引导的观测条件输入,结合约束保持投影嵌入硬物理约束,实现高效稀疏重建和不确定性量化。

Comments 17 pages, 8 figures. Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15598 2026-05-18 nlin.CG q-bio.QM stat.AP 50%

When do trajectories matter? Identifiability analysis for stochastic transport phenomena

轨迹何时重要?随机传输现象的可识别性分析

Matthew J Simpson, Michael J Plank

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在随机传输现象中,仅使用计数数据或轨迹数据对模型参数进行识别的可行性,结合多种方法揭示了结构不可识别性问题及实验设计对推断精度的影响。

Comments 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08302 2026-05-18 cs.LG cs.AI 50%

DMax: Aggressive Parallel Decoding for dLLMs

DMax:用于dLLMs的激进并行解码

Zigeng Chen, Gongfan Fang, Xinyin Ma, Ruonan Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DMax通过改进并行解码方法,有效缓解误差累积,提升生成质量。其核心是On-Policy Uniform Training策略,结合Soft Parallel Decoding实现高效统一的掩码和均匀解码。

Comments Working in progress. Code is available at: https://github.com/czg1225/DMax

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09297 2026-05-18 cs.LG 50%

Laplacian Heads Improve Transformers by Smoothing Token Representations

拉普拉斯头通过平滑标记表示来改进变换器

Yuchong Zhang, Vardan Papyan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出在变换器中引入拉普拉斯头,通过平滑标记表示提升性能,发现特定形式的平滑对任务有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00692 2026-05-18 astro-ph.HE 50%

Hadronic Origin of Sub-PeV Gamma-Ray Emission from LHAASO J0621+3755

脉冲星周围亚皮电子伏级伽马射线发射的hadronic起源

Sonali Sahoo, Ankan Roy, Kritika Yadav, Reetanjali Moharana

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过考虑质子-质子相互作用通道,探讨了脉冲星周围亚皮电子伏级伽马射线的hadronic起源,发现需要约0.14倍的宇宙射线质子亮度,质子在超扩散环境中传播。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12038 2026-05-18 cond-mat.soft cond-mat.stat-mech 50%

Emergence of Periodic Potential for Point Defects in a 2D Hexagonal Colloidal Lattice

二维六边形胶体晶体中点缺陷布朗运动的周期性势能涌现

Huang Xicheng, Liu Zefei, Chen Yong-Cong, Yang Guohong, Ao Ping

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分析实验轨迹揭示了二维六边形胶体晶体中点缺陷的布朗运动,发现其周期性势能结构及扩散矩阵的时空变化特性,结合理论分析揭示了有效能量景观。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 1 篇

2605.14716 2026-05-18 cs.GR cs.CV cs.LG 73%

AnchorRoute: Human Motion Synthesis with Interval-Routed Sparse Contro

AnchorRoute: 通过区间路由稀疏控制的人体运动合成

Pengcheng Fang, Tengjiao Sun, Dongjie Fu, Xiaoyu Zhan, Yanwen Guo, Hansung Kim, Xiaohao Cai

机构 * University of Southampton(索姆塞特大学) Mogo AI Ltd.(Mogo AI有限公司) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 AnchorRoute通过稀疏锚点实现人体运动合成,结合生成与细化过程,提升稀疏控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2605.15921 2026-05-18 cs.CV 70%

AdaEraser: Training-Free Object Removal via Adaptive Attention Suppression

AdaEraser:通过自适应注意力抑制实现无训练对象去除

Dingming Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 图像修复 :image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出AdaEraser框架,通过动态调节注意力机制实现对象去除,解决无训练方法中盲目抑制注意力导致生成质量下降的问题,实验表明其在对象去除任务中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV 57%

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2605.15309 2026-05-18 cs.CV 57%

One Pass Is Not Enough: Recursive Latent Refinement for Generative Models

一次不够:生成模型的递归潜在细化

Mehdi Esmaeilzadeh, Alexia Jolicoeur-Martineau, Chirag Vashist, Ke Li

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出RTM方法,通过递归细化提升生成模型的多样性和覆盖范围,改进了FID指标下的精度和召回率,适用于多个数据集和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 4 篇

2504.18361 2026-05-18 cs.CV cs.AI 79%

COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations

COCO-Inpaint:用于检测和定位基于修补的图像篡改的基准

Haozhen Yan, Yan Hong, Jiahui Zhan, Suning Lang, Yikun Ji, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出COCO-Inpaint基准,用于检测和定位基于修补的图像篡改,通过高质样本、多样场景和大规模覆盖,揭示修补与真实区域的内在不一致。

Comments 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15246 2026-05-18 cs.LG 50%

Privacy Evaluation of Generative Models for Trajectory Generation

轨迹生成生成模型的隐私评估

Stavros Bouras, Ioannis Kontopoulos, Chiara Pugliese, Francesco Lettich, Emanuele Carlini, Hanna Kavalionak, Chiara Renso, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典) Institute of Information Science and Technologies, National Research Council (CNR)(信息科学与技术研究所,国家研究委员会(CNR)) Institute of Informatics and Teletematics, National Research Council (CNR)(信息学与电信研究所,国家研究委员会(CNR))

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文研究生成模型在轨迹生成中的隐私评估问题,揭示现有方法在隐私保护方面的不足,并通过成员推断攻击证明生成模型仍存在隐私风险。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 50%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18527 2026-05-18 math.NA cs.NA 50%

Neural Preconditioned Born Series: A Metric-Matched Framework for Learning-based Preconditioners

神经预条件Born级数:一种与度量匹配的基于学习的预条件器框架

Juntao Wang, Jiwei Jia, Xinliang Liu

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出Neural Preconditioned Born Series (NPBS),通过将Born级数迭代转换为移位拉普拉斯左预条件,结合学习的残差到修正映射,提升了在异质Helmholtz问题中的求解效率,减少迭代次数,并在多种PDE系统中验证了残差度量匹配的通用性。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 7 篇

2605.15592 2026-05-18 cs.CV 79%

Efficient Image Synthesis with Sphere Latent Encoder

高效图像合成与球形潜在编码器

Tung Do, Thuan Hoang Nguyen, Hao Li

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·拉希德人工智能大学)

专题命中 效率与蒸馏 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出分离的固定预训练图像编码器和球形潜在去噪模型,提高效率并独立优化重建与生成。在多个数据集上,方法在生成质量和推理速度上优于Sphere Encoder。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13108 2026-05-18 cs.CV 57%

DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection

DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调

Jiazhen Yan, Ziqiang Li, Fan Wang, Boyu Wang, Ziwen He, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) University of Macau(澳门大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 57%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏