arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-23 至 2026-04-23 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2604.12652 2026-04-23 cs.CV cs.AI 79%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19976 2026-04-23 cs.CV 57%

Lucky High Dynamic Range Smartphone Imaging

幸运高动态范围智能手机成像

Baiang Li, Ruyu Yan, Ethan Tseng, Zhoutong Zhang, Adam Finkelstein, Jiawen Chen, Felix Heide

机构 * Princeton University(普林斯顿大学) Adobe(Adobe公司)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于轻量级网络的智能手机成像方法,通过线性RAW像素间接捕捉高动态范围,避免幻觉伪影,验证了其在合成和真实图像上的泛化能力。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2604.20258 2026-04-23 cs.CV 83%

Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing

重新思考编辑位置:面向任务的指令式图像编辑定位

Jingxuan He, Xiyu Wang, Mengyu Zheng, Xiangyu Zeng, Yunke Wang, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的任务感知编辑定位框架,通过分析源和目标图像流,提升非编辑区域一致性并保持指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20038 2026-04-23 cs.CV 70%

FluSplat: Sparse-View 3D Editing without Test-Time Optimization

FluSplat:无需测试时优化的稀疏视角3D编辑

Haitao Huang, Shin-Fang Chng, Huangying Zhan, Qingan Yan, Yi Xu

机构 * Goertek Alpha Labs(科特克阿尔法实验室)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种无需测试时优化的稀疏视角3D编辑框架,通过图像域中的跨视角正则化方案实现视图一致性,提升编辑质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV 70%

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 46 篇

2510.04525 2026-04-23 cs.LG math.PR stat.ML 87%

Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion

解析MaskGIT采样器及其超越:在Masked Diffusion中的自适应顺序选择

Satoshi Hayakawa, Yuhta Takida, Masaaki Imaizumi, Hiromi Wakaki, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文分析了MaskGIT采样器的隐含温度采样机制,提出更易解释的moment采样器,并通过部分缓存技术和混合方法改进了选择-采样算法,验证了理论并提升了实际性能。

Comments 23 pages, fixed cleveref-related issue

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20354 2026-04-23 cs.CV 85%

Hallucination Early Detection in Diffusion Models

扩散模型中的幻觉早期检测

Federico Betti, Lorenzo Baraldi, Lorenzo Baraldi, Rita Cucchiara, Nicu Sebe

机构 * University of Trento(特伦托大学) Università di Pisa(比萨大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEaD+方法,通过整合交叉注意力图和文本信息,早期检测扩散模型生成中的幻觉问题,提高生成完整图像的准确率并减少生成时间。

Comments 21 pages, 6 figures, 4 tables. Published in International Journal of Computer Vision (IJCV)

Journal ref Int. J. Comput. Vis. 134, 35 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 84%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 83%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20796 2026-04-23 cs.CV 83%

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解和生成

Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, Qi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan Wu, Yi Xin, Junbo Zhao

机构 * AGI Research Center, Inclusion AI(AGI研究中心,Inclusion AI)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LLaDA2.0-Uni结合全语义离散分词器、MoE-based dLLM和扩散解码器,实现多模态理解和生成,通过SigLIP-VQ离散化视觉输入,提升推理效率,支持交错生成与推理,展现强大的图像生成与编辑能力。

Comments LLaDA2.0-Uni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20470 2026-04-23 cs.CV 79%

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

动态Rad:面向长视频扩散的内容自适应稀疏注意力

Yongji Long, Shijun Liang, Jintao Li, Yun Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shenzhen Institute for Advanced Study, UESTC(深圳先进研究院) Computational Mathematics, Science, & Engineering at Michigan State University (MSU)(密歇根州立大学计算数学、科学与工程)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DynamicRad,通过引入双模式策略和语义运动路由器,实现长视频扩散中的高效稀疏注意力机制,提升推理速度并保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20715 2026-04-23 cs.CV 79%

GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

GeoRelight: 基于灵活多模态扩散变换器的联合几何重照明与重建

Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero

机构 * Codec Avatars Lab, Meta(Meta编码器动画实验室) University of Tübingen(图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学院,萨尔兰信息校园)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoRelight,通过联合解决几何重建与重照明问题,利用iNOD和混合数据训练方法提升性能,优于传统顺序模型和忽略几何的系统。

Comments CVPR 2026 Highlight; Project page: https://yuxuan-xue.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20594 2026-04-23 cs.CV 79%

Physics-Informed Conditional Diffusion for Motion-Robust Retinal Temporal Laser Speckle Contrast Imaging

具有物理信息的条件扩散用于运动鲁棒的视网膜时间激光散斑对比成像

Qian Chen, Yuehao Chen, Qiang Wang, Lei Zhu, Yanye Lu, Qiushi Ren

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RetinaDiff框架,通过相位相关注册和条件扩散模型实现运动鲁棒的视网膜时间激光散斑对比成像,提升有限帧下的结构连续性和统计稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20494 2026-04-23 eess.SP 78%

Near-Field Wideband Channel Estimation for XL-MIMO Systems via Denoising Diffusion Model

基于去噪扩散模型的XL-MIMO系统近场宽带信道估计

Qingxia Feng, Yin Fang, Meng Hua, Cheng Zhang, Chunguo Li, Yongming Huang, Luxi Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪扩散模型的近场宽带信道估计方法,通过多尺度注意力机制提升复杂空间频域结构的建模能力,实验表明在不同设置下优于现有基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20488 2026-04-23 q-bio.GN 78%

Conditional Monte Carlo Tree Diffusion for Designing Cell-Type-Specific and Biologically Faithful Regulatory DNA

基于条件蒙特卡洛树扩散的细胞类型特异性与生物忠实的调控DNA设计

Animesh Awasthi, Raphael Bednarsky, Moritz Schaefer, Christoph Bock

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DNA-CRAFT框架,结合条件离散扩散与蒙特卡洛树搜索,设计具有细胞类型特异性且生物忠实的调控DNA元素,通过训练和条件学习实现高精度调控序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20370 2026-04-23 cs.LG stat.ML 78%

Cold-Start Forecasting of New Product Life-Cycles via Conditional Diffusion Models

通过条件扩散模型进行新产品生命周期的冷启动预测

Ruihan Zhou, Zishi Zhang, Jinhui Han, Yijie Peng, Xiaowei Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CDLF模型,利用静态描述、参考轨迹和新观察数据预测新产品生命周期,解决冷启动问题,提升预测准确性与概率预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19828 2026-04-23 physics.gen-ph 78%

The fundamental units of generalized quantum conductance and quantum diffusion

广义量子电导和量子扩散的基本单元

Lino Reggiani, Eleonora Alfinito, Federico Intini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种统一理论,通过类比改进的Drude模型,推导出电导和扩散系数的基本量子单元,适用于中性粒子、热流和光子等电流。

Comments Accepted for publication in Fluctuations and Noise Letters (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 78%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16986 2026-04-23 cond-mat.mes-hall 78%

Quantum geometric contribution to the diffusion constant

量子几何对扩散常数的贡献

A. A. Burkov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究线性狄拉克能谱金属和半金属中量子几何对扩散常数和直流电导的贡献,发现三维狄拉克费米子在电中性条件下扩散常数完全源于量子几何,而二维则不同。

Comments 9 pages, 1 figure, published version

Journal ref Phys. Rev. B 113, 155145 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11931 2026-04-23 cs.RO 78%

MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy

MATT-Diff:基于扩散策略的多模态主动目标跟踪

Saida Liu, Nikolay Atanasov, Shumon Koga

机构 * Department of Computer Science and Systems Engineering, Kobe University(神户大学计算机科学与系统工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MATT-Diff,一种基于扩散策略的多模态主动多目标跟踪控制策略,通过视觉Transformer和注意力机制实现多目标跟踪与再获取。

Comments Camera-ready version for L4DC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06614 2026-04-23 cs.LG cond-mat.stat-mech quant-ph 78%

Local Diffusion Models and Phases of Data Distributions

局部扩散模型与数据分布的相

Fangjun Hu, Guangkuo Liu, Yifan F. Zhang, Xun Gao

机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, NJ 08544, USA(电气与计算机工程系,普林斯顿大学,普林斯顿,新泽西州08544,美国) QuEra Computing Inc., 1284 Soldiers Field Road, Boston, MA 02135, USA(QuEra计算公司,1284士兵场路,波士顿,马萨诸塞州02135,美国) Department of Physics, University of Colorado Boulder, Boulder, CO 80309, USA(物理系,科罗拉多大学博尔德分校,博尔德,科罗拉多州80309,美国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出局部扩散模型的相分析框架,揭示局部去噪器在相变中的作用,通过空间马尔可夫性评估相变,并验证了局部神经网络在相变区域外的高效性。

Comments 11+23 pages, 4+4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 78%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11504 2026-04-23 math.DS 78%

Traveling waves in reaction-diffusion equations with delay in both diffusion and reaction terms

具有扩散和反应项延迟的反应扩散方程中的行波

William Barker, Nguyen Van Minh

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究了具有扩散和反应项延迟的反应扩散系统中行波的存在性,通过单调迭代法扩展了线性泛函微分方程的格林函数符号研究,证明了在小正数r下方程有唯一有界解,并展示了在小延迟下Fisher-KPP和Belousov-Zhabotinski方程中行波的存在性。

Comments 36 pages

Journal ref Nonlinear Analysis, Vol. 271 (2026), 114125

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20766 2026-04-23 math.NA cs.NA 78%

A provably stable numerical method for the anisotropic diffusion equation in confined magnetic fields: Curvilinear coordinates and multi-block domains

一种可证明稳定的数值方法用于受限磁场中的各向异性扩散方程:曲线坐标和多块域

Dean Muir, Kenneth Duru, Stuart Hudson, Matthew Hole

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种稳健且准确的数值方法,用于在曲线坐标中求解各向异性扩散方程,通过多块域方法处理复杂几何,并通过数值测试验证了方法的稳定性与收敛性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20761 2026-04-23 stat.ML stat.ME 78%

Geometric Renyi Differential Privacy: Ricci Curvature Characterized by Heat Diffusion Mechanisms

几何Rényi差分隐私:通过热扩散机制特征化里奇曲率

Xiaotian Chang, Yangdi Jiang, Cyrus Mostajeran, Qirui Hu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种新的隐私机制,用于处理Riemann流形数据,通过几何分析、热扩散模型和差分隐私之间的联系,利用里奇曲率特征化Rényi散度,并通过热扩散和 Langevin 过程方法实现隐私保护的采样和连续隐私-效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11375 2026-04-23 math.NA cs.NA 78%

DiLO: Decoupling Generative Priors and Neural Operators via Diffusion Latent Optimization for Inverse Problems

DiLO:通过扩散潜在优化解耦生成先验和神经算子以解决逆问题

Haibo Liu, Guang Lin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiLO通过扩散潜在优化解耦生成先验与物理模型,解决逆问题中的计算瓶颈,提升重建精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05070 2026-04-23 stat.ML cs.LG 78%

Control Consistency Losses for Diffusion Bridges

扩散桥梁的控制一致性损失

Samuel Howard, Nikolas Nüsken, Jakiw Pidstrigach

机构 * Department of Statistics, University of Oxford(牛津大学统计学系) Department of Mathematics, King's College London(伦敦国王学院数学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于最优控制自一致性性质的新方法,用于学习扩散桥梁的条件动力学,在无需通过模拟轨迹求导的情况下,有效处理稀有事件的模拟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20597 2026-04-23 math.AP 71%

Widely degenerate anisotropic diffusion: local boundedness and semicontinuity

广泛退化各向异性扩散:局部有界性和半连续性

Pasquale Ambrosio, Simone Ciani, Giovanni Cupini

专题命中 扩散模型 :diffusion(title)

AI总结 研究了演化方程局部弱解的正则性,探讨了非齐次抛物德吉奥尼类中解的局部有界性及局部弱次(超)解的半连续代表的存在性,推广了以往结果至更退化各向异性抛物方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09283 2026-04-23 cs.CV 70%

From Ideal to Real: Stable Video Object Removal under Imperfect Conditions

从理想到现实:在不完美条件下实现稳定的视频对象移除

Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出SVOR框架,通过MUSE、DA-Seg和双阶段训练解决视频对象移除中的阴影、运动突变和掩码缺陷问题,实现更稳定的移除效果。

Comments Project Page: https://xiaomi-research.github.io/svor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02618 2026-04-23 cs.RO cs.CV 70%

Rodrigues Network for Learning Robot Actions

罗德里格斯网络用于学习机器人动作

Jialiang Zhang, Haoran Geng, Yang You, Congyue Deng, Pieter Abbeel, Jitendra Malik, Leonidas Guibas

机构 * MIT(麻省理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出罗德里格斯网络,通过引入运动学先验知识提升机器人动作学习性能,验证了其在动作预测和手部重建中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏