arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-13 至 2026-04-13 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2603.13450 2026-04-13 cs.CV cs.CL 92%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20068 2026-04-13 cs.CV 77%

PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

PRADA:基于概率比的自回归生成图像归因与检测

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11795 2026-04-13 cs.CV 70%

Intrinsic Concept Extraction Based on Compositional Interpretability

基于组合可解释性的内在概念提取

Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan

机构 * Guangdong University of Technology(广东工业大学) VIPSHOP(唯品会) Huizhou University(惠州学院) University of Macau(澳门大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CI-ICE任务,利用扩散模型提取可组合的物体和属性概念,通过超表达方法实现概念解耦与可组合性,提升单图内在概念提取性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 57%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2604.09386 2026-04-13 cs.CV 79%

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

区域约束的群相对策略优化用于基于流的图像编辑

Zhuohan Ouyang, Zhe Qian, Wenhuo Cui, Chaoqun Wang

机构 * South China Normal University(华南师范大学) South China Agricultural University(华南农业大学) Monash University(莫纳什大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出RC-GRPO-Editing框架,通过区域约束的GRPO后训练提升流基图像编辑中目标区域指令遵循和非目标区域保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09096 2026-04-13 cs.CV cs.MM eess.IV 62%

Off-the-shelf Vision Models Benefit Image Manipulation Localization

现成视觉模型助力图像篡改定位

Zhengxuan Zhang, Keji Song, Junmin Hu, Ao Luo, Yuezun Li

机构 * School of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) Southwest Jiaotong University(西南交通大学)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出ReVi适配器,利用现成通用视觉模型提升图像篡改定位性能,通过解耦语义冗余与篡改信息实现高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09231 2026-04-13 cs.CV 57%

Hitem3D 2.0: Multi-View Guided Native 3D Texture Generation

Hitem3D 2.0:多视角引导的原生3D纹理生成

Huiang He, Shengchu Zhao, Jianwen Huang, Jie Li, Jiaqi Wu, Hu Zhang, Pei Tang, Heliang Zheng, Yukun Li, Rongfei Jia

机构 * Math Magic South China University of Technology(华南理工大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Hitem3D 2.0通过整合2D多视角生成先验和原生3D纹理表示,提升3D纹理质量,解决纹理不完整、视角不一致和几何对齐问题。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 58 篇

2604.09436 2026-04-13 cs.CV 88%

SCoRe: Clean Image Generation from Diffusion Models Trained on Noisy Images

SCoRe: 从噪声图像训练的扩散模型中生成干净图像

Yuta Matsuzaki, Seiichi Uchida, Shumpei Takezaki

机构 * Kyushu University(九州大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 SCoRe通过频谱截止再生方法,有效抑制生成图像中的高频噪声,提升图像质量,无需重新训练。

Comments Accepted at IJCNN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09039 2026-04-13 eess.SP 88%

Diffusion Inpainting MIMO-OFDM Channels with Limited Noisy Observations

利用有限噪声观测进行MIMO-OFDM信道扩散修复

Weijie Zhou, Zhaoyang Zhang, Yuzhi Yang, Sen Yan, Zhixian Kong, Merouane Debbah

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本文提出基于扩散模型的MIMO-OFDM信道估计方法,通过条件生成任务修复有限噪声观测,实现高精度信道恢复,实验表明在不同噪声条件下性能提升5dB以上,且在稀疏试点密度下保持高效准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06161 2026-04-13 cs.CV cs.AI cs.GR 84%

DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models

DiffHDR:利用视频扩散模型重新暴露LDR视频

Zhengming Yu, Li Ma, Mingming He, Leo Isikdogan, Yuancheng Xu, Dmitriy Smirnov, Pablo Salamanca, Dao Mi, Pablo Delgado, Ning Yu, Julien Philip, Xin Li, Wenping Wang, Paul Debevec

机构 * Eyeline Labs(Eyeline 实验室) Netflix

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 DiffHDR通过视频扩散模型的潜在空间将LDR视频转换为HDR,恢复过曝和欠曝区域的真实细节,提升动态范围和再曝光效果。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12242 2026-04-13 cs.CV cs.AI cs.LG 83%

OmniPrism: Learning Disentangled Visual Concept for Image Generation

OmniPrism: 学习解耦的视觉概念用于图像生成

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 OmniPrism通过自然语言引导学习解耦的视觉概念表示,结合扩散模型生成高质量图像,解决多方面概念混淆问题。

Comments WebPage available at https://tale17.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09022 2026-04-13 cs.CV 79%

BlendFusion -- Scalable Synthetic Data Generation for Diffusion Model Training

BlendFusion -- 可扩展的合成数据生成用于扩散模型训练

Thejas Venkatesh, Suguna Varshini Velury

机构 * Samaya AI, Inc.(Samaya AI公司) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BlendFusion框架,通过路径追踪生成高质量图像-描述对,构建FineBLEND数据集,并分析其质量及与现有数据集的对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO 79%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08922 2026-04-13 cs.CV 79%

Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

抗退化融合:一种高效的抗退化扩散框架,用于任意退化场景下的多模态图像融合

Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen

机构 * Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种高效的抗退化扩散框架,用于处理多模态图像融合中的复杂退化场景。该框架通过隐式去噪和联合观测模型校正机制,提升了在复杂退化下的融合性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08716 2026-04-13 cs.CV 79%

What Matters in Virtual Try-Off? Dual-UNet Diffusion Model For Garment Reconstruction

虚拟试穿中什么重要?用于服装重建的双UNet扩散模型

Loc-Phat Truong, Meysam Madadi, Sergio Escalera

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat de Barcelona, Spain(西班牙巴塞罗那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了虚拟试穿的逆问题,提出双UNet扩散模型,通过比较生成骨干、条件设计和损失函数,实现了服装重建的先进性能,提升了基线并为未来研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08646 2026-04-13 cs.CV 79%

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title);image editing(abstract);分类 cs.CV

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09524 2026-04-13 astro-ph.EP astro-ph.HE astro-ph.IM 78%

Gardening on the Moon: An Advection-Diffusion Model to Guide the Search for Supernova Debris in the Lunar Regolith

月球上种花:一种输运-扩散模型以指导寻找超新星碎片在月球风化层中的搜索

Emily S. Costello, John Ellis, Brian D. Fields, Rebecca Surman, Xilu Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一个统一的随机模型,用于描述由撞击通量引起的月球风化层中的物质垂直分布,通过预测阿波罗核心样本中活化Fe60的深度剖面,探讨超新星尘埃捕获与本地铁含量无关,并预测可能来自超新星或千新星的r过程物种在月球中的信号。

Comments 5 pages + Supplementary Material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02781 2026-04-13 cs.SD 78%

DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos

DynFOA: 利用条件扩散生成动态和声学复杂的360度视频的首阶混响

Ziyu Luo, Lin Chen, Qiang Qu, Xiaoming Chen, Yiran Shen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DynFOA,通过整合动态场景重建与条件扩散模型,从360度视频生成首阶混响,解决复杂场景中声学效果建模问题,实验表明其在空间准确性、声学保真度等方面优于现有方法。

Comments Accidental duplicate submission. This paper was intended to be a replacement (v2) for arXiv:2602.06846

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24879 2026-04-13 q-bio.QM physics.med-ph 78%

General Microstructure Factor Analysis of Diffusion MRI in Gray-Matter Predicts Cognitive Scores

扩散磁共振成像在灰质中的微结构因素分析及其对认知分数的预测

Lucas Z. Brito, Ryan P. Cabeen, David H. Laidlaw

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过NODDI和PCA分析灰质微结构,发现各向同性体积分数能显著解释个体差异并预测特定认知能力。

Comments 11 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15889 2026-04-13 math.OC 78%

An optimal-control framework for reaction diffusion systems with application to synthetic developmental biology

用于反应扩散系统的最优控制框架及其在合成发育生物学中的应用

Mohamed Amine Ouchdiri, Hamza Faquir, Saad Benjelloun, Mohamed Adlene Maghenem, Irene Otero-Muras, Adnane Saoud

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于耦合反应扩散系统的最优控制框架,通过引入输入和多项式输入增益函数,保证控制系统的合理性,并在哺乳动物细胞中的Nodal-Lefty相互作用模型中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09239 2026-04-13 math.AP 78%

The backward problem for a multi-term time-fractional diffusion equation

多项时间分数扩散方程的逆问题

Ravshan Ashurov, Damir Shamuratov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究多项时间分数扩散方程的逆问题,通过正则化方法证明在光滑数据条件下解的存在性、唯一性和稳定性,并揭示了多项 Mittag-Leffler 函数的渐进行为及解的最优平滑性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09073 2026-04-13 cs.AR 78%

DRIFT: Harnessing Inherent Fault Tolerance for Efficient and Reliable Diffusion Model Inference

DRIFT:利用固有容错性实现高效可靠的扩散模型推理

Jinqi Wen, Tong Xie, Runsheng Wang, Meng Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DRIFT框架,通过利用扩散模型的固有容错性,提升推理效率和可靠性,实验显示在电压调低时平均节能36%,超频时提速1.7倍且保持生成质量。

Comments 7 pages, 14 figures. Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09058 2026-04-13 cs.LG cs.AI 78%

PDE-regularized Dynamics-informed Diffusion with Uncertainty-aware Filtering for Long-Horizon Dynamics

具有不确定性感知滤波的PDE正则化动态信息扩散用于长时间跨度动态

Min Young Baeg, Yoon-Yeong Kim

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PDYffusion框架,结合PDE正则化和不确定性感知预测,通过PDE正则化插值器和UKF预测器实现稳定长时预测,实验表明其在CRPS和MSE上表现优异,且保持稳定的不确定性行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09035 2026-04-13 cs.AI cs.LG 78%

Advantage-Guided Diffusion for Model-Based Reinforcement Learning

基于优势的扩散模型用于基于模型的强化学习

Daniele Foffano, Arvid Eriksson, David Broman, Karl H. Johansson, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Digital Futures(数字未来)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出AGD-MBRL,通过利用智能体的优势估计引导反向扩散过程,提升长周期回报。采用SAG和EAG两种引导方法,改进了短周期视角下的扩散模型MBRL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08964 2026-04-13 cs.CL 78%

Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models

打破块边界:基于锚点的历史稳定解码用于扩散大语言模型

Shun Zou, Yong Wang, Zehui Chen, Lin Chen, Chongyang Tao, Feng Zhao, Xiangxiang Chu

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学教育部多模态认知与智能系统重点实验室) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出AHD解码策略,通过动态锚点实时监控token稳定性,实现跨块高效解码,提升性能与推理效率。

Comments Accepted for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08357 2026-04-13 cs.LG 78%

Bias-Constrained Diffusion Schedules for PDE Emulations: Reconstruction Error Minimization and Efficient Unrolled Training

偏置约束的扩散调度用于PDE仿真的:重构误差最小化和高效的展开训练

Constantin Le Cleï, Nils Thuerey, Xiaoxiang Zhu

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出适应性噪声调度和代理展开训练方法,通过减少重构误差和计算成本提升PDE仿真的短期精度和长期稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI 78%

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07265 2026-04-13 q-bio.PE 78%

Entropy and diffusion characterize mutation accumulation and biological information loss

熵与扩散表征突变积累与生物信息损失

Stephan Baehr, Hans Baehr

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过熵和扩散模型研究生物信息变化,揭示突变积累与寿命的关系,提出熵管理是进化延长寿命的机制。

Comments 2 figures, 2500 words; 12 pages absent supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11568 2026-04-13 cs.LG 78%

Graph Defense Diffusion Model

图防御扩散模型

Xin He, Wenqi Fan, Yili Wang, Chengyi Liu, Rui Miao, Xin Juan, Xin Wang

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出图防御扩散模型(GDDM),通过扩散模型的去噪能力有效净化受攻击的图数据,保留图结构并增强净化效果,实验显示其在多种对抗攻击中表现优异。

Comments Accepted by The 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1 (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12213 2026-04-13 nlin.PS q-bio.CB 78%

Bistability of travelling waves and wave-pinning states in a mass-conserved reaction-diffusion system: From bifurcations to implications for actin waves

行波与波固定状态在质量守恒反应扩散系统中的双稳性:从分支到对肌动蛋白波的启示

Jack M. Hughes, Saar Modai, Leah Edelstein-Keshet, Arik Yochelis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了质量守恒反应扩散模型中行波与波固定状态的双稳性,揭示了不同细胞运动模式共存、鲁棒性和转换的可能机制。

Comments 47 pages, 25 figures

Journal ref SIAM J. Applied Dynamical Systems, 25(2), pp. 789--835. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏