arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-15 至 2026-05-15 共收录 91 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 66 篇

2605.14368 2026-05-15 cs.CL cs.AI 78%

Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement

扩散应进入语言模型的何处?几何引导的隐藏状态替换

Injin Kong, Hyoungjoon Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Biosystems & Biomaterials Science and Engineering, Seoul National University(首尔国立大学生物系统与生物材料科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiHAL模型,通过几何引导确定扩散在预训练Transformer中的最佳插入位置,通过隐藏状态恢复而非直接连续到离散恢复提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14317 2026-05-15 cs.LG physics.ao-ph 78%

Guided Diffusion Sampling for Precipitation Forecast Interventions

引导扩散采样用于降水预报干预

Ayumu Ueyama, Kazuhiko Kawamoto, Hiroshi Kera

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于梯度的引导框架,通过扩散模型实现降水减少干预,通过引导扩散采样轨迹保持大气分布一致性,实验表明其干预更符合物理规律。

Comments 12+7 pages, 7+2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14305 2026-05-15 cs.CL 78%

Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding

通过推测解码的无因子误差离散扩散语言模型

Xun Fang, Yunchen Li, Hang Yuan, Zhou Yu

机构 * East China Normal University(华东师范大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出FeF-DLLM,通过精确的前缀条件因子分解保留token依赖性,结合推测解码提升推理速度,实验表明在多个数据集上准确率提升5.04个百分点,推理速度提升3.86倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22917 2026-05-15 astro-ph.CO astro-ph.GA 78%

Diffusion-based Galaxy Simulations for the Roman High Latitude Survey

基于扩散的星系模拟用于罗马高纬度调查

Diana Scognamiglio, Jake H. Lee, Eric Huff, Sergi R. Hildebrandt, Shoubaneh Hemmati

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于扩散的星系图像模拟方法,用于罗马高纬度调查的弱透镜分析,通过训练去噪扩散概率模型生成多波段星系图像,验证其在弱透镜校准中的有效性。

Comments 15 pages, 8 Figure, accepted for publication in ApJ

Journal ref ApJ 1003 (2026) 42

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21809 2026-05-15 cs.LG cs.AI q-bio.QM stat.ML 78%

Quotient-Space Diffusion Models

商空间扩散模型

Yixian Xu, Yusong Wang, Shengjie Luo, Kaiyuan Gao, Tianyu He, Di He, Chang Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出商空间扩散模型,通过处理对称性来提升生成模型性能,优于等变模型和对齐方法,在分子结构生成中表现更佳。

Comments ICLR 2026 Oral Presentation; 43 pages, 5 figures, 6 tables; ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12554 2026-05-15 cs.LG cs.AI cs.CL 78%

Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages

基于熵引导的步骤选择和分步优势的扩散语言模型强化学习

Vishnu Teja Kunde, Fatemeh Doudi, Mahdi Farahbakhsh, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种针对扩散语言模型的强化学习方法,通过熵引导选择步骤和分步优势估计,实现无偏策略梯度,提升生成效果和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05285 2026-05-15 cs.LG 78%

Robust Inference-Time Steering of Protein Diffusion Models via Embedding Optimization

通过嵌入优化实现蛋白质扩散模型推理时间的鲁棒引导

Minhuan Li, Jiequn Han, Pilar Cossio, Luhuan Wu

机构 * Flatiron Institute(Flatiron研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出EmbedOpt框架,通过优化嵌入空间使蛋白质结构先验与实验约束对齐,在稀疏距离约束和冷冻电镜图匹配中表现更优,且对超参数更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20846 2026-05-15 cs.LG 78%

Causal Time Series Generation via Diffusion Models

通过扩散模型进行因果时间序列生成

Yutong Xia, Chang Xu, Yuxuan Liang, Li Zhao, Qingsong Wen, Roger Zimmermann, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) HKUST (Guangzhou)(香港科技大学(广州)) Squirrel AI

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出因果时间序列生成任务,通过因果视角改进传统条件时间序列生成,引入因果扩散框架实现干预和反事实生成,实验显示其在真实和合成数据上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13999 2026-05-15 cs.LG 78%

Support Before Frequency in Discrete Diffusion

在离散扩散中先支持频率

Adrian Müller, Antoine Gonon, Zebang Shen, Ya-Ping Hsieh, Niao He

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院) Academia Sinica(台湾“中央研究院”)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究揭示离散扩散模型在语言建模中通过学习支持结构优先于频率信息,统一扩散显示有效性改进、保持和恶化编辑的三元组,而吸收扩散则将主要质量放在有效性改进移动上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 78%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18549 2026-05-15 math.AP 78%

Semilinear Diffusion Equations on Infinite Graphs: The Dissipative and Lipschitz Cases

半线性扩散方程在无限图上的研究:耗散情况与利普希茨情况

Elvise Berchio, Davide Bianchi, Alberto G. Setti, Maria Vallarino

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究无限连通加权图上的半线性扩散方程,探讨单调递减和利普希茨连续非线性情况,证明在$\ell^p$空间中初值的解存在性、唯一性和正则性,采用隐式欧拉方案和狄利克雷子图技术,并证明有限时间灭绝和正性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14159 2026-05-15 cs.RO 78%

MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies

MIMIC-D: 多模态模仿用于多智能体协调的去中心化扩散策略

Dayi Dong, Maulik Bhatt, Seoyeon Choi, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MIMIC-D,通过去中心化扩散策略实现多智能体多模态模仿学习,解决了传统方法在多模态任务中协调效率低的问题。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03992 2026-05-15 stat.ML cs.LG math.ST stat.TH 78%

How well behaved is finite dimensional Diffusion Maps?

有限维扩散图的可行为性如何?

Wenyu Bo, Marina Meilă

机构 * Department of Statistics(统计学系) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究有限维扩散图在子流形上的几何性质,推导出嵌入误差的理论界,揭示扩散图在流形上的精度特性。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 74%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04850 2026-05-15 math.NA cs.NA 71%

Evolving finite elements for advection diffusion with an evolving interface

演化有限元用于对流扩散问题的界面演化

C. M. Elliott, T. Ranner, P. Stepanov

专题命中 扩散模型 :diffusion(title)

AI总结 本文基于抽象演化有限元框架,提出数值方案近似抛物方程的界面演化问题,证明了任意阶演化等参数有限元的最优误差界,并通过数值实验验证收敛阶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14705 2026-05-15 cs.CV 70%

Towards Continuous Sign Language Conversation from Isolated Signs

从孤立手势构建连续手语对话

Youngmin Kim, Kyobin Choo, Jiwoo Park, Minseo Kim, Chanyoung Kim, Junhyeok Kim, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) Emory University(埃默里大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过构建连续手语对话来解决手语翻译模型词汇覆盖不足和泛化能力弱的问题,引入了SignaVox-W和SignaVox-U数据集,并采用检索引导的语音到词组翻译和BRAID模型实现结构匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02482 2026-05-15 cs.LG 67%

SEDGE: Structural Extrapolated Data Generation

SEDGE: 结构性外推数据生成

Kun Zhang, Jiaqi Sun, Yiqing Li, Ignavier Ng, Namrata Deka, Shaoan Xie

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 本文提出SEDGE框架,通过合理假设数据生成过程,实现可靠的新规范数据生成,并探讨算法实现与外推性能验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14597 2026-05-15 cs.CV cs.CE cs.MM 62%

VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting

VMU-Diff:一种用于降水现在预测的粗到细多源数据融合框架

Chunlei Shi, Hao Li, Yufeng Zhu, Boyu Liu, Yongchao Feng, Zengliang Zang, Hongbin Wang, Yanlan Yang, Dan Niu

机构 * Department of Automation, Southeast University(东南大学自动化部门) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Key Laboratory of Transportation Meteorology, China Meteorological Administration(中国气象局交通运输气象重点实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出VMU-Diff框架,通过粗阶段确定性模型预测全局运动趋势,细阶段概率模型生成精细预测细节,利用雷达和多波段卫星数据融合,提升短期降水预测精度。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13852 2026-05-15 cs.GR cs.CV cs.LG 62%

Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

Realiz3D: 通过领域感知学习实现逼真3D生成

Ido Sobol, Kihyuk Sohn, Yoav Blum, Egor Zakharov, Max Bluvstein, Andrea Vedaldi, Or Litany

机构 * Technion(技术学院) Meta AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Realiz3D通过分离控制信号与视觉领域,提升生成图像的逼真度和3D一致性,适用于文本到多视角生成和3D输入纹理生成。

Comments Accepted to CVPR 2026. Project page: https://idosobol.github.io/realiz3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15196 2026-05-15 cs.CV cs.LG 57%

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

RefDecoder:通过条件视频解码增强视觉生成

Xiang Fan, Yuheng Wang, Bohan Fang, Zhongzheng Ren, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出RefDecoder,通过引入高保真参考图像信号提升视频生成质量,改进解码器结构以保持结构完整性,在多个基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15190 2026-05-15 cs.CV 57%

RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO

RAVEN: 实时自回归视频外推与一致性模型GRPO

Yanzuo Lu, Ronglai Zuo, Jiankang Deng

机构 * Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RAVEN通过将自回归视频扩散模型的训练与测试过程结合,提升长时视频生成质量。CM-GRPO方法优化一致性采样,提高生成效果。

Comments Project Page: https://yanzuo.lu/raven

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14988 2026-05-15 cs.CV 57%

Compositional Video Generation via Inference-Time Guidance

通过推理时间引导进行组合视频生成

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Gal Chechik, Lior Wolf

机构 * Tel-Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学) NVIDIA Research(NVIDIA研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14980 2026-05-15 cs.CV cs.AI 57%

MicroscopyMatching: Towards a Ready-to-use Framework for Microscopy Image Analysis in Diverse Conditions

MicroscopyMatching:面向多样条件下的显微图像分析即用框架

Xiaofei Hui, Haoxuan Qu, Hossein Rahmani, Shuohong Wang, Jeff W. Lichtman, Jun Liu

机构 * School of Computing and Communications(计算与通信学院) Lancaster University(兰卡斯特大学) Department of Cell Biology(细胞生物学系) Harvard Medical School(哈佛医学院) Department of Molecular and Cellular Biology(分子与细胞生物学系) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MicroscopyMatching框架,通过统一匹配问题解决显微图像分析中的分割、跟踪和计数任务,克服传统方法在多样条件下的适应性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV 57%

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14874 2026-05-15 cs.CV 57%

LPH-VTON: Resolving the Structure-Texture Dilemma of Virtual Try-On via Latent Process Handover

LPH-VTON:通过潜在过程交接解决虚拟试衣的结构-纹理困境

Yixin Liu, Baihong Qian, Jinglin Jiang, Jeffery Wu, Yan Chen, Wei Wang, Yida Wang, Lanqing Yang, Guangtao Xue

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LPH-VTON框架,通过单个连续去噪过程解决虚拟试衣中结构与纹理的平衡问题,实现高质量的视觉真实性和精确的结构对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14819 2026-05-15 cs.CV 57%

The Velocity Deficit: Initial Energy Injection for Flow Matching

速度缺陷:流匹配的初始能量注入

Linze Li, Zong-Wei Hong, Shen Zhang, Bo Lin, Jinglun Li, Yao Tang, Jiajun Liang

机构 * Jiiov Technology, Beijing, China(吉 iov 技术,北京,中国)

专题命中 扩散模型 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Initial Energy Injection方法,通过MAFM和SSC解决流匹配中速度低估问题,提升生成质量与效率,实验显示在ImageNet-1k上FID降低44.6%并提升5倍速度。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14590 2026-05-15 cs.CV 57%

FedStain: Modeling Higher-Order Stain Statistics for Federated Domain Generalization in Computational Pathology

FedStain: 模型高阶染色统计信息以实现计算病理学中的联邦域泛化

Fengyi Zhang, Junya Zhang, Wenzhuo Sun

机构 * School of Electronic Science and Technology, Hainan University, Haikou, China, 570228(海南大学电子科学与技术学院) School of Computer Science and Technology, Xidian University, Xi'an, China, 710126(西安电子科技大学计算机科学与技术学院) Xiangjiang College of Elite Engineers, Hunan University, Changsha, China, 410082(湖南大学精英工程师学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FedStain通过引入高阶染色统计量(偏度和峰度)提升联邦域泛化性能,有效应对跨机构染色异质性问题,实验表明其在Camelyon17和MvMidog-Fed数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14487 2026-05-15 cs.CV cs.AI 57%

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

强制头部:通过头部异质性实现长自回归视频生成

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang

机构 * AGI Lab, Westlake University University of California at Merced StepFun

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Head Forcing框架,通过差异化分配KV缓存策略提升长视频生成质量,实现分钟级生成并支持多提示交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08851 2026-05-15 cs.CV cs.AI cs.LG 57%

Geometrically Constrained Stenosis Editing in Coronary Angiography via Entropic Optimal Transport

通过熵最优传输的几何约束斑块编辑在冠状动脉造影中

Jialin Li, Zhuo Zhang, Yue Cao, Guipeng Lan, Jiabao Wen, Shuai Xiao, Jiachen Yang

机构 * School of Electrical and Information Engineering, Tianjin University, Tianjin, China(天津大学电气与信息工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出OT-Bridge Editor,通过熵最优传输和几何信息提升冠状动脉造影中斑块编辑的精度与泛化能力,实验显示在ARCADE基准和多中心数据集上分别提升27.8%和23.0%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV 57%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏