arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-08 至 2026-05-08 共收录 101 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 74 篇

2605.06077 2026-05-08 cs.LG 78%

Understanding diffusion models requires rethinking (again) generalization

理解扩散模型需要重新思考(再次)泛化

Pierre Marion, Yu-Han Wu

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure, PSL Research University(法国国家科学研究中心-巴黎高等师范学院) LPSM, Sorbonne University(巴黎高等师范学院-勒维克概率与统计实验室) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文探讨扩散模型泛化问题需新的理论框架,指出记忆训练数据与泛化矛盾,提出研究模型预记忆阶段学习内容的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05960 2026-05-08 cs.RO 78%

Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation

即插即用标签地图扩散用于通用目标导向导航

Zhixuan Shen, Yijie Zeng, Shengxiang Luo, Tianrui Li, Haonan Luo

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PLMD方法,通过扩散模型生成未知区域的障碍和语义标签,实现部分观测环境下的目标定位,同时提升导航策略的语义地图整合能力,实验表明其在三个目标导向导航任务中表现优异。

Comments 21 pages, 10 figures, Extended Version of accepted ICML 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-05-08 cs.CL 78%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16838 2026-05-08 cs.NE nlin.CD 78%

Jump-diffusion models of parametric volume-price distributions

参数体积-价格分布的跳跃扩散模型

Anup Budhathoki, Leonardo Rydin Gorjão, Pedro G. Lind, Shailendra Bhandari

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种数据驱动框架,用于建模纽约证券交易所股票的体积-价格分布的随机演化。通过拟合Gamma、逆Gamma、Weibull和对数正态分布,分析了去趋势参数的时间序列,揭示了不同模型中参数的跳跃扩散特性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05829 2026-05-08 q-bio.BM 78%

MP2D: Constrained Monte Carlo Tree-Guided Diffusion for Multi-Objective Protein Sequence Design

MP2D:基于约束的蒙特卡洛树引导扩散的多目标蛋白质序列设计

Zitai Kong, Yifan Dong, Yixuan Wu, Zhaokang Liang, Jian Wu, Hongxia Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MP2D框架,结合条件离散扩散与约束MCTS及全局迭代优化,解决多目标蛋白质序列设计中的冲突属性问题,实现高效平衡优化。

Comments 16 pages, 4 figures, 7 tables, accepted by the 35th International Joint Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05503 2026-05-08 cs.CL 78%

Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks

Chainwash:针对扩散语言模型水印的多步重写攻击

Mohd Ruhul Ameen, Akif Islam, Nadim Mahmud, Md. Ekramul Hamid

机构 * College of Engineering and Computer Science, Marshall University(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi(拉贾沙希大学计算机科学与工程系) Miami University(迈阿密大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究多步重写对扩散语言模型水印检测的影响,发现多次重写显著降低检测率,表明重写是更有效的攻击手段。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04830 2026-05-08 cs.LG cond-mat.stat-mech 78%

Concurrence of Symmetry Breaking and Nonlocality Phase Transitions in Diffusion Models

对称破缺与非局域性相变在扩散模型中的共存

Yifan F. Zhang, Fangjun Hu, Guangkuo Liu, Mert Okyay, Xun Gao

机构 * QuEra Computing Inc.(QuEra计算公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究现代扩散变换器中对称破缺与非局域性相变是否共存,通过分析生成轨迹动态和结果,发现两者近似同时发生,首次统一两种相变概念,为评估模型效率和指导架构设计提供依据。

Comments 20 pages, 10 figures. comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14225 2026-05-08 cs.LG stat.ML 78%

Defending Diffusion Models Against Membership Inference Attacks via Higher-Order Langevin Dynamics

通过高阶 Langevin 动力学防御扩散模型的成员推断攻击

Benjamin Sterling, Yousef El-Laham, Mónica F. Bugallo

机构 * Department of Applied Math & Statistics(应用数学与统计学系) Stony Brook University(石溪大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用高阶 Langevin 动力学防御扩散模型的成员推断攻击,通过引入辅助变量和联合扩散过程提升模型安全性,通过AUROC和FID指标验证有效性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06153 2026-05-08 cs.CR cs.CV 74%

Secure Seed-Based Multi-bit Watermarking for Diffusion Models from First Principles

基于安全性的多比特水印嵌入用于扩散模型的原理性方法

Enoal Gesny, Eva Giboulot

机构 * Inria Rennes(法国里昂国家信息与自动化研究所)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出基于原理的水印方法,通过理论分析建立安全、鲁棒性和保真度的评估框架,实现无需依赖生成模型的水印系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20616 2026-05-08 cs.CV 70%

Shape2Animal: Creative Animal Generation from Natural Silhouettes

Shape2Animal: 从自然剪影生成创意动物

Quoc-Duy Tran, Anh-Tuan Vo, Dinh-Khoi Vo, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市科学技术大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) University of Dayton, Ohio, US(Dayton 大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Shape2Animal框架,通过将自然物体剪影转化为 plausible 动物形式,展现人类对模糊刺激的感知能力。利用 vision-language 模型和扩散模型生成视觉连贯的动物图像,适用于视觉叙事、教育内容等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05435 2026-05-08 cs.LG cs.NA math.NA 67%

Active Learning for Conditional Generative Compressed Sensing

基于条件生成压缩感知的主动学习

Alexander DeLise, Nick Dexter

机构 * Department of Scientific Computing(科学计算系) Department of Mathematics(数学系) Florida State University(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本文研究了利用提示条件生成模型从子采样傅里叶测量中恢复图像的问题,提出分离提示在采样分布设计和恢复模型定义中的作用,并证明了提示匹配的Christoffel采样保持相同复杂度常数,而提示不匹配会引入显式兼容性惩罚。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06658 2026-05-08 cs.CV 57%

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06512 2026-05-08 cs.CV 57%

DCR: Counterfactual Attractor Guidance for Rare Compositional Generation

DCR:反事实吸引引导用于稀有组合生成

Taewon Kang, Matthias Zwicker

机构 * University of Maryland at College Park(马里兰大学学院市分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DCR框架,通过反事实吸引引导解决扩散模型在生成稀有但合理的组合时的默认完成偏见问题,提升生成内容的组合忠实度和视觉质量。

Comments 40 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06509 2026-05-08 cs.CV 57%

FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction

FreeSpec: 通过奇异谱重建实现无训练长视频生成

Fangda Chen, Shanshan Zhao, Longrong Yang, Chuanfu Xu, Zhigang Luo, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Zhejiang University(浙江大学) Xiangjiang Laboratory(湘江实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FreeSpec通过奇异谱重建方法解决长视频生成中的内容漂移和时间不一致问题,利用低秩谱引导和高秩重建基,提升空间细节和时间动态的保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06388 2026-05-08 cs.CV cs.LG cs.RO 57%

Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

重建还是语义?什么使潜在空间对机器人世界模型有用

Nilaksh, Saurav Jha, Artem Zholus, Sarath Chandar

机构 * Chandar Research Lab(昌达尔研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了不同潜在空间在机器人世界模型中的有效性,发现语义潜在空间在规划和下游政策性能方面优于重建潜在空间。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06192 2026-05-08 cs.CV cs.AI cs.RO 57%

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

EA-WM:事件感知生成世界模型与结构运动-视觉动作场

Zhaoyang Yang, Yurun Jin, Lizhe Qi, Cong Huang, Kai Chen

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) DeepCybo(深瞳)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。

Comments Preprint. 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 57%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06351 2026-05-08 cs.CV cs.AI cs.LG 57%

DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking

DC-DiT:通过动态分块实现视觉生成的自适应计算与弹性推理

Akash Haridas, Utkarsh Saxena, Parsa Ashrafi Fashi, Mehdi Rezagholizadeh, Vikram Appia, Emad Barsoum

机构 * Advanced Micro Devices Inc. (AMD)(先进微器件公司(AMD))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DC-DiT通过动态分块机制,自适应地压缩视觉输入,优化计算资源分配,提升生成效率与灵活性,实验显示在ImageNet生成任务中显著降低计算量并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05865 2026-05-08 cs.CV 57%

InkDiffuser: High-Fidelity One-shot Chinese Calligraphy via Differentiable Morphological Optimization

InkDiffuser: 通过可微分形态优化实现高质量单次汉字书法生成

Kunchong Shi, Jing Zhang

机构 * Department of Computer Science and Engineering, East China University of Science and Technology(计算机科学与工程系,东华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InkDiffuser框架,通过高频率增强机制和可微分墨结构损失,解决汉字书法生成中笔画渲染和墨迹形态不真实的问题,提升生成书法的视觉真实感和艺术流畅度。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05780 2026-05-08 cs.AI cs.CV cs.LG 57%

Von Neumann Networks

冯·诺依曼网络

Shekhar S. Chandra

机构 * School of Electrical Engineering and Computer Science, The University of Queensland, Australia(昆士兰大学电子工程与计算机科学学院,澳大利亚)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于冯·诺依曼细胞阵列的神经网络,通过学习构建专用神经元,实现自适应设计。该网络基于神经算子和格林函数的学习,具有通用计算能力,并在基础任务中优于传统深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05756 2026-05-08 cs.RO cs.CV 57%

MaMi-HOI: Harmonizing Global Kinematics and Local Geometry for Human-Object Interaction Generation

MaMi-HOI:协调全局运动学与局部几何以生成人-物交互

Hao Wang, Shiqi Wang, Qi Liu

机构 * School of Future Technology, South China University of Technology, Guangzhou, Guangdong, China(未来技术学院,华南理工大学,广州,广东,中国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MaMi-HOI框架,通过几何感知接近适配器和运动学和谐适配器协调宏观运动流畅性与微观空间精度,实现自然运动与精确接触的平衡,扩展了长轨迹生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05664 2026-05-08 cs.CV 57%

Sparse-to-Complete: From Sparse Image Captures to Complete 3D Scenes

稀疏到完整:从稀疏图像捕获到完整3D场景

Yiyang Shen, Yin Yang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) University of Utah(犹他大学) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出S2C-3D框架,通过六到八张图像实现高保真完整场景重建,结合专用扩散模型、视图一致性条件采样和相机轨迹规划,提升3D重建质量与鲁棒性。

Journal ref SIGGRAPH 2026 Conf. Proc

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19675 2026-05-08 cs.CV 57%

MedFlowSeg: Flow Matching for Medical Image Segmentation with Frequency-Aware Attention

MedFlowSeg: 基于频率感知注意力的医学图像分割中的流匹配

Zhi Chen, Runze Hu, Le Zhang

机构 * School of Engineering, University of Birmingham(伯明翰大学工程学院) School of Public Health, Peking University(北京大学公共卫生学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MedFlowSeg,通过流匹配框架将医学图像分割建模为学习时间依赖的向量场,以更高效地推断并保持生成模型的灵活性。引入双条件机制和频率感知注意力模块,提升结构一致性与边界定义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22812 2026-05-08 cs.CV 57%

LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer

LC4-DViT:基于变形视觉Transformer的土地覆盖创建用于土地覆盖分类

Kai Wang, Siyi Chen, Weicong Pang, Chenchen Zhang, Renjun Gao, Ziru Chen, Cheng Li, Dasa Gu, Rui Huang, Alexis Kai Hon Lau

机构 * HKUST(香港科技大学) SSE, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)电子工程系) JHU(约翰·霍普金斯大学) NUS(新加坡国立大学) MUST(慕斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LC4-DViT框架,结合生成数据创建与变形感知视觉Transformer,提升高分辨率土地覆盖制图精度,优于基线模型和传统网络。

Comments This work has been submitted to the IEEE for possible publication.The project is available at https://github.com/weicongpang/LVC2-DViT.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06500 2026-05-08 cs.LG cs.AI 50%

Operator-Guided Invariance Learning for Continuous Reinforcement Learning

操作引导的不变性学习用于连续强化学习

Zuyuan Zhang, Fei Xu Yu, Tian Lan

机构 * The George Washington University(乔治华盛顿大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出VPSD-RL,通过Lie群作用和拉回算子发现连续强化学习中的价值保持结构,提升学习稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06405 2026-05-08 q-fin.MF 50%

Funding-Aware Optimal Market Making for Perpetual DEXs

考虑资金因素的永续合约市场做市优化

Nam Anh Le

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究资金率作为随机变量时永续合约的最优做市,通过耦合库存与资金支付,构建简化控制问题并采用单调有限差分法求解,校准Hyperliquid数据后,资金意识HJB在提升ETH/BTC表现的同时降低库存RMS,SOL收益正但非帕累托改进。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06304 2026-05-08 q-bio.NC 50%

A multi-scale information geometry reveals the structure of mutual information in neural populations

多尺度信息几何揭示神经群体中互信息的结构

Simone Azeglio, Steeve Laquitaine, Ulisse Ferrari, Matthew Chalk

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种多尺度信息几何方法,通过基于原理的距离收缩机制揭示神经群体中互信息的结构,利用扩散模型估计度量张量,为神经编码提供了信息论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06272 2026-05-08 cs.LG 50%

A Flow Matching Algorithm for Many-Shot Adaptation to Unseen Distributions

用于未知分布的多示例适应的流匹配算法

Tyler Ingebrand, Ruihan Zhao, Kushagra Gupta, David Fridovich-Keil, Sandeep P. Chinchali, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :image generation(abstract)

AI总结 本文提出FP-FM算法,通过学习基函数生成速度场,实现对新分布的高效样本生成,且在未见过的分布上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06208 2026-05-08 physics.soc-ph cond-mat.dis-nn cond-mat.stat-mech 50%

Two-mode geometry controls multiscale organization in bipartite systems

双模式几何控制双分系统中的多尺度组织

Ottavia Falconi, Giulio Cimini, Pablo Villegas

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于拉普拉斯的重整化框架,用于双分系统中保留角色分离的多尺度结构分析,揭示了双模式几何对多尺度组织的关键作用。

Comments 8 pages, 4 figures and supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06140 2026-05-08 cs.LG cs.AI 50%

SymDrift: One-Shot Generative Modeling under Symmetries

SymDrift: 在对称性下的一次生成建模

Samir Darouich, Vinh Tong, Lluís Pastor-Pérez, Tanja Bien, Loay Mualem, Mathias Niepert

机构 * Institute of Artificial Intelligence(人工智能研究所) University of Stuttgart(斯图加特大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 SymDrift通过引入对称感知的漂移场和G不变嵌入,解决漂移模型在对称性下的挑战,提升一次生成建模的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏