arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-22 至 2026-05-22 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 60 篇

2605.21722 2026-05-22 cond-mat.stat-mech cond-mat.mtrl-sci cs.LG 50%

MetaDNS: Enhancing Exploration in Discrete Neural Samplers via Well-Tempered Metadynamics

MetaDNS: 通过良好温控元动力学增强离散神经采样器的探索

Xiaochen Du, Juno Nam, Jaemoo Choi, Wei Guo, Sathya Edamadaka, Junyi Sha, Elton Pan, Yongxin Chen, Molei Tao, Rafael Gómez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出MetaDNS,一种将良好温控元动力学整合到离散扩散或自回归采样器中的通用框架,以解决多模式和能量屏障离散分布采样中的模式崩溃问题,并实现自由能重建。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21716 2026-05-22 math.NA cs.NA 50%

Structure-preserving upwind DG scheme for a Cahn-Hilliard-Darcy model of tumor growth

保持结构的迎风DG方案用于肿瘤生长的Cahn-Hilliard-达西模型

Daniel Acosta-Soba, Francisco Guillén-González, J. Rafael Rodríguez-Galván

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种保持结构的数值方案,用于描述在饱和多孔介质中肿瘤生长的Cahn-Hilliard-达西模型。该方案通过从一般框架中推导出一个物理一致的模型,保证质量守恒和相场及营养变量的点wise界,并具有递减的能量定律。该模型将肿瘤细胞的演化通过Cahn-Hilliard方程与通过趋化相互作用的营养扩散方程耦合,并通过引入由达西定律描述的周围流体效应扩展了模型。随后,我们提出了一种完全离散的方案,结合了空间中的迎风不连续Galerkin方法和时间中的凸分裂策略,继承了连续模型的基本性质:质量守恒、点wise界和离散能量定律。我们的理论分析辅以数值实验,展示了所提方案的鲁棒性,并展示了周围流体对肿瘤演化的影响。

Comments 36 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21692 2026-05-22 cs.LG stat.ML 50%

Representation Gap: Explaining the Unreasonable Effectiveness of Neural Networks from a Geometric Perspective

表示差距:从几何视角解释神经网络的不合理有效性

David Perera, Victor Moura, Lais Isabelle Alves dos Santos, Michel F. C. Haddad, Flavio Figueiredo

机构 * Universidade Federal de Minas Gerais(巴西联邦大学矿务学院) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文从几何视角出发,研究神经网络的表示差距,提出一个与泛化误差密切相关的度量标准,并展示其在更广泛任务和训练算法中的适用性,通过实验证明该理论在合成数据和现实数据中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21579 2026-05-22 astro-ph.GA 50%

Interstellar Medium-Driven Orbital Transport -- I. Radial Heating and Migration

星际介质驱动的轨道传输 -- I. 径向加热与迁移

Shaunak Modak, Chris Hamilton, Eve C. Ostriker, Scott Tremaine

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究星际介质通过引力扰动驱动恒星轨道加热和迁移的过程,采用更真实的星际介质密度波动模型,揭示了径向加热与迁移的非传统尺度关系及低加热-迁移比。

Comments 31 pages, 10 figures. Submitted to ApJ, comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12836 2026-05-22 cs.LG 50%

Discrete Stochastic Localization for Non-autoregressive Generation

非自回归生成的离散随机定位

Yunshu Wu, Jiayi Cheng, Longxuan Yu, Partha Thakuria, Rob Brekelmans, Evangelos E. Papalexakis, Greg Ver Steeg

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种连续状态框架,通过单位球体令牌嵌入实现离散随机定位,以提高离散序列生成的分布忠实度,并展示了在OpenWebText上改进MAUVE指标的效果。

Comments This work was intended as a replacement of arXiv:2602.16169 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21717 2026-05-22 cs.LG 50%

Uncertainty-Aware Distribution-to-Distribution Flow Matching for Scientific Imaging

面向科学成像的不确定性感知分布到分布流匹配

Dongxia Wu, Yuhui Zhang, Serena Yeung-Levy, Emma Lundberg, Emily B. Fox

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种面向科学成像的不确定性感知分布到分布流匹配方法,通过引入贝叶斯随机流匹配和抗变异不确定性量化技术,提升模型在分布偏移下的泛化能力,并有效估计epistemic和aleatoric不确定性,从而检测不可靠的生成结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16169 2026-05-22 cs.LG cs.CL 50%

Discrete Stochastic Localization for Non-autoregressive Generation

非自回归生成的离散随机定位

Yunshu Wu, Jiayi Cheng, Longxuan Yu, Partha Thakuria, Rob Brekelmans, Evangelos E. Papalexakis, Greg Ver Steeg

机构 * University of California Riverside(加州大学河滨分校) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种名为离散随机定位(DSL)的连续状态框架,通过单位球体令牌嵌入实现最优去噪,从而在离散序列生成中提升分布忠实度,并展示了其在OpenWebText上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2605.21611 2026-05-22 cs.CV cs.LG 83%

UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation

UniVL:统一的视觉-语言嵌入用于空间接地的上下文图像生成

Jiayun Wang, Yu Wang, Weijie Gan, Zhenting Wang, Wei Wei

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一的视觉-语言嵌入方法,通过单一的视觉输入直接将语义绑定到空间位置,从而减少计算并提高图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21766 2026-05-22 cs.CV cs.GR 62%

BodyReLux: Temporally Consistent Full-Body Video Relighting

BodyReLux: 时序一致的全身人体视频重照明

Li Ma, Mingming He, Xueming Yu, David M. George, Ahmet Levent Taşel, Paul Debevec, Julien Philip

机构 * Eyeline Labs(Eyeline实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出BodyReLux,一种基于视频扩散的框架,用于在时序一致的方式下重照明全身人体表演。该方法利用混合数据集训练,结合传统静态单光源捕捉和新型动态表演捕捉技术,通过引入新的光照条件表示方法和数据增强管道,实现了高质量、鲁棒且时序一致的视频重照明。

Comments Siggraph 2026 Journal Track. Project page: https://eyeline-labs.github.io/bodyrelux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17623 2026-05-22 cs.CV cs.GR 62%

ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes

ViPS: 为自动绑定网格的视频感知姿态空间

Honglin Chen, Karran Pandey, Rundi Wu, Matheus Gadelha, Yannick Hold-Geoffroy, Ayush Tewari, Niloy J. Mitra, Changxi Zheng, Paul Guerrero

机构 * Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究) University of Cambridge(剑桥大学) University College London(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出ViPS,一种通过视频扩散模型提取运动先验来发现自动绑定网格有效姿态分布的前馈框架,实现了对多样形状变化、逆向运动学和动画的关键帧生成的支持。

Comments Project page: https://honglin-c.github.io/vips/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11642 2026-05-22 cs.RO 50%

Noise-Space Attribution and Control of Chunk-Boundary Artifact

噪声空间中的属性分析与块边界伪影控制

Rui Wang

机构 * Rui Wang(1 王瑞)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了生成视觉-运动策略中块边界伪影的机制,通过分析噪声空间中的变量,展示了如何通过控制隐含噪声来调节伪影,并证明伪影变化可以影响最终任务结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2605.22147 2026-05-22 cs.CV 57%

Flow-based Gaussian Splatting for Continuous-Scale Remote Sensing Image Super-Resolution

基于流的高斯点散射用于连续尺度遥感图像超分辨率

Jiangwei Mo, Xi Lu, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FlowGS框架,通过流匹配和高斯点散射实现任意尺度的遥感图像超分辨率,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2605.22743 2026-05-22 cs.LG 75%

SeqLoRA: Bilevel Orthogonal Adaptation for Continual Multi-Concept Generation

SeqLoRA: 为持续多概念生成的双水平正则化适应

Javad Parsa, Enis Simsar, Amir Joudaki, Thomas Hofmann, André M. H. Teixeira

机构 * Uppsala University(乌普萨拉大学) ETH Zurich(苏黎世联邦理工学院) Sweden(瑞典)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出SeqLoRA,一种双水平优化框架,通过联合优化LoRA因素来解决文本到图像扩散模型中多自定义概念组合时的表示干扰问题,提高了身份保持性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22448 2026-05-22 cs.AI 67%

S2ED: From Story to Executable Descriptions for Consistency-Aware Story Illustration

S2ED:从故事到可执行描述以实现一致性感知的故事插图

Sijing Yin, Jiamou Liu, Xiao Tang, Yaser Shakib, Qian Liu

机构 * University of Auckland(奥克兰大学) Wuhan College of Communication(武汉通信学院)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出S2ED框架,通过将完整故事转换为可编辑的可执行描述,提升故事插图的一致性和角色真实性,适用于多帧故事插图的长时程一致性需求。

Comments 6 pages, 5 figures. Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18094 2026-05-22 eess.AS cs.SD 50%

OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion

OneVoice: 一个模型,三种场景——迈向统一的零样本语音转换

Zhichao Wang, Tao Li, Wenshuo Ge, Zihao Cui, Shilei Zhang, Junlan Feng

机构 * JIUTIAN Research(钧天研究院) China Mobile(中国移动) Beijing, China(北京,中国)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出OneVoice,一种能够统一处理语音转换三种场景(语音克隆、语言保护和歌唱)的零样本框架,通过混合专家机制和双路径路由机制实现统一建模,并采用两阶段训练策略解决数据不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2605.22469 2026-05-22 cs.CV 70%

MaSC: A Masked Similarity Metric for Evaluating Concept-Driven Generation

MaSC:一种用于评估概念驱动生成的遮蔽相似度度量

Patryk Bartkowiak, Lennart Petersen, Bartosz Kotrys, Dominik Michels, Soren Pirk, Wojtek Palubicki

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) Kiel University(基尔大学) ArtCollect(艺术收藏) KAUST(卡塔尔科技大学)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MaSC,一种基于遮蔽的相似度度量方法,用于评估文本到图像扩散模型中单概念个性化生成的保真度和提示遵循性,通过使用外部提供的前景概念遮罩将评估分解为针对主体的概念保真度和基于背景的提示遵循性。

Comments 20 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21682 2026-05-22 astro-ph.SR astro-ph.GA 50%

The Absolute Age of the Open Cluster NGC 6791 and Its Implications for Galactic Archaeology and Asteroseismic Calibration

NGC 6791 开放星团的绝对年龄及其对银河考古和恒星震颤校准的启示

George Dufresne, Brian Chaboyer, Rayna Rampalli

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文通过结合Gaia DR3光度数据和NGC 6791中的分离食双星,利用10,000个蒙特卡洛等时线集确定了NGC 6791的绝对年龄,揭示了其年龄、金属丰度和距离模等参数,并探讨了其对银河考古和恒星震颤校准的影响。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2605.22060 2026-05-22 cs.CR cs.AI 71%

Safeguarding Text-to-Image Generative Models Against Unauthorized Knowledge Distillation

防范未经授权的知识蒸馏的文本到图像生成模型

Yilan Gao, Sida Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学电子学院(iOPEN)、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信) The University of Hong Kong(香港大学)

专题命中 效率与蒸馏 :text-to-image(title)

AI总结 本文提出WaveGuard,一种单次生成器基保护框架,通过在用户指定的扰动预算下保护发布的合成图像,以防止未经授权的知识蒸馏和能力复制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23582 2026-05-22 cs.CV 70%

RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization

RobuQ: 通过鲁棒激活量化推动DiTs至W1.58A2

Kaicheng Yang, Xun Zhang, Haotong Qin, Yucheng Lin, Kaisen Yang, Xianglong Yan, Yulun Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Tsinghua University, Beijing, China(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出RobuQ框架,通过鲁棒激活量化技术,解决了DiTs在极低比特下的部署问题,实现了在子4比特量化配置下的最佳性能,首次在大规模数据集上实现了稳定且具有竞争力的图像生成。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22718 2026-05-22 cs.CV 57%

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV: 通过世界检索和压缩实现高效的world内存

Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Naver AI Lab(Naver人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldKV,一种无需训练的框架,通过世界检索和压缩技术,在保持一致性的同时提高效率,实现在Matrix-Game-2.0和LingBot-World-Fast数据集上达到或超越全KV内存保真的性能。

Comments Project Page: https://cvlab-kaist.github.io/WorldKV/

详情

展开后加载摘要…

URL PDF HTML 收藏