arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-05 至 2026-06-05 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2606.05195 2026-06-05 math.NA cs.NA math.PR 50%

Euler Scheme for Stochastic Functional Differential Equations Driven by Fractional Brownian Motion via Fractional Calculus Techniques

基于分数阶微积分技术的分数布朗运动驱动随机泛函微分方程的欧拉格式

Alexander Abreu, Héctor Araya, Lisandro Fermin, Johanna Garzón, Soledad Torres

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对Hurst参数H>1/2的分数布朗运动驱动的带记忆随机泛函微分方程,提出并分析了基于分数阶微积分的欧拉型数值格式,证明了收敛性并给出了收敛阶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19642 2026-06-05 cond-mat.mtrl-sci 50%

Corrosion Evolution of T91 Steel in Static Lead-Bismuth Eutectic Under an Oxidising Environment

T91钢在静态铅铋共晶中的腐蚀演变

Minyi Zhang, Weiyue Zhou, Michael P. Short, Paul A. J. Bagot, Michael P. Moody, Felix Hofmann

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在氧化环境中T91钢在静态铅铋共晶中的腐蚀行为,探讨腐蚀层的形成机制及其对腐蚀速率的影响,发现保护层的形成对腐蚀过程有决定性作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11319 2026-06-05 cs.LG stat.ML 50%

On the Robustness of Langevin Dynamics to Score Function Error

关于对数动力学对分数函数误差的鲁棒性

Daniel Yiming Cao, August Y. Chen, Karthik Sridharan, Yuchen Wu

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于分数函数的生成模型对分数函数估计误差的鲁棒性,发现对数动力学在L2误差(更一般地Lp误差)下并不鲁棒,即使在高维简单分布中,即使分数函数估计误差非常小,对数动力学在多项式时间内运行也会导致与目标分布的总变差距离很大,这进一步支持了扩散模型优于对数动力学。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18674 2026-06-05 physics.flu-dyn physics.ao-ph physics.geo-ph 50%

Meltwater transport and mixing layer growth near the ice--ocean interface

冰水输送与冰-海洋界面混合层增长

Sofía Allende, Louis-Alexandre Couston, Simon Thalabard, Benjamin Favier

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究冰融化进入盐水在极地海洋冰-海洋界面的动力学作用,通过高分辨率数值模拟分析湍流对混合层增长的影响,发现混合层超扩散增长而界面边界层扩散增长,揭示了双扩散效应的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08713 2026-06-05 math.AP math.FA 50%

An existence result in annular regions times conical shells and its application to nonlinear Poisson systems

环形区域与锥形壳体中的存在性结果及其在非线性泊松系统中的应用

Gennaro Infante, Giovanni Mascali, Jorge Rodríguez-López

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过拓扑方法在规范空间中提出了一种新的非线性算子系统的存在性结果,解决方案位于环形区域与锥形壳体的乘积中,并将其应用于带有齐次狄利克雷边界条件的非线性泊松方程系统,证明了所有分量非平凡的解的存在性和局部化,还给出了一个具体的例子和数值近似解,最后将结果应用于具有源项的竞争物种反应-扩散洛特卡-沃勒茨系统。

Comments 21 pages, 4 figures

Journal ref Annali di Matematica (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21430 2026-06-05 cs.RO 50%

EVE: A Generator-Verifier System for Generative Policies

EVE: 一种生成策略的生成-验证系统

Yusuf Ali, Gryphon Patlin, Karthik Kothuri, Jeremiah Coholich, Muhammad Zubair Irshad, Wuwei Liang, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Toyota Research Institute(丰田研究院) Symbotic Inc.(Symbotic公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13916 2026-06-05 cond-mat.mtrl-sci 50%

Inverse Design of Amorphous Materials with Targeted Properties

无序材料的逆向设计:具有目标性质的非晶材料设计

Jonas A. Finkler, Yan Lin, Tao Du, Jilin Hu, Morten M. Smedskjaer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种针对非晶材料的逆向设计方法,通过引入基于扩散模型的AMDEN框架生成非晶材料结构,并利用能量基的AMDEN变体生成放松结构,同时构建了多种具有不同性质和组成的非晶材料数据集以评估该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20728 2026-06-05 math.PR cs.NA math.NA 50%

Sharp lower error bounds for strong approximation of SDEs with a drift coefficient of Hölder or Sobolev regularity using a Weierstraß scale

强近似SDEs的精确误差下界:使用Weierstraß尺度和Hölder或Sobolev正则性漂移系数

Simon Ellinger, Thomas Müller-Gronbach, Larisa Yaroslavtseva

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了具有有界α-Hölder连续漂移系数和常数扩散系数的SDEs在时间点1处的强近似问题,证明了Euler方案在L^p误差率(1+α)/2下无法进一步改进,并扩展了关于SDEs最终时间近似的结果。

Comments Extension of the results to cover a larger class of algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
0911.2381 2026-06-05 physics.data-an cond-mat.stat-mech cs.LG nlin.CD stat.ME 50%

Analytical Determination of Fractal Structure in Stochastic Time Series

随机时间序列中分形结构的解析确定

Fermín Moscoso del Prado Martín

机构 * Laboratoire de Psychologie Cognitive ( UMR --6146) CNRS \& Aix--Marseille Universit\'e I, Marseille, France

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于贝叶斯评估的分析框架,用于客观准确地推断时间序列的分形结构,同时推导出一种优于现有方法的Hurst指数最大似然估计器。

Comments 9 pages, 4 figures

Journal ref Psychological Methods (2013) 18(4):514-34

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2604.20329 2026-06-05 cs.CV cs.AI 70%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 可控生成 :image generation(abstract);generative vision(abstract);分类 cs.CV

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06390 2026-06-05 cs.CV cs.AI 57%

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

机构 * Ace Robotics(Ace机器人公司) CUHK MMLab(香港大学多模态实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01935 2026-06-05 cs.CV 57%

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

机构 * Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05979 2026-06-05 cs.RO cs.AI 50%

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

世界-语言-动作模型:统一世界建模、语言推理与动作合成

Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan Zhao, Zhijie Wei, Xiao Xia, Xueqi Li, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海研究院) HUST(华中科技大学) SCUT(华南理工大学) ECUST(东华大学) SHU(上海大学) NJUPT(南京工业大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2606.06158 2026-06-05 cs.CV 79%

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

通过时间冗余掩码和潜在修复的自适应分词

Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das, Gouranga Bala, R. Venkatesh Babu, Rajeshkumar SA

机构 * Phronetic AI IISc Bangalore IIT Bombay

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 提出一种无参数的自适应视频分词机制,利用冻结连续分词器的潜在空间中的时间冗余,通过阈值丢弃冗余位置,并使用轻量级潜在修复变压器重建,实现内容驱动的令牌分配和高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2602.03410 2026-06-05 cs.CV 77%

UnHype: CLIP-Guided Hypernetworks for Dynamic LoRA Unlearning

UnHype: 基于CLIP的超网络用于动态LoRA反学习

Piotr Wójcik, Maksym Petrenko, Wojciech Gromski, Przemysław Spurek, Maciej Zieba

机构 * Institute of Computer Science, University of Warsaw(华沙大学计算机科学研究所)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出UnHype框架,通过将超网络引入单概念和多概念LoRA训练,解决传统LoRA方法在概念语义适应性差、难以平衡删除相关概念与保持泛化能力以及多概念同时删除时的可扩展性问题,展示了在物体擦除、名人擦除和色情内容删除等任务中的有效性。

Comments 23 pages, 11 figures. Accepted at ICML 2026. Code: https://github.com/gmum/UnHype/ Project Page: https://gmum.github.io/UnHype/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2606.06412 2026-06-05 cond-mat.dis-nn quant-ph stat.ML 50%

Nonreversible Gauge Fields in Fokker--Planck Dynamics: Supersymmetric Hamiltonians and Learned Finite Forces

福克-普朗克动力学中的不可逆规范场:超对称哈密顿量与学习到的有限力

Masayuki Ohzeki

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文通过规范场形式化描述保持稳态密度的不可逆扰动,将福克-普朗克动力学与超对称哈密顿量联系起来,并引入有限时间正则化目标与演员-评论家程序学习最优规范场。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08318 2026-06-05 cs.LG cs.AI cs.NA math.NA physics.comp-ph stat.ML 50%

When Attention Beats Fourier: Multi-Scale Transformers for PDE Solving on Irregular Domains

当注意力胜过傅里叶:用于不规则域上的PDE求解的多尺度变换器

Brandon Yee, Pairie Koh, Jack Rodriguez, Mihir Tekal

机构 * Physics Lab, Yee Collins Research Group(Yee Collins研究组物理实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文研究了深度学习模型在求解偏微分方程(PDE)时的架构选择问题,探讨了基于学习注意力的变换器架构在何时优于傅里叶域神经算子。引入了多尺度注意力变换器(MSAT),该架构将时空解的历史编码为令牌序列,并通过复合监督目标进行端到端训练。在五个基准问题上,与九种基线方法(包括物理信息神经网络、神经算子和状态空间模型)进行了全面的实证评估,展示了在复杂几何问题上的最佳泛化能力。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03555 2026-06-05 cs.MA cs.AI cs.SI 50%

Benchmarking Emergent Coordination in Large-Scale LLM Populations: An Evaluation Framework on the MoltBook Archive

在大规模大语言模型群体中评估涌现协调:对MoltBook档案库的评估框架

Brandon Yee, Pairie Koh

机构 * Management Lab, Yee Collins Research Group(Yee Collins研究组管理实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出了一种评估框架,用于在开放代理环境中评估角色专业化、信息扩散和协作任务解决的涌现协调,通过MoltBook档案库的数据集展示了该框架,并建立了量化基准,揭示了核心-外围结构、重尾级联分布和去中心化任务解决中的严重协调开销。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 4 篇

2606.05703 2026-06-05 cs.CV 79%

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

并行雅可比解码用于快速自回归图像生成

Boya Liao, Ying Li, Siyong Jian, Huan Wang

机构 * Westlake University(西交利物浦大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出并行雅可比解码(PJD),通过二维空间域扩展草稿令牌并调整注意力掩码,实现无需训练的自回归图像生成加速,在保持生成质量的同时获得4.8倍至6.4倍加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06078 2026-06-05 cs.CV 57%

Knowledge Distillation for Visual Autoregressive Models

视觉自回归模型的知识蒸馏

Elia Peruzzo, Aritra Bhowmik, Guillaume Sautiere, Yuki M Asano, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对视觉自回归模型计算开销大的问题,提出VarKD蒸馏框架,通过选择性教师监督和减少令牌级歧义,在ImageNet上多个AR骨干网络中优于现有蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05254 2026-06-05 cs.LG cs.CV cs.RO 57%

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM:面向世界动作模型的模态感知蒸馏

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) EmbodyX Inc.(EmbodyX公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 50%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2606.05188 2026-06-05 cs.CY cs.AI 78%

Assessing the Geographic Diversity of AI's Platial Representations in Image Generation

评估图像生成中AI地点表征的地理多样性

Zilong Liu, Krzysztof Janowicz, Mina Karimi

机构 * Department of Geography and Regional Research, University of Vienna, Austria(维也纳大学地理与区域研究系)

专题命中 其他图像生成 :image generation(title,abstract)

AI总结 本文以GPT和DALL-E模型为例,引入生态学中的物种多样性度量方法,通过相似性加权评估图像生成的地理多样性,发现旧模型可能更具多样性且提示修订比图像生成更促进多样性,同时观察到模型同质性导致缺乏地理多样性。

Comments Full conference paper accepted by the AGILE 2026 (https://agile-gi.eu/conference-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏