arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-13 至 2026-05-13 共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 94 篇

2605.11387 2026-05-13 cs.LG cs.RO 50%

Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

多模态生成策略细调中的行为模式发现

Alberta Longhini, David Emukpere, Jean-Michel Renders, Seungsu Kim

机构 * Naver Labs Europe(纳维尔实验室欧洲分部) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种无监督的行为模式发现框架,用于在强化学习细调多模态生成策略时保持行为多样性,通过互信息作为内在奖励提升任务成功率。

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11199 2026-05-13 hep-lat cs.LG 50%

Operator Spectroscopy of Trained Lattice Samplers

训练晶格采样器的运算谱分析

Moxian Qian

机构 * Johannes Gutenberg University Mainz(杰尼森-古腾堡大学马因茨)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究训练后的晶格采样器的运算谱特性,通过投影到固定基底来区分不同采样器类别,发现不同基底对残差的影响差异。

Comments 26 pages, 13 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10980 2026-05-13 cs.LG cs.AI 50%

LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection

LEAP: 通过前瞻性早期收敛令牌检测解锁dLLM并行性

Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 LEAP通过前瞻性早期收敛令牌检测方法,有效降低dLLM解码延迟和步骤,减少约30%的去噪步骤,提升并行解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10506 2026-05-13 math.AP 50%

Global uniform regularity for the 3D compressible MHD equations near a background magnetic field

三维可压缩磁流体力学方程在背景磁场附近全局均匀正则性

Jincheng Gao, Xianpeng Hu, Lianyun Peng, Jiahong Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了三维可压缩磁流体力学方程在背景磁场下的全局正则性问题,通过构造四层能量函数并利用背景磁场的稳定效应,建立了与粘度和垂直电阻无关的全局时间统一界,揭示了磁场增强耗散和稳定流体动力学的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09523 2026-05-13 cs.LG cs.CE cs.NA math.NA physics.comp-ph stat.ML 50%

HS-FNO: History-Space Fourier Neural Operator for Non-Markovian Partial Differential Equations

HS-FNO:用于非马尔可夫偏微分方程的历史-空间傅里叶神经算子

Lennon J. Shikhman

机构 * College of Computing, Georgia Institute of Technology(计算学院,佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出HS-FNO,一种针对具有延迟和记忆驱动的偏微分方程的历史-空间傅里叶神经算子,通过分解历史状态更新为预测器和精确转移,减少学习维度并提升非马尔可夫动态的模拟效果。

Comments 15 pages, 4 figures, 1 table. Code at https://github.com/lennonshikhman/hs-fno/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08571 2026-05-13 cs.RO 50%

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON:通过最佳努力适应进行跨领域生成机器人策略的协同训练

Antong Zhang, Han Qi, Heng Yang

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 BEACON提出一种理论驱动框架,通过大量源演示和有限目标演示训练生成机器人策略,通过跨领域协同训练提升鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03409 2026-05-13 cs.CE cs.AI 50%

Generative AI for material design: A mechanics perspective from burgers to matter

生成AI在材料设计中的应用:从伯格到物质的力学视角

Vahidullah Tac, Ellen Kuhl

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文从力学角度探讨生成AI在高维空间中设计物质的可能性,通过伯格类比展示扩散生成模型与计算力学的联系,并在高维空间中验证其在材料设计中的有效性。

Comments 25 pages, 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22363 2026-05-13 quant-ph 50%

A field-biased quantum master equation and its Markovian limit

一个受场偏置的量子主方程及其马尔可夫极限

M. Gabriela Boada G., Andrea Delgado, Jose Morales E

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个非平衡量子主方程,用于描述在持续电磁场作用下驱动的开放量子系统,探讨了场偏置噪声相关性和非马尔可夫动力学的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09073 2026-05-13 quant-ph physics.optics 50%

Near-optimal discrimination of displaced squeezed binary signals using displacement, inverse-squeezing, and photon-number-resolving detection

利用位移、反压缩和光子数分辨检测近最优区分位移压缩二进制信号

Enhao bai, Jian Peng, Tianyi Wu, Kai Wen, Fengkai Sun, Chun Zhou, Yaping Li, Zhenrong Zhang, Chen Dong

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出反压缩Kennedy接收器,用于区分二进制相位调制位移压缩真空态,通过反压缩增强光子数对比度,实现超越标准量子限和Helstrom界,且在实际参数下保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07384 2026-05-13 cs.LG 50%

CompNO: A Novel Foundation Model approach for solving Partial Differential Equations

CompNO:一种用于求解偏微分方程的新型基础模型方法

Hamda Hmida, Hsiu-Wen Chang Joly, Youssef Mesri

机构 * Mines Paris - PSL University, Centre for Material Forming (CEMEF)(巴黎 Mines - PSL 大学,材料成型中心(CEMEF)) Mines Paris - PSL University, Centre for Robotics (CAOR)(巴黎 Mines - PSL 大学,机器人中心(CAOR))

专题命中 扩散模型 :diffusion(abstract)

AI总结 CompNO通过学习基础块和适应块构建参数化PDE求解器,降低计算成本并保持物理可解释性,适用于一维对流、扩散、对流-扩散和Burgers方程。

Comments Under review at MDPI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16127 2026-05-13 stat.ML cs.LG 50%

Learning density ratios in causal inference using Bregman-Riesz regression

利用Bregman-Riesz回归学习因果推断中的密度比

Oliver J. Hines, Caleb H. Miles

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Bregman-Riesz回归框架,统一了密度比估计的三种方法,并展示如何通过数据增强技术应用于因果问题,同时提供Python工具实现。

Comments Replication code is available from https://github.com/CI-NYC/densityratios

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07405 2026-05-13 math.AP 50%

Fujita Phenomenon for a Mixed Local-Nonlocal Hardy-Hénon Equation with Regularly Varying Time Weights

Fujita现象对于具有定期变化时间权重的混合局部-非局部Hardy-Hénon方程

Rihab Ben Belgacem, Mohamed Majdoub

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了一类混合局部-非局部扩散算子驱动的半线性抛物型方程的Cauchy问题,探讨了临界Fujita指数下的有限时间爆破和全局存在性条件,并首次分析了非线性扩散方程在具有此类时间依赖系数下的爆破现象。

Comments The proof of Theorem 1.6 has been revised, and the overall presentation has been improved

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04788 2026-05-13 cond-mat.mes-hall quant-ph 50%

Quantum-impurity sensing of altermagnetic order

量子杂质传感的交替磁序

V. A. S. V. Bittencourt, Hossein Hosseinabadi, Jairo Sinova, Libor Šmejkal, Jamir Marino

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用单个自旋缺陷进行量子传感,可探测凝聚态系统的微观性质。本文展示NV中心在钻石中通过量子弛豫率揭示交替绝缘体的各向异性自旋动力学及其特征自旋极化带。

Comments 5 pages, 3 figures plus Supplementary material

Journal ref Phys. Rev. Lett. 136, 146701 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20540 2026-05-13 astro-ph.HE 50%

Optical Flares in the Luminous Fast Blue Optical Transient AT2022tsd ("Tasmanian Devil")

亮快速蓝光学暂现源AT2022tsd("塔斯马尼亚恶魔")中的光学耀斑

Rachid Ouyed

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出亮快速蓝光学暂现源(LFBOT)是致密中子星延迟转化为高磁场混合星的过程,通过QCD磁星模型解释其核心相变及磁场生成,预测光学耀斑源于碎片化喷流中的辐射释放。

Comments Extended version (18 journal pages, 6 figures, 1 table). To appear in RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17290 2026-05-13 physics.bio-ph cond-mat.stat-mech 50%

Membrane-Associated Self-Assembly for Cellular Decision Making

膜关联自组装用于细胞决策

Samuel L. Foley, Margaret E. Johnson

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过膜关联自组装实现细胞决策,展示其作为可调且稳健的开关作用,比其他被动机制更敏感,推导出关键受体密度表达式。

Comments Manuscript: 8 pages, 4 figures. SI: 10 pages, 4 figures. Accepted for publication in Physical Review Research

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2605.12144 2026-05-13 cs.CV 57%

PoseCompass: Intelligent Synthetic Pose Selection for Visual Localization

PoseCompass: 用于视觉定位的智能合成姿态选择

Yanan Zhou, Zhaoyan Qian, Yanli Li, Nan Yang, Zhongliang Guo, Dong Yuan

机构 * The University of Sydney(悉尼大学) University of St Andrews(圣安德鲁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoseCompass通过智能姿态选择提升基于3DGS的APR性能,减少适应时间并降低姿态误差,优于随机基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 57%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2509.22414 2026-05-13 cs.CV 79%

LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer

LucidFlux:一种无需图像描述的高质量图像修复方法

Song Fei, Tian Ye, Lujia Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 LucidFlux通过大规模扩散变压器实现无描述图像修复,引入轻量双分支条件器和自适应调制方案,提升几何精度与纹理恢复,优于开源和商业基线。

Comments Project Page: https://w2genai-lab.github.io/LucidFlux

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV 57%

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16515 2026-05-13 physics.geo-ph 50%

Generative deep learning improves reconstruction of global historical climate records

生成深度学习改进全球历史气候记录的重建

Zhen Qian, Teng Liu, Sebastian Bathiany, Shangshang Yang, Philipp Hess, Nils Bochow, Christian Burmester, Maximilian Gelbrecht, Brian Groenke, Niklas Boers

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出一种统一的概率生成深度学习框架,通过学习地球系统动力学的生成先验,改进了全球历史气候记录的重建,揭示了1850年以来未解决的气候变异,尤其在极地地区表现出更高的变暖水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2605.12138 2026-05-13 cs.CV cs.CL cs.IR 57%

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

专题命中 个性化与一致性 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12002 2026-05-13 cs.CV 57%

EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization

EDGER: 基于热图细化的边缘引导图像伪造定位

Minh-Khoa Le-Phan, Minh-Hoang Le, Minh-Triet Tran, Trong-Le Do

机构 * University of Science - VNU-HCM(越南国家大学-胡志明市大学) Vietnam National University(越南国家大学)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 EDGER通过边缘引导分割和合成热图分支,实现任意分辨率图像中伪造区域的精准定位,具备跨域泛化能力。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11927 2026-05-13 cs.CV 57%

RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation

RealDiffusion:用于多角色故事书生成的物理信息注意力

Qi Zhao, Jun Chen, Ivor Tsang, Guang Dai

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang Normal University(浙江师范大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RealDiffusion通过引入物理信息注意力机制,解决多角色故事生成中叙事动态与角色一致性之间的平衡问题,提升角色连贯性并保持叙事活力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16344 2026-05-13 math.NA cs.NA 50%

Diff-ANO: Towards Fast High-Resolution Ultrasound Computed Tomography via Conditional Consistency Models and Adjoint Neural Operators

Diff-ANO:通过条件一致性模型和伴随神经算子实现快速高分辨率超声计算断层扫描

Xiang Cao, Qiaoqiao Ding, Xinliang Liu, Lei Zhang, Xiaoqun Zhang

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出Diff-ANO框架,结合条件一致性模型与伴随算子学习,解决传统方法在USCT中面临的问题,提升计算效率与重建质量,尤其在稀疏视图和部分视图条件下表现突出。

Comments 27 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 5 篇

2605.12134 2026-05-13 cs.CV cs.LG 83%

MULTI: Disentangling Camera Lens, Sensor, View, and Domain for Novel Image Generation

MULTI: 解构相机镜头、传感器、视角和领域以实现新图像生成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Danda Pani Paudel

机构 * Bosch Research(博世研究) ETH Zürich(苏黎世联邦理工学院) University of Siegen(锡根大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MULTI通过文本逆向学习解构图像生成中的多因素,提升对特定风格和对象的控制能力,并通过DF-RICO基准验证其有效性。

Comments Accepted at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11883 2026-05-13 cs.CY cs.AI cs.CV 70%

Position: Universal Aesthetic Alignment Narrows Artistic Expression

位置:通用审美对齐限制了艺术表达

Wenqi Marshall Guo, Qingyun Qian, Khalad Hasan, Shan Du

机构 * Department of CMPS, University of British Columbia, Kelowna, Canada(计算机科学与工程系,不列颠哥伦比亚大学,加拿大克洛维纳)

专题命中 图像生成评测 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本文探讨了将图像生成模型过度对齐通用审美偏好与用户意图冲突的问题,指出生成模型倾向于产生传统美观输出,忽视用户对低质量或负面图像的指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11696 2026-05-13 cs.CV cs.AI cs.GR 62%

WildRelight: A Real-World Benchmark and Physics-Guided Adaptation for Single-Image Relighting

WildRelight:一个现实世界基准和基于物理的适应方法用于单图像照明

Lezhong Wang, Mehmet Onurcan Kaya, Siavash Bigdeli, Jeppe Revall Frisvad

机构 * Technical University of Denmark(丹麦技术大学) Inria(法国国家信息与自动化研究所)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出WildRelight,首个现实世界单图像照明评估数据集,通过严格对齐的自然光照和高动态范围环境图,揭示了合成数据训练模型在现实世界中的域移问题,并引入基于物理的推理框架实现自监督适应。

Comments Companion paper to the CVPR26 findings paper 'WildRelight', introducing the physics-guided adaptation method evaluated on the dataset. Project Page: https://lez-s.github.io/wildrelight_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11601 2026-05-13 cs.CL cs.AI 50%

DiffScore: Text Evaluation Beyond Autoregressive Likelihood

DiffScore:超越自回归似然的文本评估

Wen Lai, Yingli Shen, Dingnan Jin, Qing Cui, Jun Zhou, Maosong Sun, Alexander Fraser

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 DiffScore通过基于掩码大扩散语言模型的掩码重建方法,消除位置偏差,建立从局部流畅到全局连贯的评估体系,并提供诊断工具提升文本评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11479 2026-05-13 cs.RO cs.AI 50%

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

通过折扣存活公式评估操纵策略的离线策略评估

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。

Comments Published at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 5 篇

2605.09430 2026-05-13 cs.CV 80%

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

FlashAR: 用于自回归图像生成的高效后训练加速

Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) University of Adelaide(阿德莱德大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出FlashAR框架,通过双向往前预测将预训练自回归模型转化为高效并行生成器,实现512x512图像生成速度提升22.9倍。

Comments Post-training acceleration for autoregressive image generation, code is available at https://lxazjk.github.io/FlashAR/

详情

展开后加载摘要…

URL PDF HTML 收藏