arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 177 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 14 篇

2606.29474 2026-06-30 math.OC cs.AI cs.NA math.NA 50%

A Posteriori Error Analysis for Decoupled Neural Approximations of Fully Coupled FBSDEs with Control Mismatch

完全耦合FBSDE解耦神经逼近的后验误差分析与控制失配

Xichuan Zhang

机构 * Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出完全耦合正倒向随机微分方程解耦神经逼近的后验误差分析框架,通过引入辅助控制处理控制失配,导出可计算的后验误差界,数值实验验证了指标的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28886 2026-06-30 math.OC 50%

Optimal control of diffusive mean-field models for swarming particles on the sphere

球面上群集粒子的扩散平均场模型的最优控制

Jinwook Jung, Dohyun Kim

专题命中 可控生成 :diffusion(abstract)

AI总结 针对球面上带扩散的Kuramoto型一致性动力学,研究平均场最优控制问题,控制通过漂移场和相互作用增益实现,证明了微观最优控制收敛到平均场最优控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28351 2026-06-30 cs.IR 50%

HyperSU: Corpus-Driven Semantic-Unit Hypergraph for Retrieval-Augmented Generation

HyperSU:面向检索增强生成的语料驱动语义单元超图

Jiate Liu, Liuyi Chen, Zhengyi Yang, Chuan He, Mingchen Ju, Bocheng Han, Ruyi Liu, Xu Zhou

专题命中 可控生成 :diffusion(abstract)

AI总结 提出HyperSU框架,通过语义单元超图和线索引导的双向检索,解决超图RAG中的幻觉、高索引成本和语义漂移问题,在GraphRAG-Bench上准确率提升14.7%。

Comments 24 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07744 2026-06-30 cs.RO 50%

AeroPlace-Flow: Language-Grounded Object Placement for Aerial Manipulators via Visual Foresight and Object Flow

AeroPlace-Flow:基于视觉前瞻和物体流的语言引导空中机械臂物体放置

Sarthak Mishra, Rishabh Dev Yadav, Naveen Nair, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad, India(印度IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系) Newcastle University, UK(英国新castle大学)

专题命中 可控生成 :image editing(abstract)

AI总结 本文提出AeroPlace-Flow框架,通过视觉前瞻和3D几何推理实现语言引导的空中物体放置,无需预设姿态或任务特定训练,在多样化的空中场景中实现75%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2606.29198 2026-06-30 cs.CV 57%

DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution

DTI: 面向生成式人脸视频超分辨率的动态轨迹初始化

Yingwei Tang, Chen Yan, Wendi Liu, Qiang Hu, Xiaoyun Zhang

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出动态轨迹初始化范式,将生成式人脸视频超分辨率重构为输入驱动的定向恢复,通过增强注入条件机制和判别性引导实现保真度与感知质量的平衡,达到SOTA性能。

Comments This paper is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06764 2026-06-30 eess.IV cs.CV cs.LG math.OC 57%

Fast Equivariant Imaging: Accelerating Unsupervised Learning and Model Adaptation via Inexact Splitting

快速等价成像:通过不精确分裂加速无监督学习和模型适应

Guixian Xu, Jinglai Li, Junqi Tang

机构 * School of Mathematics, University of Birmingham(伯明翰大学数学学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Fast Equivariant Imaging框架,通过不精确变量分裂方案快速高效训练深度成像网络,提升X射线CT重建和图像修复的泛化性能,实现10倍加速和改进的适应能力。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00719 2026-06-30 physics.flu-dyn cs.LG physics.ao-ph physics.geo-ph 50%

Guided Unconditional and Conditional Generative Models for Super-Resolution and Inference of Quasi-Geostrophic Turbulence

引导的无条件和条件生成模型用于超分辨率和准地转湍流的推断

Anantha Narayanan Suresh Babu, Akhil Sadam, Pierre F. J. Lermusiaux

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心)

专题命中 图像修复 :diffusion(abstract)

AI总结 本文提出引导的生成模型用于从稀疏观测中推断准地转湍流,比较了无条件和条件模型在超分辨率和湍流统计中的表现,揭示了模型在实现难度、精度和一致性间的权衡。

Comments 47 pages, 16 figures, 5 tables

Journal ref Journal of Advances in Modeling Earth Systems, 18, e2025MS005324

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 5 篇

2606.28448 2026-06-30 eess.IV cs.CV 79%

Measured-Subspace Consistency: A Plug-and-Play Operator for Diffusion Posterior Sampling in Accelerated MRI Reconstruction

测量子空间一致性:加速MRI重建中扩散后验采样的即插即用算子

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔国立大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究机构)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 针对加速MRI中扩散后验采样在已测量k空间上产生不一致的问题,提出测量子空间一致性(MSC)作为无训练的后验修正算子,通过经典一致性锁减少测量子空间泄漏,保持未测量子空间多样性,无需重新训练或调参。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07056 2026-06-30 cs.CR cs.LG 75%

LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing

LoRAShield: 无数据编辑对齐用于安全的个性化LoRA分享

Jiahao Chen, Junhao Li, Yiming Wang, Yong Yang, Yi Jiang, Chunyi Zhou, Qingming Li, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) Guizhou Medical University(贵州医科大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 LoRAShield通过对抗优化和语义增强动态编辑和对齐LoRA权重子空间,有效阻止恶意生成,保障个性化模型的安全共享。

Comments Accepted by SIGKDD 2026 Cycle2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29308 2026-06-30 cs.CV 70%

MirrorPPR: Exemplar-Based Portrait Photo Retouching

MirrorPPR:基于示例的人像照片修图

Zhihong Liu, Zheng Li, Jiachun Jin, Siqi Kou, Yitao Jian, Fengpei Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Triverse AI

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MirrorPPR框架,通过修图操作提取器和LoRA模块将示例对中的细微结构修图操作迁移到新图像,并构建大规模数据集MirrorPPR47M实现渐进式学习,显著提升修图质量和身份保持。

Comments Accepted by ECCV 2026. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28745 2026-06-30 cs.CV 57%

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 57%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 6 篇

2606.28406 2026-06-30 cs.LG cs.CV cs.GR 81%

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

AI能绘制科学吗?评估文本到图像和多模态模型生成科学图形的基准

Davie Chen

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV、cs.GR

AI总结 提出SciDraw-Bench基准,通过32个结构化任务和四维评估协议(文本保真度、语义正确性、结构质量、惯例遵循),评估文本到图像模型生成科学图形的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11734 2026-06-30 cs.CV 79%

VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On

VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准

Xiaoye Liang, Zhiyuan Qu, Mingye Zou, Jiaxin Liu, Lai Jiang, Mai Xu, Yiheng Zhu

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV 70%

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 57%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29172 2026-06-30 physics.ao-ph 50%

CORDEX-ML-Bench: A Benchmark for Data-Driven Regional Climate Downscaling -Experiment Design and Overview

CORDEX-ML-Bench: 数据驱动区域气候降尺度的基准测试——实验设计与概述

Neelesh Rampal, José González-Abad, Henry Addison, Jorge Baño-Medina, Maria Laura Bettolli, Valentina Blasone, Ben Booth, Erika Coppola, Serafina Di Gioia, Joshua Oldham-Dorrington, Antoine Doury, Francois Engelbrecht, Ramón Fuentes-Franco, Peter B. Gibson, Luca Glawion, Caroline Hardy, Mikhail Ivanov, Hugo Kyo Lee, Mikel N. Legasa, Matias Olmo, Andrew Orr, Julius Polz, Martin S. J. Rogers, Maybritt Schillinger, Shivani Sharma, Pedro M. M. Soares, Stefan Sobolowski, Jessica Steinkopf, Wenchang Tang, Jr-Ben Tian, Ricardo Tomé, Ko-Chih Wang, Yi-Chi Wang, Peter A. G. Watson, Tom Wetherell, Martin Widmann, José M. Gutiérrez

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出CORDEX-ML-Bench基准,在三个区域以10公里分辨率降尺度温度和降水,评估40种ML配置,发现生成模型在降水上优于确定性方法,但历史训练模型低估未来信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12957 2026-06-30 cs.LG cs.AI 50%

Attribution Graphs and Causal Probing for Mechanistic Discovery and Bias Repair in Multimodal Generative Learning

揭示-修订:具有多模态注意力的可解释性偏见感知生成建模

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。

Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 8 篇

2510.04961 2026-06-30 cs.CV 79%

SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization

SSDD:单步扩散解码器用于高效图像标记化

Théophane Vallaeys, Jakob Verbeek, Matthieu Cord

机构 * Meta Fundamental AI Research(Meta 基础人工智能研究) Sorbonne University(索邦大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SSDD,一种基于Transformer和GAN-free训练的单步扩散解码器,提升了图像标记化的效率和稳定性,实现比KL-VAE更高的重建质量和更快的采样速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16634 2026-06-30 stat.ML cs.AI cs.LG physics.bio-ph physics.chem-ph 78%

Enhanced Diffusion Sampling: Efficient Rare Event Sampling and Free Energy Calculation with Diffusion Models

增强扩散采样:利用扩散模型实现高效的稀有事件采样与自由能计算

Yu Xie, Ludwig Winkler, Lixin Sun, Sarah Lewis, Adam E. Foster, José Jiménez Luna, Tim Hempel, Michael Gastegger, Yaoyi Chen, Iryna Zaporozhets, Cecilia Clementi, Christopher M. Bishop, Frank Noé

机构 * Microsoft Research AI for Science(微软研究院人工智能科学部)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出增强扩散采样方法,通过精确的偏置协议生成偏置集合并利用精确重加权恢复平衡统计,实现高效稀有事件区域探索与自由能计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22391 2026-06-30 cs.LG cs.AI cs.CE cs.NA math.NA 78%

Physics-Informed Distillation of Diffusion Models for PDE-Constrained Generation

物理约束下的扩散模型蒸馏用于PDE约束生成

Yi Zhang, Peng Wang, Difan Zou

机构 * University of Macau(澳门大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出PIDDM方法,通过后处理蒸馏强制PDE约束,提升生成模型对PDE的满足度,支持正向和反向问题求解及部分观测重建。

Comments 32 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29287 2026-06-30 cs.LG cs.CV 57%

Beyond Trajectory Matching: Reflow with Marginal Distribution Alignment

超越轨迹匹配:基于边缘分布对齐的Reflow方法

Chen Wang, Peiran Yun, Pan Xie, Ke Deng

机构 * Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Bytedance Inc(字节跳动公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散模型加速生成中轨迹匹配导致学生模型边缘分布不确定的问题,提出边缘对齐正则化,通过跟踪ODE对数密度变化并利用冻结教师模型评分计算,无需额外网络,有效提升少步生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28758 2026-06-30 cs.CV cs.AI 57%

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

机构 * XPeng Inc.(小鹏汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10764 2026-06-30 cs.CV 57%

Dual-End Consistency Model

双端一致性模型

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Bytedance Inc.(字节跳动公司) Zhejiang Lab(浙江实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出双端一致性模型,通过选择关键子轨迹集群解决训练不稳定和采样灵活性问题,实现稳定高效的生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09484 2026-06-30 cs.LG 50%

CRPS-LAM: Probabilistic Regional Weather Forecasting with Continuous Ranked Probability Score

CRPS-LAM:基于连续排名概率评分的概率区域天气预报

Erik Larsson, Joel Oskarsson, Tomas Landelius, Fredrik Lindsten

机构 * Linköping University(林雪平大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) SMHI(瑞典气象和水文研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出CRPS-LAM,一种结合CNN和GNN的混合架构,用于高效准确的区域天气预测,通过连续排名概率评分目标实现快速训练和采样,相比扩散模型基线提速约39倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20771 2026-06-30 cs.LG math.DS physics.comp-ph 50%

Stochastic and Non-local Closure Modeling for Nonlinear Dynamical Systems via Latent Score-based Generative Models

通过潜在分数生成模型实现非线性动力系统中随机和非局部闭合建模

Xinghao Dong, Huchen Yang, Jin-Long Wu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种基于潜在分数生成模型的框架,用于学习非线性动力系统中的随机和非局部闭合模型,通过联合训练卷积自编码器和条件扩散模型,减少采样维度并保持物理特性,提升计算效率。

Journal ref Journal of Computational Physics 563 (2026) 115082

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2606.28386 2026-06-30 cs.CV cs.AI 57%

Data Provenance for Image Auto-Regressive Generation

图像自回归生成的数据溯源

Bihe Zhao, Louis Kerner, Michel Meintz, Tameem Bakr, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出后验框架,利用自回归生成模型输出中的特征模式进行图像溯源,无需修改生成过程或输出,适用于无水印场景。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏