arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-10 至 2026-06-10 共收录 23 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 18 篇

2409.02426 2026-06-10 cs.LG cs.CV 版本更新 83%

Breaking the Curse of Dimensionality: Diffusion Models Efficiently Learn Low-Dimensional Distributions

打破维度诅咒:扩散模型高效学习低维分布

Peng Wang, Huijie Zhang, Zekai Zhang, Siyi Chen, Yi Ma, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出新数学框架,证明扩散模型通过等价于子空间聚类,能以线性于内在维度的样本复杂度学习低维分布,避免维度诅咒。

Comments 37 pages, 8 figures, 2 tables, JMLR publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05264 2026-06-10 cs.LG cs.CV 版本更新 80%

The Emergence of Reproducibility and Generalizability in Diffusion Models

扩散模型中可重复性与泛化性的出现

Huijie Zhang, Jinfan Zhou, Yifu Lu, Minzhe Guo, Peng Wang, Liyue Shen, Qing Qu

机构 * CIFAR-10 dataset(CIFAR-10数据集)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散模型在相同初始噪声和确定性采样器下,不同模型输出高度相似,且这种可重复性在记忆和泛化两种训练模式下均存在,对训练效率、模型隐私等有重要启示。

Comments NeurIPS Diffusion Model Workshop 2023 (best paper award), the Forty-first International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新 79%

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08379 2026-06-10 cs.LG cs.AI cs.CV 版本更新 79%

MMD Guidance: Training-Free Distribution Adaptation for Diffusion Models via Maximum Mean Discrepancy Guidance

MMD Guidance: 基于最大均值差异引导的无训练分布适应扩散模型

Matina Mahdizadeh Sani, Nima Jamali, Mohammad Jalali, Farzan Farnia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MMD Guidance,一种无训练方法,通过最大均值差异梯度引导扩散模型采样,实现与参考数据分布对齐,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16518 2026-06-10 cs.CV cs.AR 版本更新 79%

FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models

FG-Attn:在视频扩散模型中利用细粒度稀疏注意力

Sankeerth Durvasula, Kavya Sreedhar, Zain Moustafa, Suraj Kothawade, Tianlei Pang, Ashish Gondimalla, Suvinay Subramanian, Narges Shahidi, Nandita Vijaykumar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05291 2026-06-10 cs.RO 版本更新 78%

Online Self-Training for Co-Adaptation in Hierarchical Diffusion Policies

层次扩散策略中的在线自训练协同适应

Clemence Grislain, Mathilde Kappel, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出ORCHID自训练框架,通过环境反馈过滤轨迹并蒸馏回规划器和控制器,实现层次扩散策略的在线稳定改进,在CALVIN基准上轻量模型超越纯离线方法。

Comments Accepted at ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation (DEMO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09639 2026-06-10 cs.LG stat.ML 版本更新 78%

Blind denoising diffusion models and the blessings of dimensionality

盲去噪扩散模型与维度的祝福

Zahra Kadkhodaie, Aram-Alexandre Pooladian, Sinho Chewi, Eero Simoncelli

机构 * Flatiron Institute, Simons Foundation(Flatiron研究院,Simons基金会) Foundations of Data Science, Yale University(数据科学基础,耶鲁大学) Department of Statistics and Data Science, Yale University(统计与数据科学系,耶鲁大学) Ctr. for Neural Science & Courant Institute, New York University(神经科学中心及Courant学院,纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出盲去噪扩散模型(BDDM),通过不向神经网络传递噪声幅度来简化设计,并在数据内在维度低于环境维度的假设下证明其正确性,实验显示自适应方案的优势。

Comments 39 pages, 13 figures; Accepted to ICML 2025 FoGen workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08280 2026-06-10 cs.RO cs.AI cs.SY eess.SY 版本更新 78%

Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making

基于模型扩散采样的离线决策预测控制

Haldun Balim, Na Li, Yilun Du

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出MPDiffuser框架,通过组合扩散规划器与动力学扩散模型,在采样中交替更新以生成符合任务目标且动力学可行的轨迹,并利用轻量级排序模块选择最优轨迹,在D4RL和DSRL基准及四足机器人上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07048 2026-06-10 cs.SD cs.AI cs.LG eess.AS 版本更新 78%

Whisfusion: Parallel ASR Decoding with Masked Diffusion

Whisfusion: 基于掩码扩散的并行ASR解码

Taeyoun Kwon, Junhyuk Ahn, Taegeun Yun, Heeju Jwa, Yoonchae Choi, Siwon Park, Jongchan Kim, Hyungon Ryu, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学) NVIDIA Corporation(英伟达公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Whisfusion,在冻结的Whisper音频嵌入上训练专用掩码扩散解码器,通过并行扩散解码实现非自回归ASR,在多种语言基准上超越Whisper-large-v3,速度提升4-5倍。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14614 2026-06-10 cs.CV cs.GR 版本更新 62%

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

WorldPlay:面向实时交互式世界建模的长期几何一致性

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。

Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20850 2026-06-10 cs.CV cs.RO 版本更新 57%

Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

Glove2Hand:从多模态传感手套合成自然的手-物体交互

Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan

机构 * Meta Reality Labs(Meta现实实验室) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Glove2Hand框架,将多模态传感手套视频转化为逼真的裸手,并保留物理交互动态;引入3D高斯手模型和扩散手恢复器,创建HandSense数据集,提升下游任务性能。

Comments CVPR 2026 Highlight. This version includes the motion retarget process in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06888 2026-06-10 cs.LG 版本更新 50%

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

数据受限的语言模型预训练:改进的正则化与缩放定律

Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20242 2026-06-10 cond-mat.stat-mech math-ph math.MP 版本更新 50%

How the arrow of time emerges from Hamiltonian systems by our incomplete knowledge

时间之箭如何从哈密顿系统中因我们的不完全知识而涌现

Katerina Mlada, Michal Pavelka, Vaclav Klika

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过路径积分形式的不匹配约化方法,证明不可逆性从可逆哈密顿力学中涌现,并推导出GENERIC框架,无需拟合参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07413 2026-06-10 cs.RO 版本更新 50%

Going with the Flow: Koopman Behavioral Models as Pseudo Planners for Visuo-Motor Dexterity

随流而行:Koopman行为模型作为视觉运动灵巧性的伪规划器

Yunhai Han, Jiaqi Fu, Linhao Bai, Ziyu Xiao, Zhaodong Yang, Yogita Choudhary, Krishna Jha, Chuizheng Kong, Shreyas Kousik, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出统一行为模型(UBM),将灵巧技能建模为耦合动力系统,确保时间一致性;基于Koopman算子实现线性潜空间,通过在线重规划实现反应性和适应性,在模拟和真实任务中达到或超越现有方法。

Comments Website: https://k-ubm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08432 2026-06-10 quant-ph math.OC 版本更新 50%

A Grover-compatible manifold optimization algorithm for quantum search

一种兼容Grover算法的流形优化算法用于量子搜索

Zhijian Lai, Dong An, Jiang Hu, Zaiwen Wen

专题命中 扩散模型 :diffusion(abstract)

AI总结 将无结构搜索问题重新表述为酉流形上的最大化问题,通过引入Grover兼容的收缩映射,利用黎曼梯度上升法实现线性收敛,迭代复杂度为O(√N log(1/ε)),匹配Grover算法的二次加速。

Comments Newly added supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20083 2026-06-10 nucl-th hep-th 版本更新 50%

Covariant equations of motion of massive spinning particles in a background Yang-Mills field

背景杨-米尔斯场中自旋有质量粒子的协变运动方程

Jie Zhou, Ying Shan Zhao, Yifeng Sun

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过狄拉克-伯格曼算法,推导出自旋1/2夸克在背景非阿贝尔杨-米尔斯场中满足洛伦兹协变、任意色磁矩和物理约束的自洽运动方程,用于重离子碰撞中硬探针的动量扩散和自旋极化研究。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21649 2026-06-10 q-fin.MF 版本更新 50%

Second-Order Esscher Pricing for Lévy Models with Applications: Risk Management and Fear Quantification

Lévy模型的二阶Esscher定价及其在风险管理和恐惧量化中的应用

Tahir Choulli, Ella Elazkany, Mich`ele Vanmaele

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出二阶Esscher变换作为经典Esscher框架的可处理扩展,用于Lévy驱动市场的期权定价和风险管理,推导了定价公式,并实证表明其参数与市场压力指标(如VIX)强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09295 2026-06-10 q-fin.RM math.PR stat.AP 版本更新 50%

On the Impact of Insurance on Households Susceptible to Random Proportional Losses: An Analysis of Poverty Trapping

保险对面临随机比例损失的贫困家庭的影响:贫困陷阱分析

Kira Henshaw, Jorge Ramirez, José Miguel Flores-Contró, Enrique A. Thomann, Sooie-Hoe Loke, Corina Constantinescu

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过比例损失模型研究保险对贫困陷阱概率的影响,推导无保险时幂律分布下的新闭式解,以及有保险时均匀分布下的非局部微分方程,分析参数约束并数值计算陷阱概率。

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 1 篇

2512.12675 2026-06-10 cs.CV cs.AI 版本更新 79%

Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling

Scone:通过统一理解-生成建模弥合主体驱动图像生成中的组合与区分

Yuran Wang, Bohan Zeng, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Academy(中关村学院) HKUST(香港科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出Scone方法,通过统一理解-生成模型结合组合与区分能力,采用两阶段训练实现主体身份保持与干扰最小化,在双基准上优于现有开源模型。

Comments CVPR 2026 Highlight. Code: https://github.com/Ryann-Ran/Scone

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 2 篇

2411.02817 2026-06-10 cs.LG cs.AI cs.CV cs.IT math.IT 版本更新 70%

Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs

条件 Vendi 分数:生成式 AI 模型和 LLM 的提示感知多样性评估

Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本提示引导的生成模型,提出条件 Vendi 和条件 RKE 分数,通过条件熵分离模型自身多样性,并证明收敛性及在多个任务中恢复真实多样性排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09809 2026-06-10 cs.CV 版本更新 57%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 2 篇

2506.14753 2026-06-10 cs.CV cs.LG 版本更新 89%

Cost-Aware Routing for Efficient Text-To-Image Generation

面向文本到图像生成的高效路由:成本感知方法

Qinchan Li, Kenneth Chen, Changyue Su, Wittawat Jitkrittum, Qi Sun, Patsorn Sangkloy

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院) Google(谷歌) Eigen 4D Inc.(Eigen 4D公司)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出成本感知路由框架,根据提示复杂度自动选择不同去噪步数或模型,在保证高质量的同时降低计算成本,优于单一模型。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13358 2026-06-10 cs.CV 版本更新 83%

One-Step Residual Shifting Diffusion for Image Super-Resolution via Distillation

一步残差移位扩散用于图像超分辨率通过蒸馏

Daniil Selikhanovych, David Li, Aleksei Leonov, Nikita Gushchin, Sergei Kushneriuk, Alexander Filippov, Evgeny Burnaev, Iaroslav Koshelev, Alexander Korotin

机构 * Kandinsky Lab(坎迪斯基实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Luzin Research Center(卢津研究所) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institute) Applied AI Institute(应用人工智能研究所)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出RSD蒸馏方法,通过训练学生网络使基于其生成图像的虚拟ResShift模型与教师一致,实现单步超分辨率,在感知指标上超越教师和SinSR,且参数和计算成本更低。

Comments ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏