arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1738 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1332 篇

2507.15730 2026-06-09 math.AP 版本更新 50%

Qualitative properties of solutions to parabolic anisotropic equations: Part II. The anisotropic Trudinger's equation

抛物型各向异性方程解的定性性质:第二部分。各向异性Trudinger方程

Simone Ciani, Eurica Henriques, Mariia O. Savchenko, Igor I. Skrypnik

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究各向异性双非线性抛物型弱解的局部正则性,证明无指数限制的抛物Harnack不等式,并在扩散指数范围受限时得到Hölder连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11757 2026-06-09 math.AP 版本更新 50%

Hele-Shaw limit of chemotaxis-Navier-Stokes flows

趋化-纳维-斯托克斯流的Hele-Shaw极限

Qingyou He, Ling-Yun Shou, Leyun Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究趋化-纳维-斯托克斯系统在孔隙介质非线性扩散下的Hele-Shaw极限,证明弱解整体存在性并严格验证极限收敛到自由边界问题。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21239 2026-06-09 cs.CL 版本更新 50%

A Unified LLM-Adaptable Framework for Cold-Start Cognitive Diagnosis

面向冷启动认知诊断的统一LLM可适配框架

Zihan Yao, Chentao Song, Yu He, Tianyu Qi, Jian Zhang, Weiping Fu, Jun Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出LMCD框架,通过知识扩散和语义-认知融合两阶段,利用大语言模型增强冷启动场景下的认知诊断性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13410 2026-06-09 math.ST math.PR stat.ML stat.TH 版本更新 50%

Joint stochastic localization and applications

联合随机定位及其应用

Tom Alberts, Yiming Xu, Qiang Ye

专题命中 扩散模型 :diffusion(abstract)

AI总结 将随机定位扩展为耦合概率测度的联合框架,定义Eldan α-距离,研究其理论性质并开发高效估计器,应用于分布数据分析。

Comments 68 pages; substantial revision including correcting an error in Theorem 3.1 (iii) in the previous version and adding a few new results

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19754 2026-06-09 econ.GN cs.AI q-fin.EC 版本更新 50%

Complement or substitute? How AI increases the demand for human skills

互补还是替代?AI如何增加对人类技能的需求

Elina Mäkelä, Matthew Bone, Mareike Sehrer, Farah Nanji, Fabian Stephany

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Burning Glass Institute(燃烧玻璃研究所) Institute for New Economic Thinking, Oxford Martin School(新经济思想研究所,牛津马丁学院) Bruegel(布鲁日)

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于2018-2024年美、英、澳近3000万条招聘数据,发现AI岗位更需分析思维等互补技能,且这些技能带来工资溢价,并溢出至非AI岗位,同时替代技能需求下降。

Comments 69

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01718 2026-06-09 stat.ML cs.LG math.ST stat.TH 版本更新 50%

Entropic Optimal Transport Eigenmaps for Nonlinear Alignment and Joint Embedding of High-Dimensional Datasets

熵最优传输特征映射用于高维数据集的非线性对齐与联合嵌入

Boris Landa, Yuval Kluger, Rong Ma

机构 * Department of Electrical and Computer Engineering, Yale University(耶鲁大学电气与计算机工程系) Department of Biostatistics, Harvard University(哈佛大学生物统计学系) Program in Applied Mathematics, Yale University(耶鲁大学应用数学项目) Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学跨学科项目) Department of Pathology, Yale University School of Medicine(耶鲁大学医学院病理学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出熵最优传输特征映射方法,通过EOT计划矩阵的奇异向量对齐和联合嵌入两个数据集,具有理论保证,在生成模型下证明其收敛性,并在模拟和真实生物数据中展示优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06211 2026-06-09 math.PR 版本更新 50%

Resolvent approach to diffusions with discontinuous scale

具有不连续尺度的扩散的预解式方法

Liping Li, Ying Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究尺度函数s仅非降时算子L=1/2 D_m D_s对应的马氏过程,证明其再生核由α-调和方程的两个正单调解生成,并诱导出与半群或Dirichlet型方法相同的马氏过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25638 2026-06-08 cs.CL cs.LG 版本更新 50%

Reinforcement Learning from Denoising Feedback

基于去噪反馈的强化学习

Qi He, Huan Chen, Ya Guo, Huijia Zhu, Yi R. Fung, Baojian Zhou

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03188 2026-06-08 math.AP 版本更新 50%

Analysis and Patterns of Nonlocal Klausmeier Model

非局部Klausmeier模型的分析与模式

Md Shah Alam

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究结合局部与非局部扩散的Klausmeier植被模型的非局部扩展,利用半群理论和对偶论证证明经典解的整体适定性和一致有界性,并通过数值模拟揭示非局部扩散对植被模式的影响。

Comments I have figured out a few mistakes in the preprint and I will resubmit this after careful revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11033 2026-06-08 math.CA math.AP 版本更新 50%

A Littlewood-Paley approach to the Mittag-Leffler function in the frequency space and applications to nonlocal problems

通过Littlewood-Paley方法研究频率空间中的Mittag-Leffler函数及其在非局部问题中的应用

Ahmed A. Abdelhakim

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过Littlewood-Paley理论研究频率空间中Mittag-Leffler函数的Lebesgue指数p(p(γ)),并推导了非局部空间-时间问题中的关键估计。

Journal ref J Fourier Anal Appl 32, 60 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13268 2026-06-08 quant-ph cs.LG 版本更新 50%

Physics Guided Generative Optimization for Trotter Suzuki Decomposition

物理引导的Trotter-Suzuki分解生成优化

WenBin Yan

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出P-GONE方法,结合条件扩散模型、图神经网络和REINFORCE微调,联合优化Trotter-Suzuki分解中的项分组、阶数和时间步分配,在保真度≥0.95时实现19.4倍电路深度压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05220 2026-06-08 cs.LG cs.AI 版本更新 50%

MidSteer: Optimal Affine Framework for Steering Generative Models

MidSteer:用于引导生成模型的最优仿射框架

Tatiana Gaintseva, Andrew Stepanov, Ziquan Liu, Martin Benning, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * University of Basel(巴塞尔大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26535 2026-06-08 stat.ME cs.NA math.NA 版本更新 50%

ARMA approximation of a Non-separable Spatio-Temporal Model with Fractional Smoothnesses in Space and Time

具有空间和时间分数平滑度的非分离时空模型的ARMA逼近

S. Knutsen Furset, Geir-Arne Fuglstad, Espen R. Jakobsen

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对具有分数平滑度的非分离时空模型,提出基于时间有理逼近的离散化方法,得到VARMA过程,证明协方差函数逐点收敛并给出收敛速率,通过数值验证和模拟研究展示低阶VARMA的精度及参数估计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13546 2026-06-08 cs.LG 版本更新 50%

Probabilistic Gaussian Homotopy: A Probability-Space Continuation Framework for Nonconvex Optimization

概率高斯同伦:非凸优化的概率空间延拓框架

Eshed Gal, Samy Wu Fung, Eldad Haber

机构 * University of British Columbia(不列颠哥伦比亚大学) Colorado School of Mines(科罗拉多矿业学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出概率高斯同伦(PGH)框架,通过变形玻尔兹曼分布和玻尔兹曼加权梯度聚合,实现非凸优化的概率空间延拓,并导出基于蒙特卡洛梯度估计的实用算法PGHO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18678 2026-06-08 astro-ph.GA astro-ph.HE 版本更新 50%

CRexit: how different cosmic ray transport modes affect thermal instability in the circumgalactic medium

CRexit:不同宇宙射线传输模式如何影响星系际介质中的热不稳定性

Matthias Weber, Timon Thomas, Christoph Pfrommer, Ruediger Pakmor

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过3D模拟探讨宇宙射线传输模式对冷云热不稳定性的影响,发现CR逃逸时间与云坍缩时间比是关键因素,高分辨率模拟避免了低分辨率导致的错误云结构。

Comments 20 pages and 17 figures in main text; submitted to A&A

Journal ref A&A 698, A125 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16212 2026-06-08 cond-mat.soft 版本更新 50%

Mesoscale simulation model for odd fluids

介观尺度奇流体模拟模型

Yuxing Jiao, Mingcheng Yang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种高效粗粒模拟方法,用于研究具有时间反演对称性破缺的奇流体,推导了其输运系数并验证了模型的准确性,为研究奇流体的异常输运现象提供了新途径。

Comments 6 pages, 4 figures

Journal ref Phys. Rev. E, 113, 055102 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 102 篇

2509.12046 2026-07-07 cs.CV cs.AI 版本更新 86%

Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking

通过结构化掩码的布局条件自回归文本到图像生成

Zirui Zheng, Takashi Isobe, Tong Shen, Xu Jia, Jianbin Zhao, Xiaomin Li, Mengmeng Ge, Baolu Li, Qinghe Wang, Haiwen Diao, Dong Li, Dong Zhou, Yunzhi Zhuge, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices Inc.(超威半导体公司) Dalian University of Technology(大连理工大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 提出SMARLI框架,通过结构化掩码策略将布局约束注入自回归生成过程,并采用GRPO后训练缓解曝光偏差,实现高质量布局控制图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00933 2026-08-04 cs.CV 版本更新 85%

EmoScene: A Dual-space Dataset for Controllable Affective Image Generation

EmoScene:用于可控情感图像生成的双空间数据集

Li He, Longtai Zhang, Wenqiang Zhang, Yan Wang, Lizhe Qi

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出EmoScene数据集,通过双空间编码情感维度与感知属性,提升文本到图像模型对场景语义和情感调制的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18267 2026-07-27 cs.CV 版本更新 83%

SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation

SRC-Flow:紧凑语义表示实现归一化流用于图像生成

Longtao Jiang, Jianmin Bao, Zhendong Wang, Xin Tao, Pengfei Wan, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出SRC-Flow,通过语义表示压缩器将高维RAE特征压缩到低维语义空间,降低归一化流建模负担,在ImageNet上实现最优生成质量,同时保持精确似然计算和确定性可逆采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20209 2026-07-21 cs.GR cs.LG cs.RO 版本更新 83%

NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control

NaP-Control: 为多功能和快速字符控制导航扩散先验

Chia-Wen Chen, Yan Wu, Korrawe Karunratanakul, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出NaP-Control方法,通过强化学习操控任务无关的扩散策略先验的潜在噪声,实现快速、鲁棒且高保真的字符控制,同时通过环境交互优化任务奖励,提升成功率并适应挑战性场景。

Comments ECCV 2026. Project page: https://chiawenchen.github.io/nap-control-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21541 2026-08-04 cs.GR cs.CV 版本更新 81%

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23924 2026-08-18 cs.CV 版本更新 79%

DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis

DepthArb: 无训练深度仲裁生成用于遮挡鲁棒图像合成

Hongjin Niu, Jiahao Wang, Xirui Hu, Weizhan Zhang, Lan Ma, Yuan Gao, Feng Lei

机构 * School of Computer Science and Technology(计算机科学与技术学院) China Telecom(中国电信)

专题命中 可控生成 :image synthesis(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DepthArb,通过仲裁交互对象的注意力竞争解决遮挡歧义,采用注意力仲裁调制和空间紧凑性控制机制,无需重新训练即可提升遮挡生成的准确性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13311 2026-08-07 cs.CV 版本更新 79%

FashionPose: Unified Text-Driven Fashion Synthesis with Joint Geometric and Photometric Control

FashionPose:结合几何与光度控制的统一文本驱动时尚合成

Chuancheng Shi, Shaotian Li, Zhenlong Yuan, Zifeng Cheng, Fei Shen

机构 * The University of Sydney(悉尼大学) Shenyang Aerospace University(沈阳航空航天大学) Zhonghuan Information College, Tianjin University of Technology(天津工业大学中环信息学院)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出FashionPose级联架构,通过双向对比对齐、身份锚定合成与提示条件重光照模块,结合PoseCap数据集,实现文本驱动的可控时尚合成,性能优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15619 2026-07-21 cs.CV 版本更新 79%

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

StructGen:通过结构化上下文建模消除多参考图像生成中的歧义

Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) Institute of Big Data, Fudan University(复旦大学大数据研究院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际联合实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) MT Lab, Meitu Inc(美图公司MT实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究多参考图像生成问题,现有方法因自然语言指令缺陷致效果不佳。提出StructGen,用结构化格式编码参考图像,构建数据集、训练框架和基准,实验证明其在语义对齐和生成一致性上优于现有方法。

Comments Project page: https://jianingpeng0382.github.io/StructGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14190 2026-08-06 cs.LG 版本更新 78%

Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation

对比扩散对齐:用于可控生成的结构化潜在学习

Ruchi Sandilya, Sumaira Perez, Charles Lynch, Lindsay Victoria, Benjamin Zebley, Derrick Matthew Buchanan, Mahendra T. Bhati, Nolan Williams, Timothy J. Spellman, Faith M. Gunning, Conor Liston, Logan Grosenick

机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09588 2026-07-14 eess.IV q-bio.QM 版本更新 78%

Diffusion-Based Quality Control of Medical Image Segmentations across Organs

基于扩散的质量控制用于跨器官医学图像分割

Vincenzo Marcianò, Hava Chaptoukaev, Virginia Fernandez, M. Jorge Cardoso, Sébastien Ourselin, Michela Antonelli, Maria A. Zuluaga

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出nnQC框架,通过扩散生成模型实现跨器官医学图像分割的质量控制,有效解决现有方法的通用性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14945 2026-06-25 cs.RO cs.AI 版本更新 78%

TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

TIDAL: 时间交错扩散与动作循环用于高频VLA控制

Yuteng Sun, Haoran Wang, Ruofei Bai, Zhengguo Li, Jun Li, Meng Yee Michael Chuah, Wei Yun Yau

机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14275 2026-06-23 eess.AS cs.AI cs.SD 版本更新 78%

Controllable Accent Normalization via Discrete Diffusion

通过离散扩散实现可控口音标准化

Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Tencent Ethereal Audio Lab(腾讯虚音频实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出DLM-AN系统,利用掩蔽离散扩散和自监督语音令牌,通过选择性重用源令牌控制口音强度,结合流匹配时长比预测器调整节奏,实现低词错误率和可解释的口音强度控制。

Comments Accepted to Interspeech 2026 as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新 74%

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏