arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-08 至 2026-07-08 共收录 28 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 23 篇

2605.13974 2026-07-08 cs.CV cs.AI cs.MM 版本更新 84%

Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers

少量通道绘制整体画面:揭示扩散变换器中的大规模激活

Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。

Comments Project page: https://aimagelab.github.io/MAs-DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 83%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16147 2026-07-08 cs.CV 版本更新 79%

Registers Matter for Pixel-Space Diffusion Transformers

注册信息对像素空间扩散变换器的重要性

Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散变换器与视觉变换器在处理像素空间时存在差异,注册令牌显著提升了生成质量,通过分析中间表示发现其在高噪声水平下产生更清晰的特征图,进而提出了一种高效的双流架构以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新 79%

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15932 2026-07-08 cs.CV 版本更新 79%

NAMD: Virtual Follow-up Computed Tomography Synthesis via Nodule-Aligned Multimodal Diffusion Models for Early Lung Cancer Diagnosis

基于LLM驱动多模态扩散的结节对齐潜在空间学习:用于肺结节进展预测

James Song, Yifan Wang, Chuan Zhou, Liyue Shen

机构 * Department of EECS, University of Michigan(电子工程与计算机科学系,密歇根大学) University of Michigan Medical School(密歇根大学医学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NAMD框架,通过生成1年随访CT图像预测肺结节进展,利用结节对齐潜在空间和LLM驱动控制机制,在NLST数据集上实现优于基线和现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04024 2026-07-08 cs.CV cs.AI 版本更新 79%

Volumetric Directional Diffusion: Anchoring Uncertainty Quantification in Anatomical Consensus for Ambiguous Medical Image Segmentation

体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化

Chao Wu, Mahesh Bhosale, Kangxian Xie, Pouya Karimian, David Doermann, Mingchen Gao

机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00001 2026-07-08 cs.CV cs.AI cs.CY 版本更新 79%

Replication in Visual Diffusion Models: A Survey and Outlook

视觉扩散模型中的复制:一项综述与展望

Wenhao Wang, Yifan Sun, Zongxin Yang, Zhengdong Hu, Zhentao Tan, Yi Yang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学) Baidu Inc.(百度公司) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文综述视觉扩散模型中的复制现象,将现有研究分类为揭示、理解和缓解该现象的方法,还回顾其现实影响,讨论了检测和基准测试复制的挑战及未来方向,助力研究人员和从业者理解AI技术与社会公益交叉点。

Comments Accepted by TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02965 2026-07-08 cs.LG cs.SY eess.SP eess.SY stat.ML 版本更新 78%

Joint Energy Management and Coordinated AIGC Workload Scheduling for Distributed Data Centers: A Diffusion-Aided Reward Shaping Approach

分布式数据中心的联合能源管理与协同AIGC工作负载调度:一种扩散辅助奖励塑造方法

Yang Fu, Peng Qin, Liming Chen, Zihao Zhang, Hao Yu, Yifei Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对AIGC在数据中心带来的能源管理与工作负载调度挑战,提出联合调度框架,考虑多种能源资源,制定系统效用最大化问题。因奖励稀疏限制DRL算法,开发扩散模型辅助奖励塑造方法,实验表明该方案能有效适应波动和异质性,实现高效学习收敛和系统效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10004 2026-07-08 eess.SP 版本更新 78%

Environment-Conditioned Diffusion Meta-Learning for Data-Efficient WiFi Localization

环境感知扩散元学习用于数据高效的WiFi定位

Jun Gao, Zheng Xing, Wenliang Lin, Weibing Zhao, Xuhui Zhang, Junting Chen, Zhongliang Deng, Shuguang Cui

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出EnvCoLoc框架,通过环境条件化的扩散元学习方法,解决WiFi指纹定位中跨环境泛化能力差的问题,核心贡献是引入几何感知先验和元学习初始化,提升在有限样本下的定位精度。

Comments The dataset used in this paper is publicly available at: https://drive.google.com/file/d/1GWUFExgJl3SYyIm-sUYedy9gjC_Bvq0q/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11711 2026-07-08 stat.ML cs.LG cs.NA math.NA stat.AP 版本更新 78%

Estimation of instrument and noise parameters for inverse problem based on prior diffusion model

基于先验扩散模型的逆问题中仪器和噪声参数估计

Jean-François Giovannelli

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究逆问题中观测参数估计,基于贝叶斯框架和扩散先验,提出简单有效方案,能定义最优估计器并进行不确定性量化,MCMC算法辅助计算,数值实验验证了计算效率和估计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11059 2026-07-08 stat.ML cs.LG stat.AP 版本更新 78%

A Gibbs posterior sampler for inverse problem based on prior diffusion model

基于先验扩散模型的逆问题吉布斯后验采样器

Jean-François Giovannelli

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对观测系统线性变换且带加性误差、问题不适定且正则化依赖贝叶斯策略、先验由扩散过程建模的逆问题,引入吉布斯算法,证明其有效且简单,给出收敛保证要素及论据,数值模拟证实了结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16165 2026-07-08 cs.LG cond-mat.supr-con 版本更新 78%

AtomBench: A Benchmarking Framework for Generative Crystal Reconstruction Models in Conventional Superconductors

AtomBench:传统超导体中生成晶体重建模型的基准测试框架

Charles Rhys Campbell, Aldo H. Romero, Kamal Choudhary

机构 * Department of Physics and Astronomy, West Virginia University(物理与天文学系,西弗吉尼亚大学) Department of Materials Science and Engineering, Whiting School of Engineering, The Johns Hopkins University(材料科学与工程系,韦廷工程学院,约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对生成晶体重建模型,提出可扩展、模型无关的AtomBench框架,在传统超导体晶体重建任务中比较四个模型,用多种指标衡量重建保真度,得出各模型表现及相关结论,还开源该框架供社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13030 2026-07-08 cs.CV 版本更新 77%

Generative Refinement Networks for Visual Synthesis

生成细化网络用于视觉合成

Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。

Comments code: https://github.com/bytedance/GRN

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19301 2026-07-08 math.PR 版本更新 71%

A Feynman--Kac representation of a non-conservative and path-dependent nonlinear reaction-diffusion-advection system

非保守且路径依赖的非线性反应扩散对流系统的费曼 - 卡茨表示

Daniela Morale, Leonardo Tarquini, Stefania Ugolini

专题命中 扩散模型 :diffusion(title)

AI总结 研究非保守且路径依赖的非线性反应扩散对流系统,通过给出概率解释,得到耦合随机公式并证明其适定性,引入相互作用粒子系统,表明加权后的经验测度收敛到极限次概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03141 2026-07-08 math.NA cs.NA 版本更新 50%

Owner-selected bubble transforms and coefficient-robust Schwarz preconditioners for variable-degree $hp$ finite elements

变阶 $hp$ 有限元界面问题的均匀 Schwarz 预条件子

Situan Li, Weiying Zheng

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对变阶 $hp$ 有限元离散的反应扩散和拟合界面问题,构造了 $h$ 和 $p$ 鲁棒的、保阶的空间分解和加性 Schwarz 预条件子,并证明了条件数独立于网格尺寸、多项式次数和系数对比度。

Comments Withdrawn by the authors. The proof of the coefficient-robust Schwarz preconditioner requires substantial revision, including clarification of the owner-selected bubble transform construction and the assumptions on variable polynomial degrees. The authors will prepare a revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06138 2026-07-08 nucl-th hep-ph nucl-ex 版本更新 50%

Probing the density dependence of nuclear symmetry energy through isospin transport in heavy-ion reactions

通过重离子反应中的异旋输运探测核对称能量的密度依赖性

S. Mallik, F. Gulminelli, C. Ciampi, D. Gruyer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过重离子反应中的异旋输运研究,探讨核对称能量的密度依赖性,结合实验数据与传输模型,提取对称能量的约束,为核方程态和致密物质研究提供支持。

Comments 20 pages, 11 figures (Universe Special Issue: 10th Anniversary of Universe: Studying the Strongly Interacting Matter in Nuclear Reactions from Intermediate to Ultra-Relativistic Energies)

Journal ref Universe 2026, 12, 202

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18174 2026-07-08 hep-ph 版本更新 50%

Sexaquarks and $H$ dibaryons in the $uuddss$ system: a comparison within a constituent quark model

六夸克和H双核子在uuddss系统中的研究:在构成夸克模型中的比较

M. C. Gordillo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用构成夸克模型研究六夸克系统,通过扩散蒙特卡罗方法求解非相对论薛定谔方程,探讨了六夸克系统两种不同构造方式下的量子态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21624 2026-07-08 cond-mat.mes-hall 版本更新 50%

Spatiotemporal chaos in the interface growth of topological insulators

拓扑绝缘体界面生长中的时空混沌

Yutaro Tanaka, Akira Furusaki

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究拓扑绝缘体界面生长中的时空混沌,发现其内在界面不稳定性源于电子特性,边界态影响表面刚度,推导出负刚度界面生长有效方程,证明界面动力学受Kuramoto - Sivashinsky方程控制。

Comments 10 pages, 9 figures

Journal ref Phys. Rev. B 114, 045404 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10535 2026-07-08 math.PR math.OA 版本更新 50%

Eigenvalues of Brownian Motions on $\mathrm{GL}(N,\mathbb{C})$

关于\(\mathrm{GL}(N,\mathbb{C})\)上布朗运动的特征值

Tatiana Brailovskaya, Nicholas A. Cook, Todd Kemp, Félix Parraud

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究\(\mathrm{GL}(N,\mathbb{C})\)上布朗运动特征值,通过一族非退化扩散过程及对小\(t\)时布朗运动的定量逼近,证明其特征值经验法则几乎必然收敛到确定性概率测度,解决了相关猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05350 2026-07-08 cs.SD cs.AI 版本更新 50%

Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders

通过噪声增强自动编码器对音乐表示进行感知对齐

Mathias Rose Bjare, Giorgia Cantisani, Marco Pasini, Stefan Lattner, Gerhard Widmer

机构 * Johannes Kepler University(约翰内斯·开普勒大学) Queen Mary University(女王玛丽大学) Sony Computer Science Laboratories (CSL)(索尼计算机科学实验室(CSL))

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究如何通过噪声增强自动编码器结合感知驱动损失对音乐表示进行感知对齐,经训练产生按感知层次结构构建的编码,此方法在估计音乐音高惊喜和预测脑电反应中效果超以前方法,还提供预训练权重。

Comments Accepted to EUSIPCO 2026. Previous version appeared in NeurIPS 2025 - AI for Music Workshop. 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10294 2026-07-08 hep-ph 版本更新 50%

Perturbative and nonperturbative properties of heavy quark transport in a thermal SU(3) gluon plasma

热SU(3)胶子等离子体中重夸克输运的微扰和非微扰性质

Jiazhen Peng, Yage Zhen, Jiale Lou, Fei Sun, Kejun Wu, Wei Xie, Zuman Zhang, Shuang Li, Sa Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究热SU(3)胶子等离子体中重夸克输运,基于软硬因子分解模型扩展微扰框架到近临界温度区,通过背景场有效理论描述转变行为,定量评估相关系数,发现其受温度相关色背景场影响有抑制,提供统一理论框架。

Comments 24 pages, 8 figures

Journal ref Physical Review D 114, 016005 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19844 2026-07-08 cond-mat.soft 版本更新 50%

Exotic rheology of materials with active rearrangements

具有主动重排材料的奇异流变学

Aondoyima Ioratim-Uba, Tanniemola B. Liverpool, Silke Henkes

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究生物组织发育中主动应力控制的流动及奇异流变学,引入含被动和主动弹性元件的平均场弹塑性模型,发现主动元件改变流变学,产生非单调流动曲线、负应力、不同屈服应力材料和流体,以及类似滞后的不对称流变曲线。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 1 篇

2505.08317 2026-07-08 math.OC 版本更新 50%

Stationary Mean-Field Games of Singular Control under Knightian Uncertainty

奈特不确定性下奇异控制的平稳平均场博弈

Giorgio Ferrari, Ioannis Tzouanas

专题命中 可控生成 :diffusion(abstract)

AI总结 研究奈特不确定性下奇异控制的平稳平均场博弈,主体通过单边奇异随机控制调整动力学以最大化奖励,利用构造性方法证明平稳平均场均衡的存在唯一性,并给出数值基准及分析不确定性对均衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 3 篇

2509.23876 2026-07-08 cs.CV cs.AI 版本更新 70%

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance

基于信息基础引导的视觉自回归采样再思考

Ky Dan Nguyen, Hoang Lam Tran, Anh-Dung Dinh, Daochang Liu, Weidong Cai, Xiuying Wang, Chang Xu

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究基于下一尺度预测的自回归模型在图像生成中因信息不一致致引导信号分散问题,提出信息基础引导(IGG)框架,通过动态加权将引导锚定到语义重要令牌,在相关任务中生成更优图像,有效纠正基于AR的方法。

Comments Accepted to The Forty-Third International Conference on Machine Learning (ICML 2026); 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09513 2026-07-08 physics.med-ph cs.AI cs.CV cs.LG eess.IV 版本更新 57%

Reduced NEXI protocol for the quantification of human gray matter microstructure on the Connectome 2.0 scanner

用于Connectome 2.0扫描仪中人类灰质微结构量化的一种简化NEXI协议

Quentin Uhl, Tommaso Pavan, Julianna Gerold, Kwok-Shing Chan, Yohan Jun, Shohei Fujita, Aneri Bhatt, Yixin Ma, Qiaochu Wang, Hong-Hsi Lee, Susie Y. Huang, Berkin Bilgic, Ileana Jelescu

机构 * Lausanne University Hospital (CHUV) and University of Lausanne(拉沃斯大学医院(CHUV)和拉沃斯大学) Massachusetts General Hospital(麻省总医院) Athinoula A. Martinos Center for Biomedical Imaging(阿提诺拉A.马丁诺斯生物医学成像中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种简化NEXI协议,利用可解释AI框架减少扫描时间,验证了其在体内的有效性,并展示了其在微结构映射中的优势。

Comments Submitted to Imaging Neuroscience. This all-in-one version includes supplementary materials. 34 pages, 145 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01725 2026-07-08 cs.LG cs.CV 版本更新 57%

Imbalance-Robust and Sampling-Efficient Continuous Conditional GANs via Adaptive Vicinal Learning and Auxiliary Regularization

通过自适应邻域学习和辅助正则化实现不平衡鲁棒且采样高效的连续条件生成对抗网络

Xin Ding, Yun Chen, Yongwei Wang, Kao Zhang, Sen Zhang, Peibei Cao, Xiangxue Wang

机构 * School of Artificial Intelligence/School of Future Technology, Nanjing University of Information Science & Technology, Nanjing, China(人工智能学院/未来技术学院,南京信息科学技术大学) Perceptual and Generative AI Lab, Nanjing University of Information Science & Technology, Nanjing, China(感知与生成人工智能实验室,南京信息科学技术大学) College of Media, Zhejiang University, Hangzhou, China(传媒学院,浙江大学) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对CcGAN固定大小邻域训练对标签密度敏感及CCDM计算昂贵问题,提出结合软/混合自适应邻域与辅助判别器引导正则化的CcGAN-AVAR,实验表明其能保持GAN采样效率,提升生成质量和标签一致性,推理速度远超CCDM。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2503.13212 2026-07-08 cs.LG 版本更新 50%

MAME: Multidimensional Adaptive Metamer Exploration with Human Perceptual Feedback

MAME:基于人类感知反馈的多维自适应同态体探索

Mina Kamao, Hayato Ono, Ayumu Yamashita, Kaoru Amano, Masataka Sawayama

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生学校) The University of Tokyo(东京大学) Graduate School of System Informatics(系统信息科学研究生学校) Kobe University(大阪大学) Hokkaido University(北海道大学) Prometech CG Research(Prometech CG研究所)

专题命中 其他图像生成 :image generation(abstract)

AI总结 该研究针对人脑网络与人工模型对齐问题,提出MAME框架,通过人类感知反馈引导在线图像生成,在单个心理物理实验中成功测量多维人类同态体空间,发现人类与CNN模型在低级处理同态体空间对齐较差,强调早期视觉计算重要性,为研究人类视觉功能提供工具。

Comments 26 pages, 12 figures. Accepted at Journal of Vision

Journal ref Journal of Vision, 26(8):1, 1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏