arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-23 至 2026-03-23 共收录 54 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 38 篇

2603.19743 2026-03-23 cond-mat.str-el quant-ph 50%

Spin subdiffusion in perturbed infinite-U Hubbard chain

受扰无限U Hubbard链中的自旋亚扩散

Jakub Rękas, Marcin Mierzejewski, Zala Lenarčič, Peter Prelovšek

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究受扰无限U Hubbard链中的自旋动力学,揭示自旋传输通过电荷传输实现,导致亚扩散现象,与无序或偶极守恒模型不同。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19687 2026-03-23 cs.LO cs.LG 50%

Diminishing Returns in Expanding Generative Models and Godel-Tarski-Lob Limits

扩展生成模型中的边际收益递减与哥德尔-塔斯基-洛布限制

Angshul Majumdar

机构 * Indraprastha Institute of Information Technology(印度理工信息科技学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个任务空间框架,分析扩展生成系统的能力增长,证明随着系统容量增加,任务覆盖的边际改进趋于零,并结合逻辑理论揭示内在推理的根本限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19679 2026-03-23 math.AP 50%

Self-similar Dynamics in the Critical $p$-Laplacian Patlak-Keller-Segel Model: Shrinking Blow-up and Expanding Propagation

临界p-拉普拉斯帕塔克-凯勒-塞格尔模型中的自相似动力学:收缩破裂与扩展传播

Chunhua Jin, Fengqing Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了临界指数m下的p-拉普拉斯帕塔克-凯勒-塞格尔模型,证明在临界阈值m下系统存在有限时间破裂解,并探讨了自相似解的性质。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19629 2026-03-23 stat.ML cs.LG physics.geo-ph 50%

On the role of memorization in learned priors for geophysical inverse problems

关于在地质反演问题中学习先验的记忆作用

Ali Siahkoohi, Davide Sabeddu

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了深度生成模型在地质反演中的记忆效应,指出训练此类模型可能使先验收敛于经验分布,进而影响反演结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14049 2026-03-23 math.OC cs.LG cs.SY eess.SY math.PR 50%

Schrödinger Bridge Over A Compact Connected Lie Group

薛定谔桥与紧连通李群上的运动方程

Hamza Mahmood, Abhishek Halder, Adeel Akhtar

机构 * Department of Mechanical & Industrial Engineering(机械与工业工程系) New Jersey Institute of Technology(新泽西理工学院) Department of Aerospace Engineering(航空航天工程系) Iowa State University(爱荷华州立大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了紧连通李群上的薛定谔桥问题,提出了一种坐标自由的随机最优控制方法,避免了局部参数化或欧几里得空间嵌入的限制,并在SO(2)和SO(3)上进行了数值示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 50%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24760 2026-03-23 physics.comp-ph 50%

FESTIM v2.0: Upgraded framework for multi-species hydrogen transport and enhanced performance

FESTIM v2.0:多物种氢传输升级框架及性能提升

James Dark, Rémi Delaporte-Mathurin, Jørgen S. Dokken, Huihua Yang, Chirag Khurana, Kaelyn Dunnell, Gabriele Ferrero, Vladimir Kulagin, Samuele Meschini

专题命中 扩散模型 :diffusion(abstract)

AI总结 FESTIM v2.0扩展了氢传输框架的物理范围和软件架构,支持多物种传输、先进捕获与反应机制,采用DOLFINx平台提升性能与可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19386 2026-03-23 eess.IV cs.LG 50%

TuLaBM: Tumor-Biased Latent Bridge Matching for Contrast-Enhanced MRI Synthesis

TuLaBM:肿瘤偏置潜在桥匹配用于增强MRI合成

Atharva Rege, Adinath Madhavrao Dukre, Numan Balci, Dwarikanath Mahapatra, Imran Razzak

机构 * MBZUAI National Institute of Technology Karnataka(国家理工学院卡纳塔) Cleveland Clinic Abu Dhabi(克利夫兰诊所阿布扎赫) Khalifa University(卡里玛大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出TuLaBM,通过在学习的潜在空间中将非对比MRI转换为增强MRI视为布朗桥传输,提升效率和肿瘤区域保真度,实验显示在BraTS2023-GLI和克利夫兰诊所肝脏MRI数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 50%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19366 2026-03-23 cond-mat.soft physics.app-ph physics.bio-ph physics.chem-ph 50%

Deciphering Molecular Charge Anisotropy: the Case of Antibody Solutions

解析分子电荷各向异性:抗体溶液的案例

Fabrizio Camerin, Susana Marin-Aguilar, Anna Stradner, Peter Schurtenberger, Emanuela Zaccarelli

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种多尺度框架,通过胶体启发的粗粒化建模与神经网络优化,解析蛋白质溶液中电荷分布对结构和动力学的影响,揭示电荷斑点的空间排列对溶液结构的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19326 2026-03-23 q-bio.QM cs.LG cs.NA math.AP math.NA 50%

Mathematical Modeling of Cancer-Bacterial Therapy: Analysis and Numerical Simulation via Physics-Informed Neural Networks

癌症-细菌疗法的数学建模:通过物理引导神经网络进行分析和数值模拟

Ayoub Farkane, David Lassounon

机构 * TICLab, International University of Rabat(里海大学拉巴特分校TIC实验室) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN研究所) Université de Lorraine, CNRS, IECL(洛林大学,法国国家科学研究中心,IECL研究所) Univ Rennes, INSA, CNRS, IRMAR-UMR 6625(里昂大学,法国国家科学研究中心,IRMAR-UMR 6625研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个耦合非线性反应扩散方程组的数学模型,利用物理引导神经网络进行分析和模拟,探讨肿瘤生长、细菌定植、氧水平、免疫抑制因子和细菌通信之间的相互作用,验证模型的全局well-posed性并分析稳定性,通过数值实验预测治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2503.19486 2026-03-23 cs.CV 83%

Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage

探索解耦和可控的人像图像合成:从端到端到分阶段

Zhengwentai Sun, Chenghong Li, Hongjie Liao, Xihe Yang, Keru Zheng, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

专题命中 可控生成 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种解耦可控的人像合成任务,通过分阶段框架提升可控性和泛化能力,优于端到端模型,适用于真实场景。

Comments A new version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19456 2026-03-23 cs.CV 74%

In-the-Wild Camouflage Attack on Vehicle Detectors through Controllable Image Editing

真实场景中通过可控图像编辑实施车辆检测器的伪装攻击

Xiao Fang, Yiming Gong, Stanislav Panev, Celso de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室) Florida State University(佛罗里达州立大学)

专题命中 可控生成 :image editing(title);分类 cs.CV

AI总结 本文提出了一种将车辆伪装攻击视为条件图像编辑问题的新框架,通过图像级和场景级生成策略提升攻击效果,实验表明其在COCO和LINZ数据集上显著降低检测器性能,同时保持车辆结构和提升人类感知的隐蔽性。

Comments 45 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV 57%

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19667 2026-03-23 cs.CV cs.AI 57%

Toward High-Fidelity Visual Reconstruction: From EEG-Based Conditioned Generation to Joint-Modal Guided Rebuilding

迈向高保真视觉重建:从基于EEG的条件生成到联合模态引导重建

Zhijian Gong, Tianren Yao, Wenjia Dong, Xueyuan Xu

机构 * Beijing University of Technology, Beijing(北京理工大学) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing(北京计算智能与智能系统重点实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出联合模态视觉重建框架,通过独立学习EEG和文本信息,提升EEG特征的重建能力,结合多尺度编码和图像增强,实现高保真视觉重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19547 2026-03-23 cs.CV 57%

SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification

SeeClear: 通过生成性消透明实现可靠的透明物体深度估计

Xiaoying Wang, Yumeng He, Jingkai Shi, Jiayin Lu, Yin Yang, Ying Jiang, Chenfanfu Jiang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SeeClear通过生成性消透明技术,将透明物体转换为几何一致的不透明图像,从而提升单目深度估计的稳定性与准确性。

Comments Project page: https://heyumeng.com/SeeClear-web/. 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2511.01998 2026-03-23 cs.CV cs.NA math.NA 57%

Locally-Supervised Global Image Restoration

局部监督的全局图像恢复

Benjamin Walder, Daniel Toader, Robert Nuster, Günther Paltauf, Peter Burgholzer, Gregor Langer, Lukas Krainer, Markus Haltmeier

机构 * Universität Innsbruck(因斯布鲁克大学) Universität Graz(格拉茨大学) Research Center for Non Destructive Testing GmbH(非破坏性测试研究中心 GmbH) Prospective Instruments LK OG(前瞻性仪器 LK OG)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出局部监督方法用于图像重建,通过利用图像分布的多重不变性,在无需完整地面真实数据的情况下实现与全监督方法相当的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19604 2026-03-23 math.OC 50%

Fixed-Point Delayed Subgradient Methods for Nonsmooth Convex Optimization Problems

固定点延迟子梯度方法用于非光滑凸优化问题

Ontima Pankoon, Nimit Nimana, Yeol Je Cho

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出基于混合最速下降法和延迟子梯度思想的固定点延迟子梯度方法,用于求解非光滑凸优化问题,证明了算法收敛性,并扩展到集中网络系统和图像修复应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 2 篇

2603.19766 2026-03-23 cs.CV 57%

Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

适应预训练的单细胞基础模型以从组织学图像生成空间基因表达

Donghai Fang, Yongheng Li, Zhen Wang, Yuansong Zeng, Wenwen Min

机构 * Sun Yat-sen University(中山大学) Yunnan University(云南大学) Chongqing University(重庆大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HINGE模型,通过引入SoftAdaLN和扩散目标,将预训练的单细胞基础模型适配为条件表达生成器,提升了组织学图像生成空间基因表达的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 57%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2603.12869 2026-03-23 math.NA cs.NA math.AP 50%

Weak Adversarial Neural Pushforward Method for Fractional Fokker-Planck Equations

弱对抗神经推进法用于分数福克-平面克方程

Andrew Qing He, Wei Cai

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出弱对抗神经推进法用于求解分数福克-平面克方程,通过神经网络将解分布表示为基本分布的推进,并利用蒙特卡洛采样离散弱形式,无需时间网格。该方法利用平面波测试函数作为分数拉普拉斯算子的本征函数,运算成本与经典扩散相同,适用于多个基准问题。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24897 2026-03-23 cs.AI 50%

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

RealUnify: 统一模型真的能从统一中受益吗?一个全面的基准测试

Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu

机构 * PKU(北京大学) Kling Team(Kling团队) NTU(国立台湾大学) CASIA(中国科学院自动化研究所) NUS(国立新加坡大学) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 RealUnify基准测试旨在评估统一模型中理解与生成能力的双向协同效应,通过10类32子任务的1000个人工标注实例,揭示现有统一模型在协同能力上的不足,强调需新的训练策略来提升统一建模潜力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2603.19570 2026-03-23 cs.CV 79%

Accelerating Diffusion Decoders via Multi-Scale Sampling and One-Step Distillation

通过多尺度采样和一步蒸馏加速扩散解码器

Chuhan Wang, Hao Chen

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出多尺度采样和一步蒸馏方法,显著降低扩散解码器的解码时间,同时保持高质量图像重建,为高效图像分词提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19647 2026-03-23 math.NA cs.NA 50%

On-the-Fly ROM-Based Acceleration of SI-DSA for Implicit Time Marching of the Radiative Transfer Equation

实时ROM基于SI-DSA加速隐式时间推进的辐射传输方程

Ningxin Liu, Zhichao Peng

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于ROM的实时加速方法,用于隐式时间推进的辐射传输方程SI-DSA,利用低秩结构提升预处理效果,实现1.4至2倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏