arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-13 至 2026-03-13 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2510.10489 2026-03-13 cs.CV 83%

Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation

面向细粒度图像生成的头部适应性旋转位置编码

Jiaye Li, Baoyou Chen, Hui Li, Zilong Dong, Jingdong Wang, Siyu Zhu

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HARoPE,一种面向细粒度图像生成的头部适应性旋转位置编码方法,通过动态频率分配和语义对齐提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12155 2026-03-13 cs.CV cs.AI 57%

GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows

GlyphBanana: 通过代理工作流推进精确文本渲染

Zexuan Yan, Jiarui Jin, Yue Ma, Shijian Wang, Jiahui Hu, Wenxiang Jiao, Yuan Lu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) South China University of Technology(华南理工大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 GlyphBanana通过代理工作流整合辅助工具,提升复杂文本和公式渲染的精度,适用于多种文本到图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 57%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11493 2026-03-13 cs.CV cs.AI cs.CY 57%

OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure

OrthoEraser: 基于耦合神经元的正交投影用于概念擦除

Chuancheng Shi, Wenhua Wu, Fei Shen, Xiaogang Zhu, Kun Hu, Zhiyong Wang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 OrthoEraser通过稀疏自编码器实现高分辨率特征解耦,利用分析梯度正交化策略有效擦除有害内容,同时保留良性语义,实验表明其在安全性和有效性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2603.12247 2026-03-13 cs.CV 85%

Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习

Xiangyu Zhao, Peiyuan Zhang, Junming Lin, Tianhao Liang, Yuchen Duan, Shengyuan Ding, Changyao Tian, Yuhang Zang, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) BUPT(北京邮电大学) CUHK(香港中文大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12264 2026-03-13 cs.CV 79%

GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

GRADE: 图像编辑中学科引导推理的基准测试

Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen Yang, Changyao Tian, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Qibing Ren, Zhihang Zhong, Xuanhe Zhou, Junchi Yan, Xue Yang

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 GRADE是首个评估图像编辑中学科引导推理能力的基准测试,通过多领域样本和多维评估协议揭示当前模型在知识密集型编辑任务中的局限性。

Comments 49 pages, 23 figures, 10 tables; Project Page: https://grade-bench.github.io/, Code: https://github.com/VisionXLab/GRADE, Dataset: https://huggingface.co/datasets/VisionXLab/GRADE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 44 篇

2603.11556 2026-03-13 cs.CV 83%

Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception

通过多模态感知引导的双条件扩散模型增强图像美学

Xinyu Nan, Ning Wang, Yuyao Zhai, Mei Yang

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出双监督图像美学增强模型DIAE,通过多模态感知和双分支监督框架提升图像美学质量与内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10445 2026-03-13 cs.LG cs.CV 83%

Unlearning the Unpromptable: Prompt-free Instance Unlearning in Diffusion Models

取消不可提示的内容:扩散模型中的无提示实例取消学习

Kyungryeol Lee, Kyeonghyun Lee, Seongmin Hong, Byung Hyun Lee, Se Young Chun

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种无提示的扩散模型实例取消学习方法,通过图像编辑、时间步加权和梯度手术,有效消除不可提示的不受欢迎输出,如面孔和文化误判,同时保持模型完整性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04308 2026-03-13 cs.LG cs.AI cs.SI physics.soc-ph 82%

HOG-Diff: Higher-Order Guided Diffusion for Graph Generation

HOG-Diff: 基于更高阶引导的图生成扩散模型

Yiming Huang, Tolga Birdal

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 HOG-Diff通过高阶拓扑引导和扩散桥梁,实现图生成的高阶拓扑结构捕捉,展示了方法在多样领域和大规模设置中的优越性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12245 2026-03-13 cs.CV 79%

One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers

一个模型,多种预算:弹性潜在接口用于扩散变换器

Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov, Dogyun Park, Anil Kag, Michael Vasilkovsky, Sergey Tulyakov, Vicente Ordonez, Aliaksandr Siarohin

机构 * Rice University(里士大学) Snap Inc.(Snap公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ELIT通过引入弹性潜在接口,解耦输入图像大小与计算资源,优化生成质量与计算效率的平衡,实现多场景下的性能提升。

Comments Project page: https://snap-research.github.io/elit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07504 2026-03-13 cs.CV 79%

High-Fidelity Medical Shape Generation via Skeletal Latent Diffusion

通过骨骼潜在扩散实现高保真的医学形状生成

Guoqing Zhang, Jingyun Yang, Siqi Chen, Anping Zhang, Yang Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。

Comments 11 pages, 5 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11509 2026-03-13 cs.CV 79%

Manifold-Optimal Guidance: A Unified Riemannian Control View of Diffusion Guidance

流形最优引导:扩散引导的黎曼控制视角统一观

Zexi Jia, Pengcheng Luo, Zhengyao Fang, Jinchao Zhang, Jie Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出流形最优引导(MOG)和Auto-MOG,通过黎曼控制视角解决扩散引导中的几何不匹配问题,提升生成质量并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10365 2026-03-13 cs.CV 79%

Geometric Autoencoder for Diffusion Models

几何自编码器用于扩散模型

Hangyu Liu, Jianyong Wang, Yutao Sun

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。

Comments Code and models are publicly available at https://github.com/sii-research/GAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24161 2026-03-13 cs.CV 79%

GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

GeoDiff4D: 基于几何的扩散模型用于4D头像重建

Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu

机构 * Tsinghua University(清华大学) Li Auto(利亚自动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26489 2026-03-13 cs.CV cs.LG eess.SP 79%

Contrastive Diffusion Guidance for Spatial Inverse Problems

对比扩散引导用于空间逆问题

Sattwik Basu, Chaitanya Amballa, Zhongweiyang Xu, Jorge Vančo Sampedro, Srihari Nelakuditi, Romit Roy Choudhury

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of South Carolina(南卡罗来纳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CoGuide模型,通过对比学习在平滑嵌入空间中近似似然分数,以解决空间逆问题中的非可微前向算子挑战,实现更稳定的去噪和更稳健的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05662 2026-03-13 cs.CV 79%

InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models

InvAD: 基于逆向的无重建异常检测方法与扩散模型

Shunsuke Sakai, Xiangteng He, Chunzhi Gu, Leonid Sigal, Tatsuhito Hasegawa

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 InvAD提出了一种基于逆向的无重建异常检测方法,通过DDIM逆向推断潜在变量并利用先验分布测量偏差,实现高效且准确的异常检测。

Comments Accepted to CVPR2026. Project page: https://invad-project.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12234 2026-03-13 cond-mat.dis-nn cond-mat.stat-mech quant-ph 78%

Thermalisation as Diffusion in Hilbert Space

热化作为希尔伯特空间中的扩散

Aleksey Lunkin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于希尔伯特空间扩散的热化理论,通过随机矩阵元模型推导出热化时间尺度,并验证了其在多种模型中的预测一致性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11265 2026-03-13 eess.SY cs.SY 78%

Conduction-Diffusion in N-Dimensional settings as irreversible port-Hamiltonian systems

N维环境下传导-扩散作为不可逆端口哈密顿系统

Luis Mora, Yann Le Gorrec, Hector Ramirez, Denis Matignon

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种适用于N维环境的传导-扩散现象的不可逆端口哈密顿系统模型,为多物理过程的系统建模与控制提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11192 2026-03-13 cond-mat.stat-mech physics.bio-ph physics.chem-ph 78%

Pattern stability in reaction-diffusion systems depends on path entropy

反应扩散系统中模式稳定性取决于路径熵

Eric R. Heller, David T. Limmer

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出非平衡瞬子框架,通过路径熵改变亚稳模式稳定性,揭示其在非平衡模式形成中的关键作用。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11125 2026-03-13 stat.ML cs.LG 78%

Co-Diffusion: An Affinity-Aware Two-Stage Latent Diffusion Framework for Generalizable Drug-Target Affinity Prediction

Co-Diffusion:一种面向亲和力的两阶段潜在扩散框架用于通用化药物-靶点亲和力预测

Yining Qian, Pengjie Wang, Yixiao Li, An-Yang Lu, Cheng Tan, Shuang Li, Lijun Liu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院) Westlake University(西湖大学) School of Artificial Intelligence, Beihang University(北航人工智能学院) Key Laboratory of Bioresource Research and Development of Liaoning Province, College of Life and Health Sciences, Northeastern University(辽宁省生物资源研究开发重点实验室,东北大学生命与健康科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Co-Diffusion通过两阶段潜在扩散框架提升药物-靶点亲和力预测的泛化能力,解决冷启动问题并增强零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11065 2026-03-13 physics.chem-ph cond-mat.mtrl-sci cond-mat.soft 78%

Micropatterning photopolymerizable hydrogels for diffusion studies using pillar arrays or photomasks

用于扩散研究的微图案化光聚合水凝胶:通过柱阵列或光掩模

Sevgi Onal, Edmondo Battista, Hilal Nasir, Fabio Formiggini, Valentina Mollo, Raffaele Vecchione, Paolo Netti

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过柱阵列或光掩模微图案化光聚合水凝胶,用于研究分子在水凝胶界面的扩散行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08771 2026-03-13 stat.ML cs.IT cs.LG math.IT 78%

Micro-Diffusion Compression - Binary Tree Tweedie Denoising for Online Probability Estimation

微扩散压缩 - 二叉树 Tweedie 去噪用于在线概率估计

Roberto Tacconelli

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Midicoth通过微扩散去噪层和二叉树校准技术,改进在线概率估计,解决稀疏观察导致的分布平坦问题,提升压缩效率。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04329 2026-03-13 cs.RO 78%

Safe and Stylized Trajectory Planning for Autonomous Driving via Diffusion Model

通过扩散模型实现自动驾驶的安全且风格化的轨迹规划

Shuo Pei, Yong Wang, Yuanchen Zhu, Chen Sun, Qin Li, Yanan Zhao, Huachun Tan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SDD Planner,通过结合多源风格感知编码器和风格引导动态轨迹生成器,实现自动驾驶中安全与风格化轨迹规划的平衡,实验表明其在多个基准测试中表现优异。

Comments 12 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03524 2026-03-13 eess.SP 78%

Channel-Aware Conditional Diffusion Model for Secure MU-MISO Communications

面向安全MU-MISO通信的通道感知条件扩散模型

Tong Hui, Xiao Tang, Yichen Wang, Qinghe Du, Dusit Niyato, Zhu Han

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种通道感知条件扩散模型,用于在MU-MISO通信中提升物理层安全性,通过生成近优的波束成形和人工噪声策略,实现更高效的保密性能。

Comments Accepted @ IEEE TVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08246 2026-03-13 cs.RO 78%

FSAG: Enhancing Human-to-Dexterous-Hand Finger-Specific Affordance Grounding via Diffusion Models

FSAG: 通过扩散模型增强人对灵巧手手指特定 affordance 的 grounding

Yifan Han, Yichuan Peng, Pengfei Yi, Junyan Li, Hanqing Wang, Gaojing Zhang, Qi Peng Liu, Wenzhao Lian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出FSAG框架,通过扩散模型提取语义affordance,实现稳定多接触抓取,无需硬件特定数据集,且单模态深度信息即可实现高性能抓取合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10986 2026-03-13 astro-ph.GA 78%

Experimental investigation of O2 diffusion and entrapment in interstellar amorphous solid water (ASW)

对星际非晶固态水(ASW)中O2扩散和捕获的实验研究

Lina Coulaud, Julia C. Santos, Ko-Ju Chuang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过实验测量了O2在星际非晶固态水中的表面扩散和捕获效率,发现其扩散能垒较低,表明高迁移性,并指出水冰可能保留了部分超易挥发物。

Comments 12 pages, 13 figures, submitted to Astronomy and Astrophysics

Journal ref A&A 707, A168 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12516 2026-03-13 cs.SI 78%

Designed to Spread: A Generative Approach to Enhance Information Diffusion

为传播而设计:一种增强信息扩散的生成方法

Ziqing Qian, Jiaying Lei, Shengqi Dang, Nan Cao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DOCG任务,通过生成模型优化内容传播,提升信息扩散效果并保持内容核心语义。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23507 2026-03-13 cond-mat.stat-mech 78%

Emergence of long-range non-equilibrium correlations in free liquid diffusion

自由液扩散中非平衡长程相关性的出现

Marco Bussoletti, Mirko Gallo, Amir Jafari, Gregory L. Eyink

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究揭示了自由液扩散中非平衡长程相关性的形成机制,通过DFV模型展示了浓度波动的自相似衰减特性及新的空间衰减规律。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04531 2026-03-13 eess.IV 78%

Anatomy-Guided Surface Diffusion Model for Alzheimer's Disease Normative Modeling

基于解剖结构的表面扩散模型用于阿尔茨海默病规范建模

Jianwei Zhang, Yonggang Shi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于解剖结构的表面扩散模型,用于提高阿尔茨海默病规范建模的解剖对齐和个体差异检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13748 2026-03-13 math.PR 71%

Heavy Traffic Diffusion Limit for a Closed Queueing Network with Single-Server and Infinite-Server Stations

重载扩散极限:具有单服务器和无限服务器站的闭环排队网络

Amir A. Alwan, Barış Ata

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了在重载条件下,具有单服务器和无限服务器站的闭环排队网络的扩散极限行为,通过证明队列长度和空闲过程的弱收敛性,为系统提供近似分析。

详情

展开后加载摘要…

URL PDF HTML 收藏