arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-06 至 2026-08-06 共收录 81 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 89%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 文生图 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 83%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2607.29025 2026-08-06 cs.CV 版本更新 85%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04840 2026-08-06 cs.CV cs.AI 新提交 70%

Towards a satellite image manipulation and deepfake localization benchmark dataset

面向卫星图像篡改与深度伪造定位的基准数据集

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。

Comments Accepted at IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 57 篇

2606.22216 2026-08-06 eess.IV cs.AI cs.CV 版本更新 91%

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge

Delta-Diffusion: 通过条件泊松扩散桥建模纵向脑淀粉样蛋白-PET轨迹

Yongheng Sun, Minhui Yu, Mengqi Wu, Maureen Kohi, Mingxia Liu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(abstract);分类 cs.CV

AI总结 提出Delta-Diffusion框架,将纵向PET合成建模为条件泊松扩散桥过程,结合扩散Transformer和物理启发的泊松扰动,在542名受试者上优于现有方法,准确捕捉淀粉样蛋白沉积的纵向变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04030 2026-08-06 cs.GR cs.AI cs.CV cs.CY cs.LG 新提交 89%

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

NuclearDiffusion:用于学习核能概念的文生成像基础模型

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。

Comments 29 pages, 10 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04820 2026-08-06 cs.CV 新提交 88%

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 85%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04394 2026-08-06 cs.CV 新提交 83%

Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection

通过重新审视基于扩散模型的跨域小样本目标检测数据生成实现无额外开销的数据增强

Zijian Zhuang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对跨域小样本目标检测的域差距与数据稀缺挑战,提出带定制噪声的选择性修复(SITN)方法,结合定制噪声生成与选择性修复模块合成有效数据,在6个CDFSOD和4个CDFSS数据集上达到新的最先进性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04827 2026-08-06 stat.ML cs.LG 新提交 82%

Intrinsic-Hybrid Latent Diffusion Models for Generative Modeling on Unknown Manifolds

用于未知流形生成建模的内在混合隐式扩散模型

Yizhu Wang, Mu Niu, Xiaochen Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出ILDM框架,将概率降维与未知流形几何感知扩散结合,通过混合扩散与近似去噪得分匹配方法,在三类数据集上实现生成质量提升,降低了FID和LPIPS分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04624 2026-08-06 cs.SD cs.AI 新提交 82%

Masked diffusion enables coherent beat tracking

掩码扩散实现连贯节拍跟踪

Francesco Foscarin, Filip Korzeniowski, Richard Vogl

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对节拍跟踪神经网络的无效输出问题,提出经三项改进的掩码扩散方法,减少不稳定行为并提升了节拍跟踪性能。

Comments Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04906 2026-08-06 cs.CV 新提交 79%

Enhancing Low Back Pain Assessment with Diffusion Models for Lumbar Spine MRI Segmentation

利用扩散模型增强下腰痛评估的腰椎MRI分割

Maria Monzon, Thomas Iff, Ender Konukoglu, Catherine R. Jutzeler

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出SpineSegDiff扩散框架,基于SPIDER数据集实现腰椎MRI的语义分割,性能接近nnUnet,可提升退化椎间盘识别,不确定性图助力临床审查,有望增强下腰痛的诊断与管理。

Comments Maria Monzon and Thomas Iff contributed equally to this work. Published in Proceedings of The 8th International Conference on Medical Imaging with Deep Learning (MIDL 2025), PMLR volume 301, pages 1145-1163, 2026

Journal ref Proceedings of Machine Learning Research 301:1145-1163, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04887 2026-08-06 cs.CV 新提交 79%

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models

STEP-OPD:重新思考扩散模型在线策略蒸馏中的输出目标与内部动态

Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 该研究针对扩散模型在线策略蒸馏提出STEP-OPD框架,通过扩展学习目标、对齐表示变化,提升了生成模型性能,在多项任务中优于标准OPD方法及对应单任务教师模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04701 2026-08-06 cs.CV 新提交 79%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交 79%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新 79%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 79%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26081 2026-08-06 hep-lat cs.LG 版本更新 79%

Group-Equivariant Diffusion Models for Lattice Field Theory

用于格点场论的群等变扩散模型

Octavio Vega, Javad Komijani, Aida El-Khadra, Marina Marinkovic

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对格点量子场论MCMC模拟的临界慢化问题,提出对群变换等变的对称感知分数扩散模型,经增强训练后在样本质量等指标上优于通用模型。

Comments Updated to match published version in JHEP. 45 pages, 12 figures. Code available at https://gitlab.com/ovega141/diffusion_for_lqft

Journal ref JHEP 07 (2026) 213

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05084 2026-08-06 cs.LG cs.RO 新提交 78%

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

学习何时停止:用于连续控制的前缀最优动态扩散策略

Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散策略连续控制的计算瓶颈,提出POGP框架,通过学习前缀值函数实现自适应去噪停止,减少约2.7倍迭代次数,同时提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 78%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04970 2026-08-06 math.AP 新提交 78%

Recovery of time-dependent coefficients for the convection-diffusion equation on conformally transversally anisotropic manifolds from partial data

从共形横截各向异性流形上的部分数据恢复对流扩散方程的时变系数

Boya Liu, Anamika Purohit

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对共形横截各向异性流形上的对流扩散方程反问题,利用部分输入-输出算子,在1-形式与函数的衰减测地射线变换单射的条件下,唯一确定时变对流项和密度系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04644 2026-08-06 math.PR 新提交 78%

Khinchin's and Chung's Laws of the Iterated Logarithm at Time Zero for the Linear Stochastic Fractional Diffusion Equation

线性随机分数阶扩散方程在时间零点的辛钦与钟氏重对数律

Chang Liu, Ran Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对带零初值的线性随机分数阶扩散方程,建立了时间零点的辛钦型重对数律,在特定附加条件下证明了钟氏型重对数律,将随机热方程的初始时间重对数律推广至一类时间分数阶随机扩散方程。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04614 2026-08-06 math.AP 新提交 78%

Stochastic Keller Segel System with Porous Medium Diffusion and Nonlinear Chemotactic Sensitivity

带有多孔介质扩散和非线性趋化敏感性的随机Keller-Segel系统

Yiming Jiang, Haohang Li, Yawei Wei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究带多孔介质扩散和非线性趋化敏感性的随机Keller-Segel系统,对a≥1且m≥2a+1的情况建立鞅解全局存在性等,揭示非线性趋化聚集与扩散的平衡,用多种方法克服相关困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04728 2026-08-06 physics.flu-dyn 新提交 78%

A hybrid proper orthogonal decomposition and diffusion framework for reduced-order forecasting of turbulent flow dynamics

一种用于湍流动力学降阶预测的本征正交分解与扩散混合框架

Rodrigo Abadia-Heredia, Xiangrui Zou, Manuel Lopez-Martin, Petros Koumoutsakos, Soledad Le Clainche

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出结合本征正交分解(POD)与有效动力学生成学习(G-LED)的混合框架,实现高效湍流预测,对比三种配置验证其降阶后大幅降低计算成本且保留关键流动结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19752 2026-08-06 math.PR 版本更新 78%

Weak Equilibrium Measures and Capacity--Hitting Identities for the Hypoelliptic Third-Order Langevin Diffusion

亚椭圆三阶朗之万扩散的弱平衡测度与容量-击中恒等式

Ping He, Xiaodan Li, Yingli Wang, Lingjiong Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文受加速采样算法启发,针对亚椭圆三阶朗之万扩散,通过证明椭圆正则化稳定性定理,结合特定策略与估计,构建弱平衡测度和弱容量,得到有界域及全空间的相关恒等式和正哈里斯常返性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28207 2026-08-06 math.OC 版本更新 78%

Three-Body Earth-Moon Transfers with Different Departure/Arrival Orbital Altitudes: New Phenomenon and Diffusion Model-Augmented Construction

不同出发/到达轨道高度的三体地月转移:新现象与扩散模型增强构建

Shuyue Fu, Wenxuan Zhang, Di Wu, Shengping Gong, Peng Shi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对传统网格搜索法在构建不同轨道高度地月转移时收敛慢、效率低的问题,本文提出扩散模型增强方法,发现飞行时间分布的不连续现象,并利用该现象训练扩散模型生成高质量初值,将收敛率提升47.34-56.25%,时间节省39.39-40.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11558 2026-08-06 math.NA cs.NA 版本更新 78%

A tensor-based exponential integrator for diffusion--reaction equations in common curvilinear coordinates

基于张量的扩散-反应方程在通用非正交坐标中的指数积分器

Marco Caliari, Fabio Cassini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于张量的方法,用于求解在允许通用非正交坐标表示的区域中扩散-反应方程的数值解,通过巧妙的有限差分离散化和指数欧拉方法处理刚性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 78%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14764 2026-08-06 math.NA cs.NA math.OC 版本更新 78%

Shape optimization for piecewise parameter identification in inverse diffusion problems with a single boundary measurement

在具有单个边界测量的逆扩散问题中针对分段参数识别的形状优化

Manabu Machida, Hirofumi Notsu, Julius Fergy Tiongson Rabago

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于形状优化的方法,用于在具有单个边界测量的逆扩散问题中恢复空间依赖参数,通过利用欧拉导数提升参数恢复的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏