arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-07 至 2026-08-07 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.08652 2026-08-07 cs.AI 版本更新 85%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image editing(abstract)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 70%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06264 2026-08-07 cs.CV cs.LG eess.IV 新提交 57%

OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations

OTLesMix:用于生成形状与位置多样化合成病灶的Wasserstein重心与最优传输映射

Robin Trombetta, Carole Lartizien

机构 * Univ. Lyon(里昂大学) INSA Lyon(里昂国立应用科学学院) UCBL(里昂第一大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) CREATIS

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究提出OTLesMix方法,利用Wasserstein重心与最优传输映射生成多样化合成病灶,在三项脑病灶分割任务上使Dice分数提升2.9至6.6个百分点,性能优于现有混合类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05600 2026-08-07 cs.LG cs.AI cs.CV 新提交 57%

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

LC-GRPO:通过朗之万校正弥合基于流的GRPO的训练-推理差距

Yingqing Guo, Hui Yuan, Zijian He, Mengdi Wang, Zheng Ding

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 LC-GRPO 是带朗之万校正的基于流的 GRPO 框架,通过对齐推理的 ODE 欧拉步加朗之万校正,缩小流模型训练与推理的样本差距,在多任务上提升奖励优化并保留生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05233 2026-08-07 cs.AI cs.CV 新提交 57%

Coherence-Oriented Dream Scene Visualisation

面向连贯性的梦境场景可视化

Azra Açıl, Simon Colton

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。

Comments short paper accepted at ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.06075 2026-08-07 cs.CV cs.AI 新提交 74%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 63 篇

2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05878 2026-08-07 cs.CV 新提交 83%

MAVISEG: Manifold Propagation and Visual Prototypes for Zero-Shot Open-Vocabulary Segmentation in Diffusion Transformers

MAVISEG:用于扩散Transformer中零样本开放词汇分割的流形传播与视觉原型

Rajatsubhra Chakraborty, Xujun Che, Ritabrata Chakraborty, Xi Niu, Depeng Xu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MAVISEG是一种无需训练的优化层,通过恢复扩散Transformer的结构化信号,在六个基准测试的无需训练方法中取得了最强整体结果,其mIoU在各基准中均最优。

Comments 20 pages, 14 figures, 9 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 82%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19725 2026-08-07 cs.LG cs.CV 版本更新 81%

Analytic Distribution of Classifier-Free Guidance for Schedule Design

用于调度设计的无分类器指导的解析分布

Enze Jiang, Zheng Ma

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对扩散模型中无分类器指导(CFG)的分布问题,通过概率流常微分方程分析并推导解析表示,提出分布引导CFG调度,经玩具模型验证,在Stable Diffusion 1.5上改进生成效果,降低采样成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06125 2026-08-07 cs.CV 新提交 79%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 79%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05834 2026-08-07 cs.CV 新提交 79%

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models

可控服装:基于潜在扩散模型的虚拟试穿精准标签与生成

Max Rehman Linder

机构 * Publicis Resources GenAI Team(阳狮集团GenAI团队) École Polytechnique(巴黎综合理工学院) KTH(皇家理工学院)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本研究提出基于潜在扩散模型的新方法,通过开源AI模型添加标签并训练适配器,实现虚拟试穿图像的可控生成,可避免误导消费者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 79%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05237 2026-08-07 cs.CV cs.AI 新提交 79%

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

上下文强制:揭示自回归视频扩散中的上下文效应

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Tencent Youtu Lab(腾讯云图实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 79%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06223 2026-08-07 cs.CV 79%

RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion

RedDiffuser:通过强化扩散审计多模态安全故障

Ruofan Wang, Xingjun Ma

机构 * Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究多模态系统在有害上下文暴露下的安全审计,提出RedDiffuser框架通过扩散模型生成视觉输入,揭示隐藏的安全漏洞,实验显示VLMs在部分有毒文本与视觉上下文结合时存在广泛安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05442 2026-08-07 eess.AS cs.SD 新提交 78%

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

Diff2Mix:基于扩散模型与可微分音频效果的可控音乐混音

Yisu Zong, Jinjie Shi, Joshua Reiss

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Diff2Mix系统,结合扩散模型与可微分音频效果,实现兼具高质量与可控风格的自动音乐混音,通过多维度评估验证其性能。

Comments Accepted to ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 78%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05687 2026-08-07 cs.CL cs.AI 新提交 78%

Answer First, Reason Later: Commitment Order in Diffusion LLMs

先给出答案,后进行推理:扩散大语言模型中的承诺顺序

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Hwiyeong Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 78%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06371 2026-08-07 math.AP 新提交 78%

Global weak solutions to the Cahn-Hilliard equation with degenerate mobility and singular diffusion

带有退化迁移率和奇异扩散的Cahn-Hilliard方程的整体弱解

Monica Conti, Andrea Giorgini, Greta Ricchi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对带退化迁移率和奇异扩散的Cahn-Hilliard方程初边值问题,在三维有界光滑凸域且初始数据具有限能量的条件下,通过非熵方法推导关键函数的L⁴(0,T;H²(Ω))估计,证明了合适整体弱解的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05382 2026-08-07 quant-ph 新提交 78%

Quantum Error Mitigation with Diffusion-Like Models

基于类扩散模型的量子误差缓解

Yuval Idan, Ofek Nourian, Elad Mentovich, Taylor L. Patti, Eliahu Cohen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对量子系统退相干问题,提出基于类扩散模型的AI辅助误差缓解框架,通过机器学习学习去噪映射,在单量子比特、多量子比特寄存器上验证,可兼容噪声分布式量子系统,用于近似非幺正动力学与缓解相干损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05305 2026-08-07 cond-mat.mtrl-sci 新提交 78%

Cooperative adsorption and diffusion trapping induced by AlF3 intercalation in graphite

石墨中AlF3插层诱导的协同吸附与扩散捕获

H. Betancourt-Infante, G. Ruano, F. Bonetto, S. J. Rodríguez-Sotelo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过第一性原理研究AlF3在石墨中的吸附与插层,揭示了其诱导的协同吸附与扩散捕获机制,为调控碳基储能系统插层效率提供了定量框架。

Comments 14 pages, 7 Figures and SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03881 2026-08-07 astro-ph.HE 版本更新 78%

Suppressed diffusion and gamma-ray emission from the Cygnus bubble

天鹅座气泡的抑制扩散和伽马射线辐射

Ben Li, Pasquale Blasi, Elena Amato

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过数值求解非热粒子输运方程,探讨了天鹅座OB2星团中粒子加速机制(激波或中心源)及抑制扩散对LHAASO观测到的PeV伽马射线能谱和形态的影响。

Comments 15 pages, 11 figures. Published in A&A

Journal ref Astronomy & Astrophysics, 712, A41 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26540 2026-08-07 physics.chem-ph cs.AI 版本更新 78%

Domain-Gated Latent Diffusion: Generative Inverse Design of HMX-Class Energetic Materials with First-Principles Validation

DGLD: 用于发现新型含能材料的域门控潜在扩散

Yehudit Aperstein, Alexander Apartsin

机构 * Department of Intelligent Systems, Afeka Tel -Aviv College of Engineering(智能系统系,阿费卡特拉维工程学院) School of Computer Science, Faculty of Sciences, HIT -Holon Institute of Technology(计算机科学学院,科学学院,希伯来理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出域门控潜在扩散模型(DGLD),通过标签质量门控、多任务评分引导和四阶段化学验证漏斗,从稀疏标记数据中生成12个经DFT验证的新型含能材料候选物,其中领先化合物L1和E1在爆速和结构新颖性上表现优异。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01107 2026-08-07 cs.LG cond-mat.dis-nn stat.ML 版本更新 78%

Diffusion Operator Geometry of Feedforward Representations

前馈表示的扩散算子几何

Kanishka Reddy

机构 * Department of Applied Mathematics(应用数学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散算子的前馈表示几何分析框架,通过Gaussian核扩散马尔可夫算子推导出运输、谱、标签边界和局部尺度可观测量,并验证了其在合成数据和MNIST实验中的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26114 2026-08-07 astro-ph.IM 版本更新 78%

Charge diffusion and modulation transfer function in a Nancy Grace Roman Space Telescope detector

罗马空间望远镜探测器中的电荷扩散与调制传递函数

Emily Macbeth, Katherine Laliotis, Christopher M. Hirata, Christopher Merchant

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究罗马空间望远镜探测器中电荷扩散对弱引力透镜测量的影响,通过激光条纹图案分析,确定调制传递函数模型,并提出适用于弱引力透镜测量的调查策略。

Comments 20 pages, 14 figures. As accepted to PASP

Journal ref Publications of the Astronomical Society of the Pacific, Volume 138, Issue 8, id.085002, 17 pp. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 78%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09799 2026-08-07 math-ph math.MP 版本更新 78%

Time-marching representation based quantum algorithms for the Lattice Boltzmann model of the advection-diffusion equation

基于时间推进表示的量子算法用于输运-扩散方程的格子玻尔兹曼模型

Yuan He, Yuan Yu, Yue Yu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于时间推进表示的量子算法,用于格子玻尔兹曼模型中的输运-扩散方程,实现了无测量的量子模拟方法。

详情

展开后加载摘要…

URL PDF HTML 收藏