arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-07 至 2026-08-07 共收录 55 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 70%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06264 2026-08-07 cs.CV cs.LG eess.IV 新提交 57%

OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations

OTLesMix:用于生成形状与位置多样化合成病灶的Wasserstein重心与最优传输映射

Robin Trombetta, Carole Lartizien

机构 * Univ. Lyon(里昂大学) INSA Lyon(里昂国立应用科学学院) UCBL(里昂第一大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) CREATIS

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究提出OTLesMix方法,利用Wasserstein重心与最优传输映射生成多样化合成病灶,在三项脑病灶分割任务上使Dice分数提升2.9至6.6个百分点,性能优于现有混合类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05600 2026-08-07 cs.LG cs.AI cs.CV 新提交 57%

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

LC-GRPO:通过朗之万校正弥合基于流的GRPO的训练-推理差距

Yingqing Guo, Hui Yuan, Zijian He, Mengdi Wang, Zheng Ding

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 LC-GRPO 是带朗之万校正的基于流的 GRPO 框架,通过对齐推理的 ODE 欧拉步加朗之万校正,缩小流模型训练与推理的样本差距,在多任务上提升奖励优化并保留生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05233 2026-08-07 cs.AI cs.CV 新提交 57%

Coherence-Oriented Dream Scene Visualisation

面向连贯性的梦境场景可视化

Azra Açıl, Simon Colton

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。

Comments short paper accepted at ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.06075 2026-08-07 cs.CV cs.AI 新提交 74%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 41 篇

2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05878 2026-08-07 cs.CV 新提交 83%

MAVISEG: Manifold Propagation and Visual Prototypes for Zero-Shot Open-Vocabulary Segmentation in Diffusion Transformers

MAVISEG:用于扩散Transformer中零样本开放词汇分割的流形传播与视觉原型

Rajatsubhra Chakraborty, Xujun Che, Ritabrata Chakraborty, Xi Niu, Depeng Xu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MAVISEG是一种无需训练的优化层,通过恢复扩散Transformer的结构化信号,在六个基准测试的无需训练方法中取得了最强整体结果,其mIoU在各基准中均最优。

Comments 20 pages, 14 figures, 9 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06125 2026-08-07 cs.CV 新提交 79%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 79%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05834 2026-08-07 cs.CV 新提交 79%

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models

可控服装:基于潜在扩散模型的虚拟试穿精准标签与生成

Max Rehman Linder

机构 * Publicis Resources GenAI Team(阳狮集团GenAI团队) École Polytechnique(巴黎综合理工学院) KTH(皇家理工学院)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本研究提出基于潜在扩散模型的新方法,通过开源AI模型添加标签并训练适配器,实现虚拟试穿图像的可控生成,可避免误导消费者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 79%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05237 2026-08-07 cs.CV cs.AI 新提交 79%

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

上下文强制:揭示自回归视频扩散中的上下文效应

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Tencent Youtu Lab(腾讯云图实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05442 2026-08-07 eess.AS cs.SD 新提交 78%

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

Diff2Mix:基于扩散模型与可微分音频效果的可控音乐混音

Yisu Zong, Jinjie Shi, Joshua Reiss

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Diff2Mix系统,结合扩散模型与可微分音频效果,实现兼具高质量与可控风格的自动音乐混音,通过多维度评估验证其性能。

Comments Accepted to ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 78%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05687 2026-08-07 cs.CL cs.AI 新提交 78%

Answer First, Reason Later: Commitment Order in Diffusion LLMs

先给出答案,后进行推理:扩散大语言模型中的承诺顺序

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Hwiyeong Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 78%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06371 2026-08-07 math.AP 新提交 78%

Global weak solutions to the Cahn-Hilliard equation with degenerate mobility and singular diffusion

带有退化迁移率和奇异扩散的Cahn-Hilliard方程的整体弱解

Monica Conti, Andrea Giorgini, Greta Ricchi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对带退化迁移率和奇异扩散的Cahn-Hilliard方程初边值问题,在三维有界光滑凸域且初始数据具有限能量的条件下,通过非熵方法推导关键函数的L⁴(0,T;H²(Ω))估计,证明了合适整体弱解的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05382 2026-08-07 quant-ph 新提交 78%

Quantum Error Mitigation with Diffusion-Like Models

基于类扩散模型的量子误差缓解

Yuval Idan, Ofek Nourian, Elad Mentovich, Taylor L. Patti, Eliahu Cohen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对量子系统退相干问题,提出基于类扩散模型的AI辅助误差缓解框架,通过机器学习学习去噪映射,在单量子比特、多量子比特寄存器上验证,可兼容噪声分布式量子系统,用于近似非幺正动力学与缓解相干损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05305 2026-08-07 cond-mat.mtrl-sci 新提交 78%

Cooperative adsorption and diffusion trapping induced by AlF3 intercalation in graphite

石墨中AlF3插层诱导的协同吸附与扩散捕获

H. Betancourt-Infante, G. Ruano, F. Bonetto, S. J. Rodríguez-Sotelo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过第一性原理研究AlF3在石墨中的吸附与插层,揭示了其诱导的协同吸附与扩散捕获机制,为调控碳基储能系统插层效率提供了定量框架。

Comments 14 pages, 7 Figures and SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05970 2026-08-07 cs.RO cs.AI 新提交 67%

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06240 2026-08-07 cs.CV cs.AI 新提交 57%

PRISM: Distribution-Gated Flow Matching for Controllable Unpaired Image Translation

PRISM:用于可控非配对图像翻译的分布门控流匹配

Elad Yoshai, Natan T. Shaked

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PRISM是一种无GAN的流匹配框架,通过分布门控实现可控非配对图像翻译,在5个自然与生物医学基准上,其在多数任务的Inception FID、KID及组织病理学细胞核计数比上表现优异,平衡了目标逼真度与结构保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05798 2026-08-07 cs.CV cs.LG cs.SD 新提交 57%

KVAE: Family of Tokenizers for Multimodal Generative Models

KVAE:用于多模态生成模型的分词器家族

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出用于多模态生成模型的KVAE分词器家族,含音频、图像、视频专用型号,性能优于多款前沿开源分词器,公开了训练细节与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05626 2026-08-07 cs.CV 新提交 57%

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

通过SDR融合与增益图逆色调映射实现双输出多曝光HDR重建

Jinho Kim, Jinwoo Kim, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DOME-HDR框架,通过LoRA适配的潜在扩散模型与双交叉注意力融合模块生成SDR,结合HPGM网络预测增益图实现多曝光HDR重建,在多个数据集上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05557 2026-08-07 cs.CV 新提交 57%

Hierarchical Flow Matching for 3D Point Cloud Generation

用于三维点云生成的分层流匹配

Linhao Wang, Qichang Zhang, Ye Su, Hao Wang

机构 * Shandong Normal University(山东师范大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有三维点云生成方法的缺陷,提出分层流匹配(HFM),将流匹配扩展为双级结构,在ShapeNet等基准上实现了有竞争力的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05450 2026-08-07 cs.CV 新提交 57%

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation

MOSAIK:用于高效生成的图像令牌多补丁内容感知空间分配

Mohammadreza Hami, Mohammadreza Samadi, Chao Gao, Negar Hassanpour

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MOSAIK是一种损伤引导的异构补丁布局框架,适配PixelDiT骨干,通过区域分配补丁大小,在大幅降低计算量和令牌数的同时,保持与全计算PixelDiT相当的生成性能,且在高计算约束下优于其他效率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05728 2026-08-07 cs.CV cs.LG physics.optics 新提交 57%

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID:基于外观印迹生成激活的参考式事件到视频重建方法

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) DISCOVER Robotics(DISCOVER机器人公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Engram-E2VID框架,通过外观印迹生成激活实现参考式事件到视频重建,在三个基准测试中PSNR最高提升3.29 dB、LPIPS最高降低0.08,性能随重建间隔增加下降更慢。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05471 2026-08-07 eess.IV cs.CV cs.LG physics.med-ph 新提交 57%

A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets

基于EDM2的高分辨率合成胎儿超声成像基础生成模型,源自开放数据集

Harvey Mannering, Yilin Zhang, Ziao Liu, Zhiwu Huang, Jacqueline Matthew, Miguel Xochicale

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对胎儿超声AI数据稀缺问题,提出基于EDM2的合成框架,生成512×512图像,在分类任务中准确率达93.36%,优于真实数据训练结果,为胎儿超声AI提供开放资源。

Comments Short paper for the 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05889 2026-08-07 cs.DL cs.AI cs.CL cs.CY 新提交 50%

The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025

长破折号嵌入国会:大语言模型时代初期(2021-2025)美国国会新闻稿中长破折号频率的全人口水平上升

Przemysław Czuma

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究分析2021-2025年美国国会新闻稿,发现无空格长破折号频率在2025年翻倍,证实LLM辅助写作的扩散,长破折号可作为全人口水平的相关标记。

Comments Preregistered study (OSF: 10.17605/OSF.IO/U5NEY); deviations from the registered plan, including a formal validation-gate breach, are disclosed in Section 4.6. Companion study: arXiv:2606.29540. 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05448 2026-08-07 cs.CL 新提交 50%

DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

DBLAST:面向随机投机解码的依赖块草稿生成

Amirmohammad Karimi, Chao Gao, Negar Hassanpour

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对块扩散草稿模型在高熵投机解码下可接受草稿长度下降的问题,提出DBLast依赖块草稿模型,在多基准测试中相比独立块采样稳定提升可接受长度。

详情

展开后加载摘要…

URL PDF HTML 收藏