arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2193 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2606.15457 2026-06-16 cs.CV cs.LG 新提交 79%

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis

Lesion-DDPM:用于MS MRI合成的病灶增强3D扩散模型

Weidong Zhang, Yongchan Jung, Shafayat Mowla Anik, Furen Xiao, Vasudevan Janarthanan, Enkhzaya Chuluunbaatar, Byeong Kil Lee, Jeeho Ryoo

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) University of Texas at Dallas(德克萨斯大学达拉斯分校) National Taiwan University Hospital(国立台湾大学医院) National University of Mongolia(蒙古国立大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lesion-DDPM,一种3D条件扩散框架,通过多级解剖掩膜注入和病灶加权重建损失,实现病灶感知的FLAIR合成,在MS病灶分割下游任务中显著提升Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15389 2026-06-16 cs.CV 新提交 79%

Timestep Rescheduling in Diffusion Inversion

扩散反演中的时间步重调度

Shangquan Sun, Ting Gong, Zhirui Liu, Jiamin Wu, Runkai Zhao, Mianxin Liu, Wenqi Ren, Xiaochun Cao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散反演中时间步选择影响反演精度的问题,提出一种基于全局重缩放和局部动态规划的非均匀时间步调度器,有效降低反演误差,提升图像重建与编辑性能。

Comments Accepted by ICML 2026. 23 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15323 2026-06-16 cs.CV 新提交 79%

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation

PPDM: 像素拼图扩散模型用于速度和内存高效的体积医学图像翻译

Tianqi Chen, Jun Hou, Yinchi Zhou, James S. Duncan, Chi Liu, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学影像系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出像素拼图扩散模型(PPDM),通过可逆像素拼图操作和直接桥接扩散公式,在降低内存和加速推理的同时保持全局一致性,用于3D医学图像翻译。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15304 2026-06-16 cs.CV 新提交 79%

HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion

HemExp: 临床引导的潜在扩散模型用于血肿扩展示建模

Orhun Utku Aydin, Satoru Tanioka, Tzu I Chuang, Alexander Koch, Dimitrios Rallios, Marie Gultom, Begum Tahhan, Fujimaro Ishida, Dietmar Frey, Adam Hilbert

机构 * CLAIM – Charité Lab for AI in Medicine, Charité – Universitätsmedizin Berlin, corporate member of Freie Universität Berlin and Humboldt-Universität zu Berlin(柏林夏里特医学院人工智能医学实验室(CLAIM),柏林夏里特医学院,柏林自由大学和柏林洪堡大学成员) Department of Neurosurgery, Mie Chuo Medical Center(三重中央医疗中心神经外科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出临床引导的潜在扩散模型HemExp,通过生成患者特异性随访CT图像及血肿分割,实现血肿扩展示的空间概率预测,支持临床变量扰动下的不确定性建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15048 2026-06-16 cs.LG cs.CV 新提交 79%

Temporal Difference Learning for Diffusion Models

扩散模型的时间差分学习

Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu, Junfeng Wen

机构 * Department of Engineering Science, University of Oxford, Oxford, United Kingdom(牛津大学工程科学系) School of Computer Science, Carleton University, Ottawa, Canada(卡尔顿大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出时间差分(TD)目标函数,通过将扩散过程视为马尔可夫奖励过程并利用强化学习中的策略评估,强制去噪轨迹上的跨时间一致性,显著提升少步采样下的生成质量。

Comments 15 pages, 4 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14879 2026-06-16 cs.RO cs.CV cs.LG 新提交 79%

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

VANDERER: 基于未来感知与视觉好奇心引导扩散策略的无地图探索

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学坦登工程学院电气与计算机工程系控制/机器人研究实验室(CRRL)) New York University Abu Dhabi (NYUAD) Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心(CAIR))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VANDERER框架,利用视觉好奇心模块引导预训练扩散策略,仅依赖单目图像实现高效无地图探索,在多种模拟环境中平均探索面积比NoMaD多13.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交 79%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13964 2026-06-15 cs.CV 新提交 79%

CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

CaricHarmony:身份保持的漫画合成的对比扩散路径

Dongyu Wang, Dar-Yen Chen, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CaricHarmony,一种无需训练的方法,通过并行无污染扩散路径解决身份与形状条件信号污染问题,实现平衡的漫画合成,在保持身份一致性的同时达到最优形状保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13496 2026-06-12 cs.CV 新提交 79%

Budget-Constrained Step-Level Diffusion Caching

预算约束的步骤级扩散缓存

Mingkun Lei, Tong Zhao, Liangyu Yuan, Chi Zhang

机构 * Westlake-AGI-Lab(西湖大学AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BudCache方法,通过离线搜索(模拟退火+爬山)在固定计算预算下优化缓存策略,并引入缓存感知调度对齐,以提升扩散模型生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13240 2026-06-12 cs.LG cs.AI cs.CV stat.ME stat.ML 新提交 79%

Towards More General Control of Diffusion Models Using Jeffrey Guidance

使用 Jeffrey 引导实现扩散模型的更通用控制

Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

机构 * Inria, CNRS, I3S, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息与系统科学实验室、马赛·蔚蓝海岸大学) Technical University of Denmark(丹麦技术大学) Inria, CNRS, LJAD, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、雅克-路易·利翁实验室、马赛·蔚蓝海岸大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出 Jeffrey 引导框架,通过 Jeffrey 条件规则更新边缘分布,扩展扩散模型控制到标准引导无法表达的应用,在 CIFAR-10 和 FFHQ 上显著降低 FID,并在 CelebA-HQ 上实现公平性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12263 2026-06-12 cs.CV 新提交 79%

VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

VOID: 击败潜在扩散模型中的未授权模仿

Chunlin Qiu, Ang Li, Tianxiao Huang, Ruilin Gan, Yunjie Ge, Shenyi Zhang, Huayi Duan, Lingchen Zhao, Chao Shen, Qian Wang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Institute for Math&AI, Wuhan University(武汉大学数学与人工智能研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Cyber Science and Engineering, Xi’an Jiaotong University(西安交通大学网络空间安全学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型被用于未授权模仿的问题,提出VOID防御框架,通过操纵模型内在随机性,放大潜在编码误差并抵消目标引导信号,实现语义破坏,阻止未授权模仿,同时将扰动限制在人眼不可感知区域。

Comments Extended full version with more comprehensive experimental results. To appear in the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 79%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09718 2026-06-09 cs.LG cs.CV 新提交 79%

Evaluating the Representation Space of Diffusion Models via Self-Supervised Principles

通过自监督原则评估扩散模型的表示空间

Xiao Li, Yixuan Jia, Zekai Zhang, Xiang Li, Lianghe Shi, Jinxin Zhou, Zhihui Zhu, Liyue Shen, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 受自监督学习启发,提出基于Fisher信息的度量ICR,分解特征为不变和残差成分,用于联合评估扩散模型的表示与生成能力,发现中间噪声水平下不变性最强且分类性能最佳,ICR可敏感检测训练中的记忆化。

Comments First two authors contributed equally. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09608 2026-06-09 cs.CV 新提交 79%

TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution

TUDSR: 用于更高超分辨率的两次上采样扩散

Zhiqiang Wu, Yitong Dong, Xian Wei

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TUDSR框架,通过两阶段训练(R分辨率和NR分辨率)结合循环分块策略,在SD2.1基础上实现1024²和2048²高分辨率图像超分辨率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09378 2026-06-09 cs.CV 新提交 79%

Echo-DM: Ultrasound Marker Removal via Conditional Latent Diffusion and Region-Aware Fusion

Echo-DM: 通过条件潜在扩散和区域感知融合去除超声标记

Zhiwei Wang, Tao Huang, Wentao Jiang, Muyi Li, Jianxin Liu, Jian Chen, Jie Zou, Yong Luo, Bo Du, Jing Zhang

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) The Central Hospital of Wuhan, China(武汉市中心医院) School of Computer Science, Hubei University of Technology, China(湖北工业大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Echo-DM框架,结合条件潜在扩散和区域感知融合,在无掩码条件下有效去除超声图像中的人工标记,同时保持解剖结构保真度。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09250 2026-06-09 cs.CV 新提交 79%

LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution

LiteVSR: 冻结扩散变换器的轻量级自适应用于视频超分辨率

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LiteVSR,利用流匹配原理,通过轻量级状态感知适配器在冻结扩散变换器上实现视频超分辨率,仅需11.25%可训练参数和12 GPU小时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08957 2026-06-09 cs.CV 新提交 79%

Rethinking 3D Shape Generation: Diffusion over Superquadrics

重新思考3D形状生成:超二次曲面上的扩散

Zhiyang Liu, Wanze Li, Yuwei Wu, Chengran Yuan, Jiawei Sun, Rui Zheng, Marcelo H Ang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出将扩散模型从高基数几何表示转移到紧凑的超二次曲面参数上,以降低计算和内存成本,并支持无分辨率点云解码、部件级编辑和约束设计,实现高效生成。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08788 2026-06-09 cs.CV 新提交 79%

MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training

MaskAlign: 面向高效扩散训练的令牌子集表示对齐

Lianyu Pang, Tianlin Pan, Cheng Da, Changqian Yu, Huan Yang, Kun Gai, Song Guo, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型与预训练视觉模型表示对齐中令牌级信息不匹配问题,提出MaskAlign方法,通过随机采样令牌子集进行对齐,并引入预掩码令牌混合块减少信息损失,提升训练效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08751 2026-06-09 cs.CV 新提交 79%

Less Is More: Training-Free Acceleration Framework of 3D Diffusion Models for Low-Count PET Denoising via Global-Local Trajectory Reduction

少即是多:通过全局-局部轨迹缩减实现低计数PET去噪的3D扩散模型免训练加速框架

Yuhan Liu, Scott M. Leonard, Marlee Crews, Muhannad Fadhel, Jinkui Hao, Tianqi Chen, Ryan J. Avery, Bo Zhou

机构 * Northwestern University(西北大学) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种免训练的全局-局部跳跃策略,通过噪声一致变换初始化中间步骤和重用U-Net特征,在加速3D扩散模型去噪的同时提升重建质量。

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08652 2026-06-09 astro-ph.SR cs.AI cs.CV 新提交 79%

Reconstructing Synthetic SDO/AIA 193 A EUV Images from He I 10830 A Observations with Diffusion Model Translator

利用扩散模型翻译器从He I 10830 Å观测重建合成SDO/AIA 193 Å EUV图像

Marco Marena, Qin Li, Haimin Wang, Haodi Jiang, Prajwal Shah, Bo Shen

机构 * Department of Mechanical and Industrial Engineering, New Jersey Institute of Technology(机械与工业工程系,新泽西理工学院) Department of Physics, New Jersey Institute of Technology(物理系,新泽西理工学院) Department of Computer Science, Sam Houston State University(计算机科学系,萨姆霍斯顿州立大学) Department of Computer Science, New Jersey Institute of Technology(计算机科学系,新泽西理工学院) Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的日冕洞感知翻译模型(CH-aware DMT),从He I图像重建AIA 193 Å EUV图像,在测试集上保持全盘EUV形态(CC=0.92)和日冕洞结构(CC=0.84),并通过历史数据验证其物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08309 2026-06-09 cs.LG cs.CV 新提交 79%

Where the Score Lives: A Wavelet View of Diffusion

分数函数所在之处:扩散的小波视角

Emma Finn, Binxu Wang, T. Anderson Keller, Demba E. Ba

机构 * The Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于二维正交小波基的分数函数参数化,通过数据分布矩分析揭示不同架构的归纳偏差,解释扩散模型中分数网络与数据分布的相互作用。

Comments 20 pages, 12 figures, AISTATS 2026

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026, Tangier, Morocco. PMLR: Volume 300

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08150 2026-06-09 cs.CV 新提交 79%

Property-Informed Diffusion-Based Text-to-Microstructure Generation

基于属性信息的扩散模型文本到微结构生成

Bingxuan Dai, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种属性信息驱动的扩散网络,从文本描述直接生成3D微结构,通过对比文本-结构对齐和测试时奖励引导对齐确保生成结构的语义和物理可行性。

Comments Published in CVPR2026, Code is at: https://github.com/hongsong-wang/PropDiff-TMG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07895 2026-06-09 cs.CV cs.RO 新提交 79%

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA: 时序块扩散视觉语言动作模型

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TBD-VLA框架,通过时序块扩散机制实现离散令牌VLA模型的并行动作生成,兼顾时序连贯性与推理速度,在仿真和真实任务中优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06887 2026-06-08 cs.CV 新提交 79%

ARAPDiffusion: ARAP Regularization for Diffusion-Based Deformable Shape Space Learning

ARAPDiffusion: 基于ARAP正则化的扩散变形形状空间学习

Haibo Liu, Jinghan Ke, Haitao Yang, Xiangru Huang, Georgios Pavlakos, Qixing Huang

机构 * University of Texas at Austin(德克萨斯大学) Westlake University(西拉丘学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ARAPDiffusion,一种潜在扩散模型,通过注入ARAP变形模型作为正则化损失,学习变形形状集合的连续形状空间,减少对大量3D训练数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交 79%

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交 79%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01029 2026-08-04 cs.RO 新提交 79%

Diffusion-Based Body Schema Learning Enabling Abnormal-State Adaptation in Musculoskeletal Robots

基于扩散模型的身体模式学习:实现肌肉骨骼机器人的异常状态适应

Kento Kawaharazuka, Shuhei Ikemoto

机构 * The University of Tokyo(东京大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对肌肉骨骼机器人传统身体模式学习方法难以处理异常状态的问题,提出基于扩散模型的身体模式学习框架,通过仿真实验验证了其异常状态下自适应估计肌肉参数的有效性。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L), website - https://haraduka.github.io/muscle-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29398 2026-08-03 cs.LG 新提交 79%

OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference

OnlineCache:用于高效扩散推理的带误差校正的动态缓存策略学习

Zhikang Xie, Xichen Ye, Yifan Wu, Haoshen Yu, Li chenan, Peizhu Gong, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对扩散模型推理延迟高的问题,提出动态缓存框架OnlineCache,结合策略梯度与可学习校正器,实现样本与时间步的自适应资源分配,在FLUX.1-dev等模型上实现加速且优于现有基线。

Comments Dynamic timestep-level cache method for diffusion acceleration via policy gradient

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12365 2026-06-11 cs.RO cs.AI 新提交 79%

Ambient Diffusion Policy: Imitation Learning from Suboptimal Data in Robotics

环境扩散策略:从次优数据中进行机器人模仿学习

Adam Wei, Nicholas Pfaff, Thomas Cohn, Arif Kerem Dayı, Constantinos Daskalakis, Giannis Daras, Russ Tedrake

机构 * MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出环境扩散策略,通过噪声依赖的数据使用从次优数据中提取有用特征,在六项任务上优于现有方法,最高提升33%。

Comments 14 pages (main body), 52 pages total. Project website: https://ambient-diffusion-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14097 2026-08-17 eess.AS cs.SD 新提交 78%

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

使用设备无关扩散模型的房间冲激响应的Ambisonics编码

Eloi Moliner, Christoph Hold, Juan Azcarreta Ortiz, Sebastian Prepelita, Ishwarya Ananthabhotla, Daniel Wong, Sanjeel Parekh, Sanha Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对不规则/稀疏等空间捕获能力有限的麦克风阵列无法用线性方法重建HOA RIR高阶空间细节的问题,提出基于扩散的生成框架,实现设备无关编码,实验显示其性能优于基线,可支撑可扩展声学模拟。

Comments IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏