arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1299 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2608.01677 2026-08-14 cs.CV cs.LG 版本更新 79%

Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis

用于增强心肌应变分析的运动空间生成布朗桥扩散模型

Rishov Paul, Frederick H. Epstein, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出运动空间生成布朗桥扩散模型,以标准CMR图像为条件学习运动映射,在多中心CMR数据集上验证其可提升应变分析准确性,为开发临床可用的低成本心脏评估AI工具提供新范式。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新 79%

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 79%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 79%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新 79%

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13058 2026-08-12 cs.CV cs.AI 版本更新 79%

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

SynBoost:用于扩散模型快速采样的协同框架

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao

机构 * USTC(中国科学技术大学) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27974 2026-08-11 cs.CV 版本更新 79%

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting

现在你拥有我的健康注意力:用于脑部MRI修复的U-DiT

Danilo Danese, Angela Lombardi, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学)

专题命中 扩散模型 :inpainting(title,abstract);分类 cs.CV

AI总结 针对脑部MRI修复任务,提出U-DiT模型,结合对侧对称先验与注意力约束,在BraTS-2026验证集219例病例上取得健康区域SSIM 0.864等优异指标,提升了解剖学合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14513 2026-08-11 cs.CV cs.AI 版本更新 79%

HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion

HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速

Xuzhe Zheng, Yuexiao Ma, Jing Xu, Xiawu Zheng, Rongrong Ji, Fei Chao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25003 2026-08-11 cs.LG cs.CV 版本更新 79%

Score-based Membership Inference on Diffusion Models

基于扩散模型的分数化成员推断

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SimA攻击方法,通过预测噪声向量实现高效成员推断,优于现有多查询方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新 79%

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18093 2026-08-11 cs.CV 版本更新 79%

Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers

预测以跳过:线性多步特征预测用于高效的扩散变换器

Hanshuai Cui, Zhiqing Tang, Qianli Ma, Zhi Yao, Weijia Jia, Wei Zhao

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence(人工智能研究所) Future Networks, Beijing Normal University, Zhuhai 519087, China(未来网络,北京师范大学,珠海)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PrediT通过线性多步特征预测方法,在不训练的情况下加速扩散变换器,实现显著的延迟降低同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00506 2026-08-11 cs.CV 版本更新 79%

Affordance-Guided Diffusion Prior for 3D Hand Reconstruction

用于3D手部重建的可负担性引导扩散先验

Naru Suzuki, Takehiko Ohkawa, Tatsuro Banno, Jihyun Lee, Ryosuke Furuta, Yoichi Sato

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新 79%

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16048 2026-08-10 cs.CV 版本更新 79%

CloudDiffusion: Diffusion-Based Scene Completion in the Point Cloud Domain

PointDiffusion: 点云领域的基于扩散的场景补全

Chidera Agbasiere, Mikhail Sannikov, Faith Ogunwoye, Erik Shaikhiev, Alex Kozinov, Ilya Mikhalchuk, Iana Zhura, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院智能空间机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出多令牌高斯VAE和锚点ICP地面真值精化,实现单步扩散场景补全,在SemanticKITTI上平方倒角距离降低16倍,推理延迟降低25-143倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 79%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07419 2026-08-10 cs.CV 版本更新 79%

DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation

DisPOSE: 投影多随机扩散用于自监督多视图3D人体姿态估计

Tony Danjun Wang, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DisPOSE框架,将多视图人员分配问题建模为多随机张量空间上的生成扩散过程,通过可微Sinkhorn投影和超图卷积解码器实现自监督3D人体姿态估计,在标准数据集和手术室遮挡场景中表现优异。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10340 2026-08-10 cs.CV 版本更新 79%

Learning Ordinal Degradation Representations with Textual Priors for Diffusion-Based Blind Image Super-Resolution

通过插件分层退化表示实现稳定扩散的零样本适应

Yi-Cheng Liao, Shyang-En Weng, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) MediaTek Inc.(联发科公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HD-CLIP通过分层退化表示提升扩散模型在现实世界超分辨率中的零样本适应能力,增强细节保真度和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 79%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新 79%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 79%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02151 2026-08-05 cs.GR 版本更新 79%

Fourier-Latent Diffusion for Constrained Generation of Triply Periodic Minimal Surfaces

用于三重周期极小曲面约束生成的傅里叶潜扩散模型

Shu Yan, Bohan Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 该研究提出基于扩散的生成框架,构建含超1.8万种TPMS的数据集,训练Transformer扩散模型实现TPMS的可控生成,满足几何与弹性能约束,为TPMS逆设计提供实用工具。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新 79%

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新 79%

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 79%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新 79%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04551 2026-08-05 cs.CV 版本更新 79%

Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis

双向衣物迁移:用于穿衣和脱衣合成的统一扩散框架

Angang Zhang, Fang Deng, Hao Chen, Zhongjian Chen, Junyan Li

专题命中 扩散模型 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对虚拟试穿与脱衣任务孤立研究的不足,提出双向衣物迁移模型,构建统一扩散框架,通过双向特征解纠缠和分阶段训练,在两个公开数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23179 2026-08-04 cs.CV 版本更新 79%

Gimbal360: Canonicalizing Planar Diffusion for Spherical Panorama Completion

Gimbal360: 可微自动水平校准用于标准化360度全景图像补全

Yuqin Lu, Haofeng Liu, Yang Zhou, Yihua Dai, Guiqing Li, Shengfeng He, Jun Liang

机构 * orange-3dv-team(orange-3dv团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Gimbal360通过引入标准化视角空间和可微自动水平校准模块,解决360度全景图像补全中的几何与拓扑不匹配问题,实现高精度补全。

Comments Project page: https://orange-3dv-team.github.io/Gimbal360

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06741 2026-08-04 cs.LG cs.AI cs.CV 版本更新 79%

Heterogeneous Decentralized Diffusion Models

异构去中心化扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * bagel.com(Bagel公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种异构去中心化训练框架,通过支持不同专家使用不同目标(DDPM和Flow Matching)并统一推理、预训练检查点转换以及高效架构,大幅降低计算和数据需求,使单GPU(24-48GB VRAM)即可参与训练。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07163 2026-08-04 cs.RO cs.CV 版本更新 79%

Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models

Mamba Policy:基于混合选择性状态模型的高效3D扩散策略

Jiahang Cao, Qiang Zhang, Jingkai Sun, Jiaxu Wang, Hao Cheng, Yulin Li, Jun Ma, Kun Wu, Zhiyuan Xu, Yecheng Shao, Wen Zhao, Gang Han, Yijie Guo, Renjing Xu

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。

Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/

详情

展开后加载摘要…

URL PDF HTML 收藏