arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2512.11121 2026-06-24 cs.CV eess.IV 版本更新 57%

Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior

生成式流形蒸馏:将恢复轨迹与自然图像先验对齐

Yuyang Hu, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio

机构 * Google(谷歌) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出生成式流形蒸馏(GMD),通过几何流形对齐实现无配对域自适应,利用冻结文本到图像基础模型的流匹配动力学将离流形恢复投影到自然图像流形,并引入质量门控滤波器和源锚定轨迹正则化,无需架构修改或推理延迟即可提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22089 2026-06-23 cs.CV 新提交 57%

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision

BAC-JEPA: 通过合成乳腺X线摄影引导的标签高效乳腺动脉钙化分割

Scott Chase Waggener, Lakshman Tamil

机构 * Department of Computer Engineering University of Texas at Dallas Richardson, TX(计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出BAC-JEPA框架,利用合成动脉钙化图像和自监督视觉Transformer,实现无需像素级人工标注的乳腺动脉钙化分割,在BacSeg数据集上达到AUROC 0.8719。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交 57%

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21705 2026-06-23 cs.CV 新提交 57%

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

结构评估用于理解和指导离散令牌空间中的数据集蒸馏

Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev, Yu Hu, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia(不列颠哥伦比亚大学) The Ohio State University(俄亥俄州立大学) Czech Technical University in Prague(布拉格捷克理工大学) TerraSense Analytics(TerraSense Analytics公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文通过离散视觉分词器分析令牌组成结构,提出结构评分衡量令牌组合充分性,发现平衡的令牌组成提升蒸馏数据集性能,并指导扩散模型的数据集蒸馏。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18471 2026-06-23 cs.CV 版本更新 57%

Jacobian-Aware Posterior Sampling for Inverse Problems

Jacobian-Aware 后验采样用于逆问题

Liav Hen, Tom Tirer, Raja Giryes, Shady Abu-Hussein

机构 * Tel Aviv University, Israel(特拉维夫大学,以色列) Bar-Ilan University, Israel(巴伊兰大学,以色列) University of Cambridge, UK(剑桥大学,英国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出 Jacobian-Aware 后验采样器 (JAPS),通过结合扩散去噪器的 Jacobian 先验与近端解,在无额外计算成本下提升逆问题重建质量。

Comments Accepted by TMLR 2026; Code at https://github.com/liavhen/JAPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19970 2026-06-19 cs.CV 新提交 57%

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow: 跨潜在空间与像素空间的单步生成

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Tencent(腾讯) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出CrossFlow,一种跨空间流模型,将噪声潜在输入直接映射到像素图像,通过无速度单步目标实现潜在到像素的生成,并替代潜在扩散中的解码器,在ImageNet-1k上达到1.62 FID。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06952 2026-06-19 cs.CV 版本更新 57%

LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer

LaTtE-Flow: 基于层间时间步专家流的Transformer

Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland(马里兰大学) Nvidia(英伟达) Salesforce AI Research(Salesforce AI研究) Intuit AI Research(Intuit AI研究)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出LaTtE-Flow,一种基于预训练视觉语言模型的高效统一架构,通过层间时间步专家流和条件残差注意力机制,实现图像理解与生成,生成速度提升约6倍。

Comments Unified multimodal model, Flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交 57%

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11363 2026-06-11 cs.CV 新提交 57%

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization

NSVQ: 通过稳定向量量化中的编码器漂移缓解码本崩溃

Hao Lu, Yongxin Guo, Onur Koyun, Zhengjie Zhu, Abbas Alili, Metin N. Gurcan

机构 * Wake Forest University School of Medicine(维克森林大学医学院) Advocate Health(倡导健康)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出NSVQ训练策略,通过非平稳嵌入损失、码本替换和分阶段编码器冻结,缓解大码本VQ中的码本崩溃,在ImageNet-1k上提升重建质量并保持100%码本利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08302 2026-06-09 cs.CV 新提交 57%

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

HACK++:面向高效视觉自回归建模的更有效的头部感知键值压缩

Ziran Qin, Yuchen Jiang, Mingbao Lin, Youru Lv, Hang Guo, Wen Fei, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten(乐天) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 针对VAR模型跨尺度KV缓存导致的高计算和内存开销,提出无训练头部感知压缩框架HACK++,通过离线分类头部类型和自适应预算分配,在极低缓存预算下保持近无损生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06078 2026-06-05 cs.CV 57%

Knowledge Distillation for Visual Autoregressive Models

视觉自回归模型的知识蒸馏

Elia Peruzzo, Aritra Bhowmik, Guillaume Sautiere, Yuki M Asano, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对视觉自回归模型计算开销大的问题,提出VarKD蒸馏框架,通过选择性教师监督和减少令牌级歧义,在ImageNet上多个AR骨干网络中优于现有蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05254 2026-06-05 cs.LG cs.CV cs.RO 57%

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM:面向世界动作模型的模态感知蒸馏

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) EmbodyX Inc.(EmbodyX公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05071 2026-06-04 cs.CV 57%

InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space

InstantRetouch:基于双边空间的高效高保真指令引导图像润色

Jiarui Wu, Yujin Wang, Ruikang Li, Fan Zhang, Mingde Yao, Tianfan Xue

机构 * Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于双边空间操作的图像润色方法,通过预测低分辨率双边网格并利用学习引导图切片,结合扩散模型蒸馏和提示对齐损失,实现高效、高保真且遵循指令的图像润色。

Comments Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04461 2026-06-04 cs.CV 57%

ChannelTok: Efficient Flexible-Length Vision Tokenization

ChannelTok: 高效灵活长度视觉分词

Sukriti Paul, Arpit Bansal, Tom Goldstein

机构 * University of Maryland, College Park(马里兰大学College Park分校)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出一种基于通道的轻量级灵活长度分词器,通过随机尾部丢弃训练实现语义重要性排序,在保持高质量的同时大幅提升解码速度和模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.06176 2026-06-04 cs.CV cs.NA math.NA stat.ML 57%

An extended Perona-Malik model based on probabilistic models

基于概率模型扩展的Perona-Malik模型

Lars M. Mescheder, Dirk A. Lorenz

机构 * Institute for Analysis and Algebra, TU Braunschweig(布拉unsch维格技术大学分析与代数研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文基于高斯尺度混合模型扩展了Perona-Malik模型,通过EM算法推导出滞后扩散算法,并改进其以更好地捕捉恢复中的不确定性,同时提出计算可行的放松方法,实验显示改进算法在恢复纹理区域和模糊边缘方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02068 2026-06-02 cs.CV cs.AI 57%

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

基于可微多平面图像的快速轻量级新视角合成

Kaidi Zhang, Guanxu Zhu

机构 * Universiti Malaya(马来大学) Wuhan University(武汉大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方法在速度、模型大小和稀疏视角下的不足,提出基于可微多平面图像(MPI)的快速轻量级新视角合成方法,利用点图进行几何初始化并引入一步扩散处理空洞和伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00664 2026-06-02 cs.RO cs.CV 57%

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

SKIP: 用于高效具身世界模型的稀疏关键帧插值范式

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) NJU(南京大学) GigaAI THU(清华大学) FiveAges

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出稀疏关键帧插值范式(SKIP),通过识别任务相关关键帧并仅生成这些帧,再基于机器人动作插值缺失帧,实现高效视频生成,在LIBERO上速度提升4.16倍,FVD降低89%,且生成视频作为训练数据时策略性能下降极小。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00310 2026-06-02 cs.CV 57%

Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation

何处精炼,何时停止:通过潜在差异重新思考高效视觉自回归生成中的冗余

Changwang Mei, Peisong Wang, Zekun Li, Changsheng Li, Shuang Qiu, Qinghao Hu, Gang Li, Yifan Zhang, Zhihui Wei, Jian Cheng

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出基于潜在差异(Latent Discrepancy)的无训练剪枝框架LD-Pruning,通过解码无关区域选择和自适应无条件分支跳过,在视觉自回归模型中实现高达2.35倍加速并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25144 2026-06-02 cs.CV 57%

SpikeReg: Energy-Efficient 3D Deformable Medical Image Registration with Spiking Neural Networks

SpikeReg: 基于脉冲神经网络的高能效3D可变形医学图像配准

Ali Mikaeili Barzili, Behzad Moshiri, Hamid Azadegan, Mohammad-Reza A. Dehaqani

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院) Max Planck Institute for Brain Research(马克斯·普朗克脑科学研究所) School of Computer Engineering, Iran University of Science and Technology (IUST)(伊朗科学技术大学计算机工程学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出SpikeReg,一种脉冲U-Net,通过层间权重迁移和激活百分位阈值校准从模拟ANN教师初始化,结合局部互相关、扩散正则化和脉冲率稀疏性的代理梯度微调,在OASIS Learn2Reg验证集上达到Dice 0.7474,与ANN教师无显著差异,同时实现12.8%平均脉冲率和55.5倍算术能量降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30991 2026-06-01 cs.LG cs.CV 57%

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment

推理时奖励对齐中的并行回火初始采样

Myeongjun Oh, Gwangho Kim, Sungyoon Lee

机构 * Department of Artificial Intelligence(人工智能系) Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对推理时奖励对齐中标准SMC方法因初始采样陷入局部模式的问题,提出基于并行回火的PATHS方法,通过耦合多条回火链实现高效探索,提升对齐质量。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28691 2026-05-28 cs.CV 57%

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

OSP-Next: 结合稀疏序列并行、HiF8量化和强化学习的高效高质量视频生成

Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, Li Yuan

机构 * Peking University(北京大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出OSP-Next文本到视频生成模型,通过混合全稀疏注意力架构、稀疏序列并行(SSP)、HiF8量化和混合GRPO后训练,在保持高质量的同时显著提升效率,在NVIDIA H200和Ascend 950PR上实现1.5倍以上加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11755 2026-05-28 cs.LG cs.CV stat.ML 57%

One-Step Generative Modeling via Wasserstein Gradient Flows

通过Wasserstein梯度流的一步生成建模

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出W-Flow框架,通过Wasserstein梯度流将参考分布到目标分布的演化压缩为一步生成,结合Sinkhorn散度实现高效最优传输,在ImageNet 256×256上达到1.29 FID且采样速度提升约100倍。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16483 2026-05-28 cs.CV 57%

FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models

FasterVAR:视觉自回归模型的即插即用加速

Senmao Li, Kai Wang, Salman Khan, Fahad Shahbaz Khan, Jian Yang, Yaxing Wang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院、VCIP、PCA实验室) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机系,中国) City University of Hong Kong, HK SAR, China(香港城市大学,香港特别行政区,中国) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Linkoping University, Sweden(林地平大学,瑞典) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院、PCA实验室) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对VAR模型在大尺度步骤计算复杂度高的问题,提出一种基于阶段感知的即插即用加速框架FasterVAR,通过保留早期关键步骤并剪枝或近似后期细节步骤,实现最高3.4倍加速且几乎无性能损失。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV 57%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26744 2026-05-27 cs.CV 57%

Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy

基于高效人体球代理的自交感知3D人体运动生成

Pascal Herrmann, Maarten Bieshaar, Dennis Mack, Robert Herzog, Juergen Gall

机构 * Bosch Research(博世研究院) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于人体球代理的自交损失函数,用于训练人体运动生成模型,可减少高达49%的自交现象并改善评估指标。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19741 2026-05-27 cs.CV 57%

Efficient Transferable Optimal Transport via Min-Sliced Transport Plans

通过最小切片传输计划的高效可迁移最优传输

Xinran Liu, Elaheh Akbari, Rocio Diaz Martin, Navid NaderiAlizadeh, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比大学计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Electrical & Computer Engineering, Vanderbilt University(范德比大学电气与计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出最小切片传输计划(min-STP)框架,研究优化切片器在不同分布对间的可迁移性,并引入小批量公式以提高可扩展性,在点云对齐和流生成建模中实现一次性匹配和摊销训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV 57%

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24843 2026-05-26 cs.CV cs.AI 57%

Adversarial Error Correction for Visual Autoregressive Generation

视觉自回归生成的对抗性纠错

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 提出AID-VAR框架,通过对抗性注入诊断机制纠正视觉自回归模型中的级联误差,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV 57%

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏