arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-02 至 2026-06-02 共收录 15 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 15 篇

2606.00658 2026-06-02 cs.CV cs.AI 79%

Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models

Wan2.2双专家视频扩散模型的协同少步蒸馏与低位量化

Jinyang Du, Shenghao Jin, Ziqian Xu, Ruihao Gong, Shiqiao Gu, Yang Yong, Jinyang Guo, Xianglong Liu

机构 * IEEE ICME 2026 GCC Low-Bit-width Large Model Quantization Challenge(GCC 低精度大模型量化挑战)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 针对Wan2.2-T2V-A14B视频扩散模型,提出结合少步分布匹配蒸馏与低位量化的部署压缩流程,通过双专家去噪分支校准、敏感层保护及HiF4低位表示,在保持质量的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15141 2026-06-02 cs.CV 79%

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏

Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan, Xinyuan Li, Xiao Yang, Chongxuan Li, Jun Zhu

机构 * Tsinghua University(清华大学) ShengShu(盛数) Renmin University of China(中国人民大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22965 2026-06-02 cs.RO 78%

Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation

自模仿扩散策略用于高效鲁棒的视觉导航

Runhua Zhang, Junyi Hou, Changxu Cheng, Qiyi Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi Technology Co., Ltd.(Uni-Ubi技术有限公司) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 提出自模仿扩散策略(SIDP),通过奖励引导的自模仿机制和课程学习范式,减少对大量采样和后过滤的依赖,实现高效鲁棒的视觉导航。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26089 2026-06-02 cs.CV cs.AI 70%

Channel-wise Vector Quantization

通道级向量量化

Wei Song, Tianhang Wang, Yitong Chen, Tong Zhang, Zuxuan Wu, Min Li, Jiaqi Wang, Kaicheng Yu

机构 * Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学) Fudan University(复旦大学) JD.COM(京东公司) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出通道级向量量化(CVQ)代替补丁级量化,并基于此设计通道级自回归(CAR)模型,通过逐通道预测实现渐进式细节生成,在图像重建和文本到图像生成中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04646 2026-06-02 cs.LG cs.AI 67%

Efficient Weighted Sampling via Score-based Generative Models

基于分数生成模型的高效加权采样

Heasung Kim, Taekyun Lee, Hyeji Kim, Gustavo de Veciana

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 提出一种无需训练的加权采样框架,通过轻量级引导近似和不确定性感知调度器,在预训练分数生成模型上实现高效、稳定的采样,并在大规模设置中取得1.2至4.7倍加速。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01910 2026-06-02 cs.GR cs.CV 62%

Single-Line Drawing Generation via Semantics-Driven Optimization

基于语义驱动的单线图生成

Tanguy Magne, Alexandre Binninger, Ruben Wiersma, Olga Sorkine-Hornung

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出一种基于语义驱动的方法,通过文本提示或输入图像自动生成矢量格式的单线图,利用分数蒸馏采样优化均匀有理B样条曲线参数,并引入额外损失项控制艺术风格,生成结果优于现有方法且支持下游制造。

Comments 18 pages, published in Computer Graphics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02068 2026-06-02 cs.CV cs.AI 57%

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

基于可微多平面图像的快速轻量级新视角合成

Kaidi Zhang, Guanxu Zhu

机构 * Universiti Malaya(马来大学) Wuhan University(武汉大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方法在速度、模型大小和稀疏视角下的不足,提出基于可微多平面图像(MPI)的快速轻量级新视角合成方法,利用点图进行几何初始化并引入一步扩散处理空洞和伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00664 2026-06-02 cs.RO cs.CV 57%

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

SKIP: 用于高效具身世界模型的稀疏关键帧插值范式

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) NJU(南京大学) GigaAI THU(清华大学) FiveAges

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出稀疏关键帧插值范式(SKIP),通过识别任务相关关键帧并仅生成这些帧,再基于机器人动作插值缺失帧,实现高效视频生成,在LIBERO上速度提升4.16倍,FVD降低89%,且生成视频作为训练数据时策略性能下降极小。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00310 2026-06-02 cs.CV 57%

Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation

何处精炼,何时停止:通过潜在差异重新思考高效视觉自回归生成中的冗余

Changwang Mei, Peisong Wang, Zekun Li, Changsheng Li, Shuang Qiu, Qinghao Hu, Gang Li, Yifan Zhang, Zhihui Wei, Jian Cheng

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出基于潜在差异(Latent Discrepancy)的无训练剪枝框架LD-Pruning,通过解码无关区域选择和自适应无条件分支跳过,在视觉自回归模型中实现高达2.35倍加速并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25144 2026-06-02 cs.CV 57%

SpikeReg: Energy-Efficient 3D Deformable Medical Image Registration with Spiking Neural Networks

SpikeReg: 基于脉冲神经网络的高能效3D可变形医学图像配准

Ali Mikaeili Barzili, Behzad Moshiri, Hamid Azadegan, Mohammad-Reza A. Dehaqani

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院) Max Planck Institute for Brain Research(马克斯·普朗克脑科学研究所) School of Computer Engineering, Iran University of Science and Technology (IUST)(伊朗科学技术大学计算机工程学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出SpikeReg,一种脉冲U-Net,通过层间权重迁移和激活百分位阈值校准从模拟ANN教师初始化,结合局部互相关、扩散正则化和脉冲率稀疏性的代理梯度微调,在OASIS Learn2Reg验证集上达到Dice 0.7474,与ANN教师无显著差异,同时实现12.8%平均脉冲率和55.5倍算术能量降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02455 2026-06-02 cs.LG cond-mat.mtrl-sci physics.chem-ph physics.comp-ph stat.CO 50%

Speculative Sampling For Faster Molecular Dynamics

用于加速分子动力学的推测采样

Arthur Kosmala, Stephan Günnemann, Meng Gao, Brandon Wood

机构 * FAIR at Meta(Meta FAIR) School of Computation, Information & Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center For Machine Learning(慕尼黑机器学习中心)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出Langevin推测动力学(LSD),一种分布式且模型无关的推测采样方法,通过草稿模型快速提议步长并用目标模型并行验证,实现分子动力学模拟的3-9倍加速而不增加相对误差。

Comments Forty-Third International Conference on Machine Learning (ICML 2026). 32 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02237 2026-06-02 cs.LG 50%

Why Are DMD Students Lazy? Understanding the Copying Behavior in Few-Step Distillation

为什么 DMD 学生懒惰?理解少步蒸馏中的复制行为

Shucheng Li, Iolo Jones, Alexander Tong, Michael M. Bronstein

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) AITHYRA, Research Institute for Biomedical AI(生物医学AI研究 institute)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究分布匹配蒸馏(DMD)中高维学生模型自发复制教师噪声-数据配对的现象,通过几何自由度受限解释其成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01098 2026-06-02 cs.RO cs.AI 50%

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

隐式漂移策略:通过条件专家几何实现单步动作生成

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Morphi Robot(Morphi机器人)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出隐式漂移策略(IDP),一种单步模仿学习框架,通过条件专家几何隐式引入训练时的漂移校正,无需显式向量场估计,在2D、3D及真实世界操作任务中有效保持有效动作流形,性能优于显式漂移方法并达到强单步基线水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27095 2026-06-02 cs.LG 50%

Adversarial Dual On-Policy Distillation from Expressive Teacher

来自表达性教师的对抗性双在线策略蒸馏

Zhenglin Wan, Jingxuan Wu, Xingrui Yu, Chubin Zhang, Mingcong Lei, Bo An, Ivor W. Tsang, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出FA-OPD方法,通过对抗性双在线策略蒸馏,结合流匹配教师和轻量MLP学生,利用奖励和动作双通道信号,在机器人导航、操作和运动任务中优于强基线,且对噪声和有限演示鲁棒。

Comments arXiv admin note: substantial text overlap with arXiv:2510.09222

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09041 2026-06-02 cs.LG cs.AI physics.ao-ph stat.ML 50%

U-Cast: A Surprisingly Simple and Efficient Frontier Probabilistic AI Weather Forecaster

U-Cast:一种惊人简单且高效的边界概率AI天气预报器

Salva Rühling Cachay, Duncan Watson-Parris, Rose Yu

机构 * University of Cambridge(剑桥大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出基于标准U-Net骨架的概率天气预报模型U-Cast,通过确定性预训练和短时概率微调,以不到1/10的计算成本匹配或超越GenCast和IFS ENS的预报技能。

Comments ICML 2026. Our code is available at: https://github.com/Rose-STL-Lab/u-cast

详情

展开后加载摘要…

URL PDF HTML 收藏