arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-17 至 2026-07-17 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 3 篇

2607.14728 2026-07-17 cs.CV cs.RO 新提交 70%

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交 57%

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10821 2026-07-17 cs.RO 版本更新 50%

UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

统一噪声引导用于高效的人类引导VLA适应

Junjie Lu, Xinyao Qin, Yuhua Jiang, Kaixin Wang, Chuheng Zhang, Bin Liang, Jun Yang, Min Xu, Li Zhao

机构 * University of Technology Sydney(悉尼技术大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出UniSteer框架,结合人类纠正指导与噪声空间RL,通过近似动作到噪声的逆向转换提升VLA在真实世界中的适应效率,实验显示成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏