arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-14 至 2026-08-14 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 7 篇

2505.16733 2026-08-14 cs.LG 版本更新 78%

Efficient Image Restoration with State-Dependent Forward Diffusion

基于状态依赖正向扩散的高效图像复原

Ziwei Luo, Fredrik K. Gustafsson, Jens Sjölund, Thomas B. Schön

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 该研究提出状态依赖均值回复正向扩散(FoD)框架,以单正向扩散过程实现高效图像复原,其含状态依赖SDE,可少步采样,在多类图像复原任务上性能优于多种对比方法。

Comments Accepted by TMLR. Project page: https://algolzw.github.io/fod

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新 74%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12276 2026-08-14 cs.CV 版本更新 70%

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

XYZFlow:用于高效生成建模的多维捷径流缩放方法

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * CUHK(香港中文大学) Westlake University(西湖大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 XYZFlow框架通过流匹配的多维缩放实现高效图像生成,兼具7.2-8.5倍的教师模型速度提升与竞争力FID,其下一捷径预测可实现更优的质量-延迟权衡。

Comments ICML 2026 (16 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12532 2026-08-14 cs.CV cs.AI cs.LG eess.IV eess.SP 版本更新 70%

Exploring Sparsity for Parameter Efficient Fine Tuning Using Wavelets for Vision

探索用于视觉参数高效微调的小波稀疏性

Ahmet Bilican, M. Akın Yılmaz, A. Murat Tekalp, R. Gökberk Cinbiş

机构 * Dept. of Electrical and Electronics Engineering, Koç University(电子工程系,科奇大学) Codeway AI Research(Codeway人工智能研究) Dept. of Computer Engineering, Middle East Technical University(计算机工程系,中东技术大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出小波微调(WaveFT),利用权重矩阵小波域的稀疏更新实现细粒度参数控制,在视觉任务的参数高效微调方法中达最优,已纳入Hugging Face PEFT库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09233 2026-08-14 cs.LG cs.CV 版本更新 57%

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。

Comments project page: https://sleepy1231.github.io/DreOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27431 2026-08-14 cs.LG cs.AI 版本更新 50%

SE(3)-MeanFlow: Few-Step Protein Backbone Generation on Lie Groups

SE(3)-MeanFlow:李群上的少步蛋白质主链生成

Yikun Bai, Binghang Lu, Yikai Liu, Elaheh Akbari, Soheil Kolouri, Linxuan Wang, Ping He, Shuchan Wang, Ruqi Zhang, Guang Lin

机构 * Purdue University(普渡大学) Vanderbilt University(范德堡大学) Freie Universität Berlin(柏林自由大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 SE(3)-MeanFlow将MeanFlow扩展到李群几何,通过新训练目标实现少步蛋白质主链生成,性能优于多倍采样的流匹配基线,适配高通量设计需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06239 2026-08-14 stat.ML cs.LG 版本更新 50%

Functional Adjoint Sampler: Scalable Sampling on Infinite Dimensional Spaces

功能伴随采样器:无穷维空间上的可扩展采样方法

Byoungwoo Park, Juho Lee, Guan-Horng Liu

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对无穷维函数空间吉布斯分布采样的理论缺口,提出基于随机最优控制的功能伴随采样器FAS,在合成势与真实分子系统上实现了更优的转移路径采样性能。

详情

展开后加载摘要…

URL PDF HTML 收藏