arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-27 至 2026-03-27 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2603.25463 2026-03-27 cs.CV 83%

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

基于区间的方法:用于图像生成加速的协作解码

Keming Ye, Zhou Zhao, Fan Wu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CIAR框架,通过设备端自验证处理图像生成中的大词汇量和空间冗余问题,采用连续概率区间加速处理并保持图像质量,实验显示在速度和云请求减少方面优于现有方法。

Comments 23 pages, 10 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08985 2026-03-27 cs.CV 83%

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24806 2026-03-27 cs.RO cs.AI 78%

FODMP: Fast One-Step Diffusion of Movement Primitives Generation for Time-Dependent Robot Actions

FODMP:快速一步扩散运动原形生成用于时间依赖机器人动作

Xirui Shi, Arya Ebrahimi, Yi Hu, Jun Jin

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 FODMP通过单步解码器生成时间结构化运动,提升机器人实时控制性能,速度比MPD快10倍,能拦截快速飞来的球。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 62%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25730 2026-03-27 cs.CV cs.AI 57%

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

PackForcing:短视频训练足以支持长视频采样和长上下文推理

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24752 2026-03-27 physics.chem-ph cs.LG 50%

Autotuning T-PaiNN: Enabling Data-Efficient GNN Interatomic Potential Development via Classical-to-Quantum Transfer Learning

自适应T-PaiNN:通过经典到量子迁移学习实现数据高效的GNN互原子势开发

Vivienne Pelletier, Vedant Bhat, Daniel J. Rivera, Steven A. Wilson, Christopher L. Muhich

机构 * Materials Science & Engineering, School for the Engineering of Matter, Transport, & Energy, Arizona State University(材料科学与工程系,物质、传输与能源工程学院,亚利桑那州立大学) Chemical Engineering, School for the Engineering of Matter, Transport, & Energy, Arizona State University(化学工程系,物质、传输与能源工程学院,亚利桑那州立大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出T-PaiNN框架,利用经典力场数据提升GNN-MLIP的数据效率,通过预训练和微调实现量子精度,显著降低误差并加速训练。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏