arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-28 至 2026-04-28 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2603.06165 2026-04-28 cs.CV cs.AI 77%

Reflective Flow Sampling Enhancement

反射流采样增强

Zikai Zhou, Muyao Wang, Shitong Shao, Lichen Bai, Haoyi Xiong, Bo Han, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Tokyo(东京大学) Microsoft(微软) Hong Kong Baptist University(香港 Baptist大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Reflective Flow Sampling,一种针对流模型的无训练增强框架,提升文本图像生成质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22177 2026-04-28 cs.LG cs.CV 77%

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

通过REINFORCE与James-Stein收缩设计实例级采样计划

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) UCLA(加州大学洛杉矶分校)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过REINFORCE学习实例级采样计划,结合James-Stein收缩估计器提升高维策略学习的梯度估计精度,实现文本图像对齐和生成质量提升。

Comments CVPR 2026; 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08425 2026-04-28 cs.LG cs.SY eess.SY 67%

HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization

HardFlow: 通过轨迹优化实现流匹配模型的硬约束采样

Zeyang Li, Kaveh Alim, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract)

AI总结 本文提出HardFlow框架,通过轨迹优化解决流匹配模型中硬约束采样问题,利用数值最优控制确保终端时间满足约束,并在统一框架下提升样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24586 2026-04-28 cs.CV 57%

Point-MF: One-step Point Cloud Generation from a Single Image via Mean Flows

点-流:通过均流实现单图像点云生成

Yuta Baba, Keiji Yanai

机构 * The University of Electro-Communications(电子通信大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Point-MF框架,通过均流与辅助损失实现单图像点云重建,以单次网络调用完成高精度重建,提升效率与质量。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI 50%

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏