arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-13 至 2026-07-13 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 3 篇

2601.09881 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

Transition Matching Distillation for Fast Video Generation

用于快速视频生成的过渡匹配蒸馏

Weili Nie, Julius Berner, Nanye Ma, Chao Liu, Saining Xie, Arash Vahdat

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09336 2026-07-13 cs.LG cs.AI cs.RO 新提交 50%

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

用于高效离线强化学习的捷径轨迹规划

Guanquan Wang, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对离线强化学习中轨迹规划器的问题,提出捷径轨迹规划(STP)框架,将捷径模型作为轨迹生成器,单阶段训练条件捷径轨迹模型,支持可调推理,用增强可行性感知校正的评论家选候选计划,在多任务基准测试中性能强且简化训练管道。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏