arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-09 至 2026-07-09 共收录 3
2607.07608 2026-07-09 cs.RO cs.CV 新提交

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06699 2026-07-09 cs.RO 新提交

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

RoboSnap:用于可泛化机器人学习与评估的一次性真实到模拟场景生成

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 针对构建物理稳定且视觉逼真场景缓慢昂贵的问题,提出RoboSnap框架,通过分层设计将单张RGB图像转为模拟场景,实验证明其能实现轨迹重放等,还引入DROID-Sim数据集,凸显真实到模拟方法对机器人学习评估的价值。

Comments 24 pages, 16 figures, Project page: https://robosnap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏