KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies
KEMO: 面向长程机器人操作的VLA策略事件驱动关键帧记忆
Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li
机构
*
Hong Kong Embodied AI Lab(香港具身智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Shanghai Jiao Tong University(上海交通大学)
AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots
AIR-VLA+: 通过级联双动作解码器与非对称MoE解耦空中机器人的移动与操作
Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian
机构
*
The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)
;
College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院)
;
School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
;
Information Science, East China Normal University(华东师范大学信息科学)
FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning
FiberTune: 在视觉-语言-动作微调中保留动作纤维视觉残差
Haihao Lin, Xiangsheng Huang, Xiao Yang, Weibang Zhou, Yiqi Zhang, Bo Yang, Simin Zeng, Jiawei Yang, Zhengyang Wang, Jiahui Du
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Hebei Key Laboratory of Cognitive Intelligence, Xiong’an Institute of Innovation(河北省认知智能重点实验室,雄安创新研究院)
;
Hebei University of Technology(河北工业大学)
;
Beijing Information Science and Technology University(北京信息科技大学)
Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar
机构
*
Motoniq.ai
;
Stanford University(斯坦福大学)
;
Istituto Italiano di Tecnologia(意大利技术研究院)
;
ETH Zurich(苏黎世联邦理工学院)
;
Technical University of Darmstadt(德累斯顿技术大学)
;
UCL Centre for AI(伦敦大学学院人工智能中心)
专题命中
VLA模型
:VLA(title,title_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Microsoft Research Asia(微软亚洲研究院)
;
Princeton University(普林斯顿大学)
;
Tsinghua University(清华大学)
Hermite Curves as Trajectory Priors for Vision-Language-Action Models
作为视觉-语言-动作模型轨迹先验的埃尔米特曲线
Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng
机构
*
School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)
;
Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏赛克德智能科技有限公司)
;
National University of Singapore(新加坡国立大学)
机构
*
University of Hong Kong(香港大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
Huazhong University of Science and Technology(华中科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Infiforce(英飞拓)
HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models
HMVLA:超几何多模态融合用于视觉-语言-动作模型
Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Chongqing Research Institute of HIT(重庆HIT研究 institute)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中
VLA模型
:vision-language-action(title);action model(title);VLA(abstract,abstract_cn);vision language action(abstract)
AI总结
HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。
Comments5 pages,5 figures,ICASSP
Journal refICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)