FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments Accepted by ICCV 2025
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments Accepted by ICCV 2025
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) ; Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICML2025
机构 * Manifold Research ; MIT(麻省理工学院)
专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.LG
Comments 16 pages, 26 figures
机构 * Cedars-Sinai Medical Center(西达萨凡纳医学中心)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV、cs.AI
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 VLA模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO、cs.AI
Journal ref Robotics: Science and Systems, 2025
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Xi’an Jiaotong University(西安交通大学) ; HKUST(GZ) Project Lead(香港科技大学(广州)项目负责人)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.AI、cs.LG
Comments accepted on NeurIPS 2024
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV
Comments 10 page
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sharpa ; Shanghai AI Lab(上海人工智能实验室) ; Zhongguancun Academy(中关村学院) ; National University of Singapore(新加坡国立大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO
AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。
Comments Project Homepage: https://sites.google.com/view/mode-vla
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; CASIA(中国科学院自动化研究所)
专题命中 VLA模型 :VLA(title,abstract);action model(abstract);分类 cs.CV
Comments Homepage: https://ltbai.github.io/VITA-VLA/
机构 * School of Engineering, Westlake University(西lake大学工程学院) ; College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; College of Environmental and Resource Sciences, Zhejiang University(浙江大学环境与资源科学学院) ; Australian National University(澳大利亚国立大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,comments);分类 cs.RO
Comments This paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作
机构 * The University of Tokyo(东京大学) ; ByteDance Seed(字节跳动 Seed) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。
Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/
IntentVLA:用于有歧义机器人操作的短周期意图建模
机构 * HUST(华中科技大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢智能科技有限公司) ; HIT(哈尔滨工业大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ZZU(浙江工业大学) ; ECNU(华东师范大学) ; USTC(中国科学技术大学) ; DeepCybo
专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。
Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA
PhysBrain 1.0 技术报告
机构 * PhysBrain Team(PhysBrain团队)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 PhysBrain 1.0 通过将大规模人类自体视频转化为结构化的物理常识监督,提升机器人适应能力,在多模态问答和具身控制基准测试中取得SOTA结果,尤其在SimplerEnv中表现突出。
Comments Project Page: https://phys-brain.github.io
当视觉超越语言:评估和缓解VLAs中的反事实失败
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 本文提出CAG方法,通过双分支推理方案缓解VLAs中的反事实失败,提升语言跟随和任务成功率。
Comments Website: https://vla-cf.github.io/
无视觉前瞻:面向世界动作模型的潜在未来
机构 * Shanghai Jiao Tong University(上海交通大学) ; ACE Robotics(ACE机器人公司) ; Nanyang Technological University(南洋理工大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。
Comments 12 pages, 3 figures
4D-WAM:通过轨迹场将时空感知注入世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。
HarnessWAM:弥合世界动作模型中的预测与审议差距
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) ; Beijing Institute of Technology(北京理工大学) ; Wuhan AI Research(武汉人工智能研究院)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。
执行前再思考:世界动作模型的自适应执行
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本文针对世界动作模型(WAMs)的固定执行 horizon 缺陷,提出自适应执行方案TempoWAM,经实验可改善WAM执行的效率-成功率权衡,在真实机器人任务中表现优异。
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
DynamicWAM:面向动态操作的世界-动作模型的双路径运动条件机制
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 针对现有世界-动作模型在动态场景中运动感知与响应控制不足的问题,提出采用双路径运动条件机制的DynamicWAM,在DOMINO数据集及12项真实世界任务中均显著优于基线方法。
Comments 18 pages, 9 figures. Project page: https://dynamicwam.github.io/
DreamWAM:超越RGB未来预测的世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。
Faster-WAM:面向鲁棒世界动作模型的高效推理时未来条件化方法
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 本文提出Faster-WAM,通过稀疏未来条件化框架等技术解决现有WAMs的性能效率矛盾,在多个机器人操控基准上实现更优权衡,提升了分布外泛化能力与鲁棒性。
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型
机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) ; School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)
专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO
AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。
SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Nanyang Technological University(南洋理工大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。
Comments 20 pages, 5 figures, 8 tables