A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments 26 pages,10 figures
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments 26 pages,10 figures
机构 * Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai University(上海大学) ; Xi’an Jiaotong University(西安交通大学) ; Noematrix Intelligence(Noematrix智能科技)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV
Comments NeurIPS 2025
机构 * Shanghai AI Lab(上海人工智能实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ; Peking University(北京大学) ; SenseTime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; HKISI, CAS(中国科学院香港中文大学研究所)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(abstract);分类 cs.RO、cs.CV
Comments Preprint; https://robodita.github.io; To appear in ICCV2025
机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Northwestern Polytechnical University(西北工业大学)
专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments The first three authors contributed equally
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Shanghai AI Lab(上海人工智能实验室) ; SenseTime Research(商汤科技研究院) ; Nanjing University(南京大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI
Comments Accepted by ICCV 2025
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) ; Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICML2025
机构 * Manifold Research ; MIT(麻省理工学院)
专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.LG
Comments 16 pages, 26 figures
机构 * Cedars-Sinai Medical Center(西达萨凡纳医学中心)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV、cs.AI
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 VLA模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO、cs.AI
Journal ref Robotics: Science and Systems, 2025
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Xi’an Jiaotong University(西安交通大学) ; HKUST(GZ) Project Lead(香港科技大学(广州)项目负责人)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.AI、cs.LG
Comments accepted on NeurIPS 2024
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV
Comments 10 page
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sharpa ; Shanghai AI Lab(上海人工智能实验室) ; Zhongguancun Academy(中关村学院) ; National University of Singapore(新加坡国立大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO
AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。
Comments Project Homepage: https://sites.google.com/view/mode-vla
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; CASIA(中国科学院自动化研究所)
专题命中 VLA模型 :VLA(title,abstract);action model(abstract);分类 cs.CV
Comments Homepage: https://ltbai.github.io/VITA-VLA/
机构 * School of Engineering, Westlake University(西lake大学工程学院) ; College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; College of Environmental and Resource Sciences, Zhejiang University(浙江大学环境与资源科学学院) ; Australian National University(澳大利亚国立大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,comments);分类 cs.RO
Comments This paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作
机构 * The University of Tokyo(东京大学) ; ByteDance Seed(字节跳动 Seed) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。
Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/
IntentVLA:用于有歧义机器人操作的短周期意图建模
机构 * HUST(华中科技大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢智能科技有限公司) ; HIT(哈尔滨工业大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ZZU(浙江工业大学) ; ECNU(华东师范大学) ; USTC(中国科学技术大学) ; DeepCybo
专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。
Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA
PhysBrain 1.0 技术报告
机构 * PhysBrain Team(PhysBrain团队)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 PhysBrain 1.0 通过将大规模人类自体视频转化为结构化的物理常识监督,提升机器人适应能力,在多模态问答和具身控制基准测试中取得SOTA结果,尤其在SimplerEnv中表现突出。
Comments Project Page: https://phys-brain.github.io
当视觉超越语言:评估和缓解VLAs中的反事实失败
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 本文提出CAG方法,通过双分支推理方案缓解VLAs中的反事实失败,提升语言跟随和任务成功率。
Comments Website: https://vla-cf.github.io/
无视觉前瞻:面向世界动作模型的潜在未来
机构 * Shanghai Jiao Tong University(上海交通大学) ; ACE Robotics(ACE机器人公司) ; Nanyang Technological University(南洋理工大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。
Comments 12 pages, 3 figures
4D-WAM:通过轨迹场将时空感知注入世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。
HarnessWAM:弥合世界动作模型中的预测与审议差距
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) ; Beijing Institute of Technology(北京理工大学) ; Wuhan AI Research(武汉人工智能研究院)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。
执行前再思考:世界动作模型的自适应执行
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本文针对世界动作模型(WAMs)的固定执行 horizon 缺陷,提出自适应执行方案TempoWAM,经实验可改善WAM执行的效率-成功率权衡,在真实机器人任务中表现优异。
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/