Manipulation by Feel: Touch-Based Control with Deep Predictive Models
专题命中 具身与机器人 :predictive model(title,abstract);predictive models(title);分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)
Comments Accepted to ICRA 2019
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 具身与机器人 :predictive model(title,abstract);predictive models(title);分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)
Comments Accepted to ICRA 2019
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
Comments NIPS Workshop on Acting and Interacting in the Real World: Challenges in Robot Learning
Journal ref Bruce, Jake, et al. "One-Shot Reinforcement Learning for Robot Navigation with Interactive Replay." Proceedings of the NIPS Workshop on Acting and Interacting in the Real World: Challenges in Robot Learning. 2017
WCM:用于视觉-语言-动作强化学习的世界评论者模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。
迈向可预测、对齐且可扩展的机器人学习
机构 * Astribot Team(Astribot团队)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。
IndoorR2X: 基于大语言模型的室内机器人与万物协调
机构 * Fujitsu Research(富士通研究所) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO、cs.MA
AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。
DSWAM:用于细粒度机器人操作的双系统世界行动基础模型
机构 * AIRC, Midea Group(美的集团美云智数) ; Tongji University(同济大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。
Comments 13 pages, 1 figures
科大讯飞-具身全能技术报告
机构 * iFLYTEK ; LindenBot ; University of Science and Technology of China(中国科学技术大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。
ABot-M0.5:统一移动与操作的世界动作模型
机构 * AMAP CV Lab(AMAP CV实验室)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 针对移动操作任务中VLA策略缺乏世界建模、动作空间耦合及训练-推理不一致的问题,提出ABot-M0.5模型,通过三级对齐(时间粒度、动作空间、训练-测试一致性)实现细粒度控制,在长时域任务成功率和控制精度上达到最优。
Comments Code: https://github.com/amap-cvlab/ABot-Manipulation
沉思之道:面向具身导航的空间感知世界动作模型
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。
Comments ECCV 2026
学习感知未来:DreamTacVLA用于接触丰富的 manipulation
机构 * Northwestern University(西北大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 DreamTacVLA通过结合高分辨率触觉图像与多尺度视觉信息,提升接触丰富任务的鲁棒性,实现95%的成功率。
双锚定:解决视觉语言导航中的状态漂移问题
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) ; National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Johns Hopkins University(约翰霍普金斯大学) ; Joy Future Academy, JD(京东探索研究院)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。
Comments Accepted by ECCV26
PearlVLA:潜在空间中的渐进式具身动作计划精炼
机构 * Imperial College London(帝国理工学院) ; Tsinghua University(清华大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。
Comments 21 pages, 2 figures. Preprint
LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型
机构 * Tsinghua University(清华大学) ; Jilin University(吉林大学) ; Nankai University(南开大学) ; Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Zhongguancun Academy(中关村学院) ; Striding.AI ; Infinigence AI
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。
面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应
机构 * The University of Manchester(曼彻斯特大学) ; International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) ; Delft University of Technology(代尔夫特理工大学) ; Newcastle University(纽卡斯尔大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO;dynamics model(abstract)
AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。
Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型
机构 * Open-H-Embodiment Consortium ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学) ; University of Tokyo(东京大学) ; University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) ; University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。
Comments Project website: https://open-h.github.io/open-h-embodiment/
PEACE: 一种用于无人机的带约束执行的规划-执行智能体
机构 * Institute of Computer Science, University of Bern(伯尔尼大学计算机科学研究所) ; AI4I - The Italian Institute of Artificial Intelligence(意大利人工智能研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出一种基于大语言模型的规划-执行智能体架构,通过解耦高层任务规划与低层控制,并引入约束执行层和有限重规划,实现无人机可解释、可约束的自主飞行。
Comments Accepted to ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy: From Environment Understanding and Reasoning to Safe Interaction
杂乱场景中通过动力学感知策略学习涌现的外在灵巧性
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Galbot ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出动力学感知策略学习框架,通过显式世界建模学习接触诱导物体动力学表示并用于强化学习,使杂乱场景中的外在灵巧性无需手工启发式或复杂奖励塑造即可涌现。
Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project page: https://pku-epic.github.io/DAPL/
TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力
机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) ; Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) ; North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) ; Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。
Comments Accepted to ICML 2026
Robo-Cortex: 通过双粒认知记忆和自主知识诱导实现自我进化具身智能体
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; X-Humanoid ; Institute of Automation, CAS(中国科学院自动化研究所) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出Robo-Cortex框架,通过双粒认知记忆和自主知识诱导机制,使机器人能够自主诱导导航启发式方法并优化认知策略,从而在复杂环境中实现自主导航和探索。
DynoSLAM:基于生成图神经网络的动态SLAM用于现实世界的社交导航
机构 * Applied AI Institute(应用人工智能研究所)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出DynoSLAM,通过整合社交感知图神经网络,解决动态环境中SLAM的不确定性问题,提升机器人在拥挤环境中的导航能力。
Comments Code & Project page at https://github.com/makriot/dynoslam
LaST-R1:通过自适应物理潜在推理强化机器人操作
机构 * The Chinese University of Hong Kong(香港中文大学) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院) ; Simplexity Robotics Project(Simplexity机器人项目)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出LaST-R1,一种基于强化学习的后训练框架,通过联合优化潜在推理过程和动作生成,提升机器人在动态环境中的适应性和泛化能力。
AIM: 基于意图的统一世界动作建模与空间价值图
机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO
AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
StaMo:从紧凑状态表示中无监督学习通用机器人运动
机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Nanjing University(南京大学) ; HKUST(香港科技大学) ; Ant Group(蚂蚁集团)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。
ProgressVLA: 用于视觉-语言机器人操控的进展引导扩散策略
机构 * Peking University(北京大学) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 本文提出ProgressVLA模型,通过鲁棒的进展估计和可微进展引导方法提升机器人操控任务的成功率和泛化能力。
3D动态感知操控:赋予操控策略三维前瞻性
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; JAKA Robotics Co., Ltd.(JAKA机器人有限公司)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出一种融合3D世界建模与策略学习的框架,通过引入三个自监督任务提升操控策略的3D前瞻性,实验表明在仿真和现实环境中显著提升操控性能。
Comments ICRA 2026
通过反事实失败合成学习可操作的操纵恢复
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Minnesota(明尼苏达大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Abaka AI(Abaka人工智能) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO
AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。
长短期代理用于纯视觉支气管镜机器人自主性
机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) ; Shanghai Chest Hospital(上海胸科医院)
专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.RO
AI总结 本研究提出一种纯视觉的支气管镜机器人自主导航框架,通过长短期代理实现无外部跟踪的精准导航,验证了其在体内外实验中的有效性。
通过代理引导加速机器人强化学习
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; PKU-PsiBot Joint Lab(北京大学- PsiBot 联合实验室)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 AGPS通过多模态代理替代人类监督,提升机器人强化学习的样本效率和可扩展性。
HARMONI: 基于大语言模型的多用户人机交互多模态个性化
机构 * Institut Curie, Université Paris-Saclay(巴黎-萨克勒大学Curie研究所) ; Institute of Intelligent Systems and Robotics (ISIR), Sorbonne University(索邦大学智能系统与机器人研究所) ; Assistance Publique – Hôpitaux de Paris (AP-HP), Université Paris Cité(巴黎公共医院(AP-HP)与巴黎城市大学)
专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 HARMONI通过多模态个性化框架,利用大语言模型提升多用户人机交互的持续个性化和动态适应能力。