LeRobot: An Open-Source Library for End-to-End Robot Learning
LeRobot:端到端机器人学习的开源库
机构 * Hugging Face
专题命中 机器人学习 :robot learning(title,abstract);robotics(abstract);分类 cs.RO
AI总结 LeRobot是一个开源库,整合了机器人学习的整个堆栈,支持多种前沿算法,旨在降低研究门槛并促进可重复的先进机器人学习。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
LeRobot:端到端机器人学习的开源库
机构 * Hugging Face
专题命中 机器人学习 :robot learning(title,abstract);robotics(abstract);分类 cs.RO
AI总结 LeRobot是一个开源库,整合了机器人学习的整个堆栈,支持多种前沿算法,旨在降低研究门槛并促进可重复的先进机器人学习。
面向接口的有限示范轨迹重建用于机器人学习
机构 * Northwestern University \& Shirley Ryan AbilityLab Chicago Illinois USA ; Northwestern University \& Shirley Ryan AbilityLab
专题命中 机器人学习 :robot learning(title);robotic(abstract);分类 cs.RO
AI总结 本文提出一种轨迹重建算法,通过考虑任务、环境和接口约束,将受限示范提升到完整控制空间,以提升机器人运动的效率和用户意图的实现。
Comments 13 pages, 8 figures, to appear in the proceedings of the 2026 Human-Robot Interaction (HRI) Conference
EgoAVFlow:通过人类中心视频主动视觉实现机器人策略学习
机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) ; InnoCORE AI-Transformed Aerospace Research Center, KAIST(AI转型航空航天研究中心,韩国成均馆大学)
专题命中 机器人学习 :robot policy(title);manipulation(abstract);分类 cs.RO
AI总结 EgoAVFlow通过共享3D流表示从人类中心视频中学习机器人策略,实现主动视觉和稳健操纵,无需机器人演示。
SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作
机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))
专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI
AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。
Comments 7 pages, 2 figures
变形物体操控中的开放性挑战视角
机构 * Department of Computer Science, University of York(约克大学计算机科学系)
专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 本文探讨了变形物体操控中的关键挑战,包括遮挡处理、任务泛化和实时解决方案,并介绍了多模态感知、物理感知强化学习和生成神经网络等方法,旨在提升机器人在动态环境中的适应性和实用性。
Comments 28 pages, 7 Figures
表面纹理的时空调制用于信息编码和物体操控
专题命中 机器人操作 :manipulation(title,abstract);navigation(abstract);robotic(abstract)
AI总结 本文提出了一种光热驱动的液晶弹性体双层结构,通过动态褶皱实现可编程的时空表面纹理调制,用于信息编码和物体操控。
空间锚定触觉感知用于鲁棒的灵巧操作
机构 * Sharpa ; Tsinghua University(清华大学) ; Wuhan University(武汉大学) ; Shanghai Qi Zhi Institute(上海启智研究所)
专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO
AI总结 SaTA通过空间锚定触觉感知提升灵巧操作的精度和鲁棒性,有效解决亚毫米级任务中的触觉与运动学结合问题。
Comments 8 pages
GraspLDP: 通过潜在扩散实现通用抓取策略
机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) ; School of Computer Science and Engineering(计算机科学与工程学院)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 GraspLDP通过引入潜在扩散框架和抓取先验知识,提升了抓取策略的精度和泛化能力,实验表明其在动态抓取任务中表现优异。
Comments Accepted to CVPR 2026
DigiArm: 一种具有增强灵活性的3D打印仿人假手,适用于打字任务
机构 * Department of Computer Science, Technion, Haifa, Israel(计算机科学系,技术学院,海法,以色列) ; Department of Mechanical Engineering, Technion, Haifa, Israel(机械工程系,技术学院,海法,以色列)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 DigiArm是一种低成本3D打印假手,专为提高打字任务的灵活性而设计,通过增强手指和腕部控制实现精确操作。
Dyslexify: 一种针对CLIP中印刷攻击的机制性防御
机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ; University of Oxford(牛津大学) ; Technological University Dublin(都柏林技术大学) ; Technische Universität Berlin(柏林技术大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 Dyslexify通过消融CLIP中的印刷电路,有效防御印刷攻击,提升性能并保持应用安全性。
利用LLMs进行工业过程自动化
机构 * University of Passau(帕绍大学)
专题命中 机器人操作 :robotic(abstract);分类 cs.AI
AI总结 本研究探讨如何利用大型语言模型在工业过程自动化中解决实际编程任务并加速开发周期。
皮肤病变图像中皮肤颜色自动解构分析
机构 * University of Waterloo(滑铁卢大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 本文提出了一种皮肤颜色解构框架,通过学习结构化潜在空间,解决皮肤颜色差异导致的模型性能下降问题,并实现皮肤状况的反事实编辑和颜色转换。
超越监视器:混合现实可视化与多模态AI用于增强的数字病理学工作流程
机构 * Department of Computer Science and Engineering, University of Texas at Arlington(计算机科学与工程系,德克萨斯大学阿灵顿分校) ; Department of Medicine Division of Hematology-Oncology, UCLA(医学系血液肿瘤学分会,加州大学洛杉矶分校) ; Center for Innovation in Health Informatics, University of Texas at Arlington(健康信息创新中心,德克萨斯大学阿灵顿分校)
专题命中 机器人操作 :navigation(abstract);分类 cs.AI
AI总结 PathVis通过混合现实和多模态AI优化数字病理学工作流程,提升诊断效率与准确性。
二维半导体中单自旋缺陷的原子级量子控制
专题命中 机器人操作 :manipulation(abstract)
AI总结 研究通过扫描隧道显微镜和电子自旋共振技术,在二维半导体中实现单自旋缺陷的原子级量子控制,展示了确定性创造、相干操控和可控耦合的实验成果。
Comments 30 pages, 4 figures in the main text, 10 supplementary figures
基于拉格朗日插值的LLM文本水印
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文提出基于拉格朗日插值的LLM文本水印方案,通过嵌入连续点序列实现作者身份的高效恢复,即使在文本被大量删除的情况下也能有效工作。
EndoDDC: 通过扩散深度补全学习稀疏到密集重建以实现内窥镜机器人导航
机构 * Department of Electronic Engineering, The Chinese University of Hong Kong(电子工程系,香港中文大学)
专题命中 具身导航 :navigation(title,abstract);robotic(title);分类 cs.CV
AI总结 EndoDDC通过扩散模型整合图像、稀疏深度信息和深度梯度特征,提升内窥镜环境下深度重建的准确性和鲁棒性。
Comments Accepted by ICRA 2026
UniScale:通过先验注入实现多视角理解的统一尺度感知3D重建
专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO、cs.CV
AI总结 UniScale通过整合几何先验实现多视角下的统一尺度感知3D重建,适用于机器人感知任务。
自动化机器人针刺用于经皮气管切开术
机构 * Manchester Centre for Robotics and AI(曼彻斯特机器人与人工智能中心) ; Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) ; University of Manchester(曼彻斯特大学) ; Department of Electrical and Electronic Engineering(电子与电气工程系) ; Manchester University Foundation Trust Wythenshawe Hospital Intensive Care Unit(曼彻斯特大学基金会韦斯豪斯医院重症监护单元)
专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO
AI总结 本文提出了一种自动化机器人系统,用于提高经皮扩张气管切开术的穿刺精度和安全性。
在量子退火机上进行曲线拟合以实现高级导航方法
专题命中 具身导航 :navigation(title)
AI总结 本文探讨了利用量子退火机进行曲线拟合以优化导航方法的可行性,发现其在小规模问题中能与经典方法媲美。
Comments 17 pages, 7 figures, 5 tables; v3: minor corrections and clarifications
Journal ref Adv. Comput. Math. 52, 18 (2026)
时空令牌剪枝用于高效高分辨率GUI代理
机构 * Tsinghua University(清华大学) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 GUIPruner通过时空令牌剪枝技术,实现高分辨率GUI导航的高效处理,显著提升性能并降低资源消耗。
WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) ; Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) ; School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) ; School of Engineering, Stanford University(斯坦福大学工程学院) ; Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)
专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV
AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。
Comments 11 pages,8 figures
通过自监督骨骼表示学习实现鲁棒的人体轨迹预测
机构 * Chiba University(千叶大学)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 本文提出一种基于自监督学习的鲁棒人体轨迹预测方法,通过预训练的骨骼表示模型提升在遮挡环境下预测的鲁棒性和准确性。
Comments 11 pages main, 5 pages supplementary material
学习任务无关的动机以捕捉动物行为的连续性质
机构 * School of Computational Science and Engineering(计算科学与工程学院)
专题命中 具身导航 :navigation(abstract);分类 cs.LG
AI总结 本文提出MCD框架,通过连续动态建模捕捉动物行为的连续性质,实现对复杂行为的生成解释。
Comments 8 pages and 4 figures for the main text
关系型家电:用于家庭健康促进的冰箱中的机器人
机构 * Northeastern University(东北大学)
专题命中 具身导航 :robotic(abstract);分类 cs.RO
AI总结 本研究提出了一种冰箱中的拟人化机器人,通过个性化互动促进家庭健康,结果显示机器人能有效提升用户对健康零食选择的意识。
CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型
机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)
专题命中 具身推理 :embodied agent(title,abstract);world model(title,abstract);分类 cs.RO、cs.AI
AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。
GigaBrain-0.5M*: 基于世界模型强化学习的VLA
机构 * GigaBrain Team(GigaBrain团队)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.CV
AI总结 GigaBrain-0.5M*通过基于世界模型的强化学习提升VLA模型的跨任务适应能力,实现复杂操作任务的可靠执行。
Comments https://gigabrain05m.github.io/
稀疏想象用于高效的视觉世界模型规划
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出稀疏想象方法,通过减少标记处理数量提升视觉世界模型规划效率,同时保持高控制保真度。
Comments Accepted to ICLR 2026; Project Page: https://nikriz1.github.io/sparse_imagination/
面向风险的 world model 预测控制用于通用的端到端自动驾驶
机构 * University of Trento(特伦托大学) ; Sun Yat-sen University(中山大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出风险感知世界模型预测控制(RaWMPC)框架,通过鲁棒控制提升端到端自动驾驶在罕见场景下的决策可靠性与安全性。
一致性三元组作为一般世界模型的定义原则
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本文提出一致性三元组作为定义通用世界模型的原则,通过系统回顾多模态学习的演变,引入CoW-Bench基准测试,明确未来发展方向。
Comments 119 pages, 50 figures
K-Search: 通过共进化内在世界模型生成LLM内核
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。