Agile Robotics: Optimal Control, Reinforcement Learning, and Differentiable Simulation
专题命中 机器人数据与评测 :robotics(title,comments);分类 cs.RO
Comments This abstract has been accepted for the Robotics: Science and Systems (RSS) Pioneers Workshop, 2024
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 机器人数据与评测 :robotics(title,comments);分类 cs.RO
Comments This abstract has been accepted for the Robotics: Science and Systems (RSS) Pioneers Workshop, 2024
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)
Comments 2023 International Conference on Robotics and Automation (ICRA)
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)
Comments Under review at Robotics and Autonomous Systems (RAS) - Special issue: Semantic Policy and Action Representations for Autonomous Robots (SPAR)
专题命中 机器人数据与评测 :robotic(title);分类 cs.CV;robotics(journal_ref)
Journal ref IEEE Robotics and Automation Letters, vol.6, issue 4, October 2021
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(journal_ref)
Comments 8 pages, 8 figures, To appear in the proceedings of IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2019 Macau
Journal ref IEEE Robotics and Automation Letters (RA-L) 2019
在仿真环境中预训练视觉灵巧性
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Scale AI(Scale AI公司)
专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。
Comments Project page: https://spd.bot
通过信息瓶颈和向量量化实现带宽高效的多智能体通信
机构 * Department of Electrical and Computer Engineering, University of Arkansas at Little Rock(电气与计算机工程系,阿肯色大学小岩分校)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本研究通过信息瓶颈与向量量化方法,实现多智能体通信的带宽高效优化,提升协调性能并减少带宽消耗。
Comments Accepted at IEEE ICRA 2026, Vienna, Austria. 8 pages, 4 figures, 4 tables. v2: replaces v1 with the accepted camera-ready version and corrects a typo in the bandwidth reduction (41.4% -> 71.4%) in the abstract, Sec. I, Fig. 2 caption, Sec. VI and Sec. VII. Sec. V-A and Table I (800 vs 2800 bits/episode) were already correct; no results or conclusions changed
基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航
专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。
Comments 11 pages, 17 figures
用于空中多模态大语言模型智能体的零样本任务级评估
专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。
Comments Preprint
学习用于可变形物体模拟的物理引导残差动力学
机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; Columbia University(哥伦比亚大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。
Comments Website: https://pgrd-robot.github.io/
规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Beijing Normal University(北京师范大学) ; Guangzhou University(广州大学)
专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。
MagicSim: 可执行具身交互的统一基础设施
机构 * Northwestern University(西北大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ShanghaiTech University(上海科技大学)
专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。
EgoPhys: 从第一人称视频学习可变形物体的通用物理模型
机构 * UC San Diego(加州大学圣地亚哥分校)
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。
Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys
EgoTraj: 用于多模态预测的现实世界人轨迹数据集
机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) ; Meta Reality Labs(Meta现实实验室) ; School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。
Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj
MotionBricks: 可扩展的实时动作生成与模块化潜在生成模型及智能原语
机构 * NVIDIA ; Simon Fraser University(西蒙·弗雷泽大学) ; The University of Texas at Austin(得克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出MotionBricks,通过模块化潜在生成模型和智能原语实现实时动作生成,解决工业应用中实时可扩展性和多模态控制的挑战,展示了高质量和实时性能。
Comments ACM Transactions on Graphics; SIGGRAPH 2026. Project page: https://nvlabs.github.io/motionbricks/
SIM1:物理对齐的模拟器作为零样本数据放大器在变形世界中
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 SIM1通过物理对齐的仿真方法,将稀疏观测转化为高保真的合成监督,实现变形物体 manipulation 的高效训练,取得与真实数据相当的性能。
Comments Website: https://internrobotics.github.io/sim1.github.io/
StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发
机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)
专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。
Comments Open-source VLA infra, Technical Report
ManiTwin:将数据生成-ready的数字对象数据集扩展到10万
机构 * The University of Hong Kong(香港大学) ; Xspark AI ; Deemos Tech ; Shanghai Jiao Tong University(上海交通大学) ; ShanghaiTech University(上海交通大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; D-Robotics ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Shenzhen University(深圳大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。
Comments Website: https://manitwin.github.io/
AtomicVLA:解锁机器人中原子技能学习的潜力
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 AtomicVLA通过原子技能抽象和动态专家组合提升机器人长周期任务的性能
Comments Accepted by CVPR2026
EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)
专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。
记忆、基准与机器人:一种用于通过强化学习解决复杂任务的基准
机构 * AXXX ; MIRIAI ; ITMO University(ITMO大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出MIKASA基准,旨在通过强化学习解决复杂任务,包含32个记忆密集型任务,用于评估智能体在桌面机器人操作中的记忆能力。
Comments 57 pages, 29 figures, 11 tables
UrbanVerse: 通过观看城市游览视频扩大城市模拟
专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 UrbanVerse 通过将众包城市游览视频转化为物理-aware 的模拟场景,实现了城市模拟的扩展,提升了城市导航中代理的泛化能力和现实任务完成效率。
Comments Accepted to ICLR 2026. Project page: https://urbanverseproject.github.io/
去噪粒子滤波:基于单步目标的学习状态估计
机构 * Learning AI for Dextrous Robots Lab, Technical University of Munich(灵活机器人学习人工智能实验室,慕尼黑技术大学)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出了一种基于单步目标的去噪粒子滤波方法,通过隐式学习测量模型和动力学模型,实现高效的机器人状态估计,具有可组合性和良好的性能表现。
从开放式对话中推断目标
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。
Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119
RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Beijing Institute of Technology(北京理工大学) ; The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。
为人类机器人学习人类般的羽毛球技能
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出Imitation-to-Interaction框架,通过强化学习使机器人从模仿者发展为具备击球能力的智能体,实现了拟人化羽毛球技能的模拟到现实的零样本迁移。
Comments 10 pages, 4 figures
STEMNIST:基于事件的神经形态触觉数据集
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract)
AI总结 STEMNIST是一个扩展至35个字母数字类别的神经形态触觉数据集,用于评估基于事件的触觉识别性能。
拿出银器——对存储家居物品的语义理解
机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) ; Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。
Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025
具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆
专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。
Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/
PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) ; Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) ; Spatialtemporal AI(时空人工智能) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 机器人数据与评测 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。