arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8657 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8657 篇

2407.01568 2024-07-03 cs.RO 76%

Agile Robotics: Optimal Control, Reinforcement Learning, and Differentiable Simulation

Yunlong Song, Davide Scaramuzza

专题命中 机器人数据与评测 :robotics(title,comments);分类 cs.RO

Comments This abstract has been accepted for the Robotics: Science and Systems (RSS) Pioneers Workshop, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03903 2023-07-11 cs.RO 76%

Proprioceptive Sensor-Based Simultaneous Multi-Contact Point Localization and Force Identification for Robotic Arms

Seo Wook Han, Min Jun Kim

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)

Comments 2023 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05255 2022-09-13 cs.RO 76%

A Causal-based Approach to Explain, Predict and Prevent Failures in Robotic Tasks

Maximilian Diehl, Karinne Ramirez-Amaro

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)

Comments Under review at Robotics and Autonomous Systems (RAS) - Special issue: Semantic Policy and Action Representations for Autonomous Robots (SPAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08488 2021-10-12 cs.CV 76%

Unsupervised identification of surgical robotic actions from small non homogeneous datasets

Daniele Meli, Paolo Fiorini

专题命中 机器人数据与评测 :robotic(title);分类 cs.CV;robotics(journal_ref)

Journal ref IEEE Robotics and Automation Letters, vol.6, issue 4, October 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.12216 2019-09-27 cs.RO cs.SY eess.SY 76%

Information-Guided Robotic Maximum Seek-and-Sample in Partially Observable Continuous Environments

Genevieve Flaspohler, Victoria Preston, Anna P. M. Michel, Yogesh Girdhar, Nicholas Roy

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(journal_ref)

Comments 8 pages, 8 figures, To appear in the proceedings of IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2019 Macau

Journal ref IEEE Robotics and Automation Letters (RA-L) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15917 2026-08-18 cs.RO cs.AI cs.CV 新提交 75%

Pre-training Visual Dexterity in Simulation

在仿真环境中预训练视觉灵巧性

Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Scale AI(Scale AI公司)

专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。

Comments Project page: https://spd.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02035 2026-08-12 cs.RO cs.AI cs.IT cs.LG cs.MA math.IT 版本更新 75%

Bandwidth-Efficient Multi-Agent Communication through Information Bottleneck and Vector Quantization

通过信息瓶颈和向量量化实现带宽高效的多智能体通信

Ahmad Farooq, Kamran Iqbal

机构 * Department of Electrical and Computer Engineering, University of Arkansas at Little Rock(电气与计算机工程系,阿肯色大学小岩分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究通过信息瓶颈与向量量化方法,实现多智能体通信的带宽高效优化,提升协调性能并减少带宽消耗。

Comments Accepted at IEEE ICRA 2026, Vienna, Austria. 8 pages, 4 figures, 4 tables. v2: replaces v1 with the accepted camera-ready version and corrects a typo in the bandwidth reduction (41.4% -> 71.4%) in the abstract, Sec. I, Fig. 2 caption, Sec. VI and Sec. VII. Sec. V-A and Table I (800 vs 2800 bits/episode) were already correct; no results or conclusions changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25728 2026-07-29 cs.RO cs.AI cs.LG 新提交 75%

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 75%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13451 2026-07-16 cs.RO cs.AI cs.CV 新提交 75%

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation

学习用于可变形物体模拟的物理引导残差动力学

Shivansh Patel, Kaifeng Zhang, Sanjay Pokkali, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) Columbia University(哥伦比亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。

Comments Website: https://pgrd-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 75%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交 75%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16202 2026-06-16 cs.CV cs.AI cs.RO 新提交 75%

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys: 从第一人称视频学习可变形物体的通用物理模型

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。

Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19004 2026-05-20 cs.CV cs.LG cs.RO 75%

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

EgoTraj: 用于多模态预测的现实世界人轨迹数据集

Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。

Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24833 2026-04-29 cs.RO cs.AI cs.GR cs.LG 75%

MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives

MotionBricks: 可扩展的实时动作生成与模块化潜在生成模型及智能原语

Tingwu Wang, Olivier Dionne, Michael De Ruyter, David Minor, Davis Rempe, Kaifeng Zhao, Mathis Petrovich, Ye Yuan, Chenran Li, Zhengyi Luo, Brian Robison, Xavier Blackwell, Bernardo Antoniazzi, Xue Bin Peng, Yuke Zhu, Simon Yuen

机构 * NVIDIA Simon Fraser University(西蒙·弗雷泽大学) The University of Texas at Austin(得克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出MotionBricks,通过模块化潜在生成模型和智能原语实现实时动作生成,解决工业应用中实时可扩展性和多模态控制的挑战,展示了高质量和实时性能。

Comments ACM Transactions on Graphics; SIGGRAPH 2026. Project page: https://nvlabs.github.io/motionbricks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08544 2026-04-13 cs.RO cs.AI cs.CV 75%

SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds

SIM1:物理对齐的模拟器作为零样本数据放大器在变形世界中

Yunsong Zhou, Hangxu Liu, Xuekun Jiang, Xing Shen, Yuanzhen Zhou, Hui Wang, Baole Fang, Yang Tian, Mulin Yu, Qiaojun Yu, Li Ma, Hengjie Li, Hanqing Wang, Jia Zeng, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SIM1通过物理对齐的仿真方法,将稀疏观测转化为高保真的合成监督,实现变形物体 manipulation 的高效训练,取得与真实数据相当的性能。

Comments Website: https://internrobotics.github.io/sim1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 75%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16866 2026-03-18 cs.RO cs.AI cs.GR cs.LG cs.SE 75%

ManiTwin: Scaling Data-Generation-Ready Digital Object Dataset to 100K

ManiTwin:将数据生成-ready的数字对象数据集扩展到10万

Kaixuan Wang, Tianxing Chen, Jiawei Liu, Honghao Su, Shaolong Zhu, Minxuan Wang, Zixuan Li, Yue Chen, Huan-ang Gao, Yusen Qin, Jiawei Wang, Qixuan Zhang, Lan Xu, Jingyi Yu, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xspark AI Deemos Tech Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) D-Robotics Peking University(北京大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。

Comments Website: https://manitwin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07648 2026-03-10 cs.RO cs.AI cs.CV 75%

AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

AtomicVLA:解锁机器人中原子技能学习的潜力

Likui Zhang, Tao Tang, Zhihao Zhan, Xiuwei Chen, Zisheng Chen, Jianhua Han, Jiangtong Zhu, Pei Xu, Hang Xu, Hefeng Wu, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 AtomicVLA通过原子技能抽象和动态专家组合提升机器人长周期任务的性能

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00405 2026-03-06 cs.CV cs.AI cs.RO 75%

EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations

EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进

Jiayi Liu, Jiaming Zhou, Ke Ye, Kun-Yu Lin, Allan Wang, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10550 2026-03-05 cs.LG cs.AI cs.RO 75%

Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning

记忆、基准与机器人:一种用于通过强化学习解决复杂任务的基准

Egor Cherepanov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRIAI ITMO University(ITMO大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出MIKASA基准,旨在通过强化学习解决复杂任务,包含32个记忆密集型任务,用于评估智能体在桌面机器人操作中的记忆能力。

Comments 57 pages, 29 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15018 2026-03-03 cs.CV cs.AI cs.RO 75%

UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos

UrbanVerse: 通过观看城市游览视频扩大城市模拟

Mingxuan Liu, Honglin He, Elisa Ricci, Wayne Wu, Bolei Zhou

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 UrbanVerse 通过将众包城市游览视频转化为物理-aware 的模拟场景,实现了城市模拟的扩展,提升了城市导航中代理的泛化能力和现实任务完成效率。

Comments Accepted to ICLR 2026. Project page: https://urbanverseproject.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19651 2026-02-24 cs.RO cs.AI cs.LG 75%

Denoising Particle Filters: Learning State Estimation with Single-Step Objectives

去噪粒子滤波:基于单步目标的学习状态估计

Lennart Röstel, Berthold Bäuml

机构 * Learning AI for Dextrous Robots Lab, Technical University of Munich(灵活机器人学习人工智能实验室,慕尼黑技术大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于单步目标的去噪粒子滤波方法,通过隐式学习测量模型和动力学模型,实现高效的机器人状态估计,具有可组合性和良好的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13957 2026-02-20 cs.AI cs.LG cs.RO 75%

Goal Inference from Open-Ended Dialog

从开放式对话中推断目标

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。

Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16444 2026-02-20 cs.RO cs.AI cs.LG 75%

RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation

RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务

Yixue Zhang, Kun Wu, Zhi Gao, Zhen Zhao, Pei Ren, Zhiyuan Xu, Fei Liao, Xinhua Wang, Shichao Fan, Di Wu, Qiuxuan Feng, Meng Li, Zhengping Che, Chang Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Beijing Institute of Technology(北京理工大学) The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08370 2026-02-10 cs.RO cs.AI cs.LG 75%

Learning Human-Like Badminton Skills for Humanoid Robots

为人类机器人学习人类般的羽毛球技能

Yeke Chen, Shihao Dong, Xiaoyu Ji, Jingkai Sun, Zeren Luo, Liu Zhao, Jiahui Zhang, Wanyue Li, Ji Ma, Bowen Xu, Yimin Han, Yudong Zhao, Peng Lu

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Imitation-to-Interaction框架,通过强化学习使机器人从模仿者发展为具备击球能力的智能体,实现了拟人化羽毛球技能的模拟到现实的零样本迁移。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01658 2026-01-06 cs.NE 75%

STEMNIST: Spiking Tactile Extended MNIST Neuromorphic Dataset

STEMNIST:基于事件的神经形态触觉数据集

Anubhab Tripathi, Li Gaishan, Zhengnan Fu, Chiara Bartolozzi, Bert E. Shi, Arindam Basu

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract)

AI总结 STEMNIST是一个扩展至35个字母数字类别的神经形态触觉数据集,用于评估基于事件的触觉识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 75%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14396 2025-12-24 cs.RO cs.AI cs.CV 75%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08708 2025-11-24 cs.RO cs.AI cs.CV 75%

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏