arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-31 至 2026-03-31 共收录 143 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 2 篇

2511.21428 2026-03-31 cs.CV cs.AI cs.RO 67%

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

专题命中 机器人基础模型 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO 57%

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 7 篇

2511.14262 2026-03-31 cs.LG cs.AI 81%

Object-Centric World Models for Causality-Aware Reinforcement Learning

基于因果意识的强化学习对象中心世界模型

Yosuke Nishimoto, Takashi Matsubara

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出STICA框架,通过对象中心Transformer构建世界模型,并结合因果意识策略和价值网络,提升样本效率和最终性能。

Comments Accepted by AAAI-26. Codes are available at https://github.com/nishimoto0430/STICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22859 2026-03-31 cs.RO 79%

DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation

DecompGrind:一种通过切削面规划和接触力适应的机器人磨削分解框架

Shunsuke Araki, Takumi Hachimine, Yuki Saito, Kouhei Ohnishi, Jun Morimoto, Takamitsu Matsubara

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) Keio University(庆应义塾大学) Kyoto University(京都大学) Advanced Telecommunications Research Institute International (ATR)(国际电气通信基础技术研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出DecompGrind框架,通过分解磨削过程为去除形状规划和接触力适应,解决不同形状和材料硬度工件的高效磨削问题,实现安全接触力控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28053 2026-03-31 cs.LG 70%

Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL

通过视觉语言嵌入减少Oracle反馈用于基于偏好的强化学习

Udita Ghosh, Dripta S. Raychaudhuri, Jiachen Li, Konstantinos Karydis, Amit Roy-Chowdhury

机构 * AWS AI Labs(AWS AI实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出ROVED框架,结合视觉语言嵌入与针对性Oracle反馈,通过过滤机制减少不确定性样本的Oracle查询,提升鲁棒性与效率,实验证明在机器人任务中显著降低Oracle调用次数。

Comments Accepted at ICRA 2026. Project page:https://roved-icra-2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 70%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27416 2026-03-31 cs.RO cs.AI 62%

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

由代理驱动的自主强化学习研究:四足运动的迭代策略改进

Nimesh Khandelwal, Shakti S. Gupta

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27751 2026-03-31 cs.AI 57%

SkyNet: Belief-Aware Planning for Partially-Observable Stochastic Games

SkyNet:基于信念的规划用于部分可观测随机博弈

Adam Haile

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 SkyNet通过引入自我条件辅助头,改进了MuZero在部分可观测随机博弈中的规划能力,其在Skyjo游戏中实现了显著的胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27364 2026-03-31 cs.NI 50%

DRASTIC: A Dynamic Resource Allocation Framework over 6G Network Slicing in Task-aware Closed-Loop Tactile Internet Applications

DRASTIC:一种面向6G网络切片的动态资源分配框架,用于任务感知闭环触觉互联网应用

Narges Golmohammadi, Madan Mohan Rayguru, Sabur Baidya

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出DRASTIC框架,通过强化学习动态分配资源,满足延迟要求并提高吞吐量,适用于eMBB和HRLLC用户。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 4 篇

2603.27770 2026-03-31 cs.RO 70%

Transferability Through Cooperative Competitions

通过合作竞争实现转移性

Rodrigo Serra, Carlos Azevedo, André Silva, Kevin Alcedo, Quentin Rouxel, Peter So, Alejandro Suarez, Alin Albu-Schäeffer, Pedro U. Lima

机构 * Institute for Systems and Robotics / LARSyS, Instituto Superior Técnico, University of Lisbon(系统与机器人研究所 / LARSyS,里斯本高等理工学院,里斯本大学) Laboratory for Automatics and Systems, Instituto Pedro Nunes(自动化与系统实验室,佩德罗·努内斯研究所) INRIA, CNRS, Université de Lorraine, Nancy, France(法国国家信息与自动化研究所,法国国家科学研究中心,洛林大学,南锡) Munich Institute of Robotics and Machine Intelligence, TUM, Germany(慕尼黑机器人与机器智能研究所,慕尼黑工业大学) GRVC Robotics Laboratory, USE, Spain(GRVC机器人实验室,塞维利亚大学) Institute of Robotics and Mechatronics, DLR, Germany(机器人与机电一体化研究所,德国航空航天中心)

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种促进机器人模块在异构系统间转移与组合的协作机器人竞赛框架,通过结构化任务设计、共享基础设施和版税评分系统激励合作,以euROBIN首届Coopetition为例,探讨了模块重用的实践挑战及框架有效性。

Comments Description of the cooperative competition concept, with a case study in EU project euROBIN, held in Nancy, November 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28079 2026-03-31 cs.RO 57%

Control Without Control: Defining Implicit Interaction Paradigms for Autonomous Assistive Robots

无需控制:为自主助行机器人定义隐式交互范式

Janavi Gupta, Kavya Puthuveetil, Dimitra Tsakona, Akhil Padmanabha, Yiannis Demiris, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Imperial College London(伦敦帝国理工学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 本文探讨隐式控制范式,通过两个设计案例展示如何通过自然行为线索调整机器人行为,减少用户感知负荷并保持控制感,提出隐式交互设计指南。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28428 2026-03-31 cs.CY cs.MA 50%

Synergy: A Next-Generation General-Purpose Agent for Open Agentic Web

Synergy: 一个下一代通用智能体用于开放性智能体网络

Xiaohang Nie, Zihan Guo, Kezhuo Yang, Zhichong Zheng, Bochen Ge, Shuai Pan, Zeyi Chen, Youling Xiang, Yu Zhang, Weiwen Liu, Yuanjian Zhou, Weinan Zhang

专题命中 人机交互与遥操作 :embodied agent(abstract)

AI总结 本文提出Synergy,一个用于开放性智能体网络的通用智能体架构,强调智能体间的协作、身份管理和持续进化,以实现开放网络中的社会集成。

Comments A tech report of a general-purpose agent architecture and human-agent society, 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27497 2026-03-31 cs.CY 50%

AI Civilization and the Transformation of Work

人工智能文明与工作的转变

Dongsoo Han

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 本文探讨人工智能文明如何重构就业机制,主张从集中式模型转向去中心化生态系统,通过AI提升生产力降低经济价值创造门槛,强调人类与AI协同进化对教育和劳动力发展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 31 篇

2509.22578 2026-03-31 cs.RO 88%

EgoDemoGen: Egocentric Demonstration Generation for Viewpoint Generalization in Robotic Manipulation

EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成

Yuan Xu, Jiabing Yang, Xiaofeng Wang, Yixiang Chen, Zheng Zhu, Bowen Fang, Guan Huang, Xinze Chen, Yun Ye, Qiang Zhang, Peiyan Li, Xiangnan Wu, Kai Wang, Bing Zhan, Shuo Lu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) GigaAI Tsinghua University(清华大学) X-Humanoid FiveAges

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI 83%

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);embodied AI(abstract);分类 cs.AI

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26757 2026-03-31 cs.RO 83%

Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?

超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们

Boyang Cai, Qiwei Liang, Jiawei Li, Shihang Weng, Zhaoxin Zhang, Tao Lin, Xiangyu Chen, Wenjie Zhang, Jiaqi Mao, Weisheng Xu, Bin Yang, Jiaming Liang, Junhao Cai, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO 83%

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(title);embodied AI(abstract);robotic(abstract);分类 cs.RO

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27029 2026-03-31 cs.CV cs.LG 81%

YOLO Object Detectors for Robotics -- a Comparative Study

用于机器人视觉的YOLO目标检测器——一项比较研究

Patryk Niżeniec, Marcin Iwanowski, Marcin Gahbler

机构 * Nicolaus Copernicus University in Toruń(托伦尼古拉·哥白尼大学)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文比较了不同YOLO版本在机器人工作空间目标检测中的适用性,通过自定义数据集和COCO2017数据集进行实验,评估了不同训练测试配置和模型的鲁棒性。

Journal ref PAR (Pomiary Automatyka Robotyka), R. 30, Nr 1/2026, 117-126

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 80%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10655 2026-03-31 cs.SE cs.RO 74%

Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software

评估用于自主水下机器人软件中的视觉-语言模型感知能力

Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆城市大学) Mondragon University(蒙德拉贡大学) National Institute of Informatics(国立信息学研究所) Det norske Veritas (DNV)(挪威船级社(DNV))

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 本文评估了视觉-语言模型在自主水下机器人软件中的感知性能,通过计算性能和不确定性来指导软件工程师选择合适的模型。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 73%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28475 2026-03-31 cs.RO 70%

Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-Shot Real-World Deployment

Tac2Real: 可靠且用于在线强化学习和零样本现实部署的GPU视觉触觉模拟

Ningyu Yan, Shuai Wang, Xing Shen, Hui Wang, Hanqing Wang, Yang Xiang, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Algorithms of Machine Learning and Autonomous Driving Research Lab, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(机器学习与自动驾驶算法研究实验室,香港科技大学深圳-香港协同创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Tac2Real框架,结合PNCG-IPC方法和多GPU并行架构,实现高效的在线强化学习训练,并通过TacAlign方法减少领域间隙,验证了在现实场景中高成功率的零样本迁移。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 70%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27923 2026-03-31 cs.CV 70%

ForestSim: A Synthetic Benchmark for Intelligent Vehicle Perception in Unstructured Forest Environments

ForestSim:智能车辆在无结构森林环境中的合成基准

Pragat Wagle, Zheng Chen, Lantao Liu

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University(印第安纳大学卢迪信息学、计算与工程学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出ForestSim,一个高保真合成数据集,用于训练和评估智能车辆在森林环境中的语义分割模型,涵盖25种不同环境,支持自主导航。

Journal ref 2026 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27429 2026-03-31 cs.CV 70%

Mind the Shape Gap: A Benchmark and Baseline for Deformation-Aware 6D Pose Estimation of Agricultural Produce

注意形状差距:一种用于农业产品的变形感知6D姿态估计的基准和基线

Nikolas Chatzis, Angeliki Tsinouka, Katerina Papadimitriou, Niki Efthymiou, Marios Glytsos, George Retsinas, Paris Oikonomou, Gerasimos Potamianos, Petros Maragos, Panagiotis Paraskevas Filntisis

机构 * Robotics Institute, Athena Research Center(雅典娜研究中心机器人研究所) HERON - Hellenic Robotics Center of Excellence(HERON - 希腊机器人卓越中心) School of Electrical & Computer Engineering, NTUA(国立雅典理工大学电气与计算机工程学院) Music Technology, New York University(纽约大学音乐技术系) Department of Electrical & Computer Engineering, UTH(色萨利大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出PEAR基准和SEED框架,解决农业产品变形导致的6D姿态估计难题,展示现有方法性能下降,并证明显式形状建模对农业机器人可靠姿态估计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27344 2026-03-31 cs.CV 70%

TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR

TerraSeg: 任意LiDAR的自监督地面分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 TerraSeg通过自监督学习实现任意LiDAR的地面分割,利用大规模统一数据集OmniLiDAR提升泛化能力,无需人工标注即可在多个数据集上取得最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 70%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26685 2026-03-31 cs.RO cs.AI cs.CV cs.LG 70%

Contextual Graph Representations for Task-Driven 3D Perception and Planning

基于任务驱动的3D感知与规划的上下文图表示

Christopher Agia

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文研究了现有具身AI环境在机器人任务规划与3D场景图交集中的适用性,构建了评估现有经典规划器的基准,并探索图神经网络在规划领域关系结构不变性中的应用。

Comments University of Toronto Undergraduate Thesis, 2021. 85 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 67%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18532 2026-03-31 cs.RO cs.AI cs.LG 67%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏