arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-19 至 2026-05-19 共收录 174 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 9 篇

2605.17681 2026-05-19 cs.RO 86%

PRIME: Physically-consistent Robotic Inertial and Motion Estimation for Legged and Humanoid Robots

PRIME: 为四足机器人和人形机器人提供物理一致的机器人惯性与运动估计

Jiarong Kang, Kunzhao Ren, Tao Pang, Xiaobin Xiong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :robotic(title,abstract);robot foundation model(abstract);分类 cs.RO;robotics(comments)

AI总结 该研究提出PRIME方法,通过结合可微接触动力学和光滑互补约束,实现从 onboard 传感器数据中获得物理一致的运动轨迹和惯性参数估计,从而提升机器人运动估计的准确性。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14371 2026-05-19 cs.RO cs.AI 73%

OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism

OxyGen: 为多任务并行下的VLA推理提供统一的KV缓存管理

Xiangyu Li, Huaizhi Tang, Xin Ding, Weijun Wang, Ting Cao, Yunxin Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Department of Electronic Engineering(电子工程系) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出OxyGen,一种统一的KV缓存管理方法,用于在多任务并行下提高VLA推理效率,通过跨任务KV共享和跨帧连续批处理实现冗余计算和资源竞争的减少,从而在设备端实现更高的吞吐量和频率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18722 2026-05-19 cs.RO 70%

Dexora: Open-source VLA for High-DoF Bimanual Dexterity

Dexora: 开源的高自由度双臂灵巧性VLA系统

Zongzheng Zhang, Jingrui Pang, Zhuo Yang, Kun Li, Minwen Liao, Saining Zhang, Guoxuan Chi, Jinbang Guo, Huan-ang Gao, Modi Shi, Dongyun Ge, Yao Mu, Jiayuan Gu, Rui Chen, Hao Dong, Huazhe Xu, Li Yi, Yixin Zhu, Hang Zhao, Pengwei Wang, Shanghang Zhang, Guocai Yao, Jianyu Chen, Hongyang Li, Hao Zhao

机构 * Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Peking University(北京大学)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出Dexora,首个开源的VLA系统,旨在双臂双手高自由度操作,通过混合遥控管道分离粗臂运动和精细手指运动,结合物理平台和数字孪生,构建大规模训练数据集,并提出数据质量感知训练方法,实验证明其在基础和灵巧任务上的优越性能。

Comments Accpeted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07308 2026-05-19 cs.RO 70%

AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models

AT-VLA: 用于增强视觉-语言-动作模型反馈反应的自适应触觉注入

Xiaoqi Li, Muhe Cai, Jiadong Xu, Juan Zhu, Hongwei Fan, Yan Shen, Guangrui Ren, Hao Dong

机构 * School of Computer Science, Peking University(北京大学计算机科学系) PrimeBot PKU Lab(北京大学实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出AT-VLA,一种自适应触觉注入机制,通过动态决定触觉注入的时间和位置,减少对预训练表示的干扰,同时引入触觉反应双流机制,实现快速准确的触觉响应,以提高视觉-语言-动作模型在接触丰富操作任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16278 2026-05-19 cs.CV cs.AI cs.RO 67%

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE:面向端到端自动驾驶的视觉-语言-动作混合专家模型

Zhenjie Yang, Yilin Chai, Xiaosong Jia, Qifeng Li, Yuqian Shao, Xuekai Zhu, Haisheng Su, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学学院与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) AnyScale AI Project(AnyScale AI项目)

专题命中 机器人基础模型 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DriveMoE,一种基于混合专家架构的端到端自动驾驶框架,通过场景专用的视觉混合专家和技能专用的动作混合专家,实现了对复杂驾驶场景的有效处理,展示了在自动驾驶任务中结合视觉和动作混合专家的有效性。

Comments Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17144 2026-05-19 cs.RO cs.AI cs.LG 67%

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12978 2026-05-19 cs.RO cs.AI 66%

Learning Native Continuation for Action Chunking Flow Policies

学习原生延续以实现动作分块流策略

Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

机构 * Spirit AI

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 本文提出Legato方法,通过训练时的延续技术改进动作分块流基于VLA策略,减少动作边界不连续性和伪多模态切换,提升轨迹平滑度和任务完成效率。

Comments Accepted by Robotics: Science and Systems 2026 (RSS 2026). Project page: https://lyfeng001.github.io/Legato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15735 2026-05-19 cs.CV cs.AI 62%

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

UAM:VL A训练中遗忘的双流视角

Jianke Zhang, Yuanfei Luo, Yucheng Hu, Xiaoyu Chen, Yanjiang Guo, Ziyang Liu, Hongbin Xu, Tian Lan, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出UAM模型,通过双流架构解决VL A训练中因单一编码器导致的多模态能力下降问题,展示了通过架构分离而非冻结权重或辅助数据可实现语义保留,并在多种任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10503 2026-05-19 cs.RO 57%

Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning

迈向长寿命机器人:通过强化微调实现持续学习的VLA模型

Yuan Liu, Haoran Li, Shuai Tian, Yuxing Qin, Yuhui Chen, Yupeng Zheng, Yongzhen Huang, Dongbin Zhao

机构 * CASIA(中国科学院自动化研究所)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 本文提出LifeLong-RFT方法,通过整合分块级在线强化学习与多维过程奖励机制,提升VLA模型在多任务学习中的性能,实现持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 1 篇

2604.10825 2026-05-19 cs.AI 57%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 6 篇

2506.13189 2026-05-19 cs.HC cs.RO 81%

Gesture First, LLM-Assisted Voice Complement: Exploring Multimodal Robot 'Puppeteer' Teleoperation Via Virtual Counterpart in Augmented Reality

先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控

Yuchong Zhang, Bastian Orthmann, Shichen Ji, Michael Welle, Jonne Van Haastregt, Danica Kragic

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 人机交互与遥操作 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。

Comments This work is under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17123 2026-05-19 cs.HC cs.RO 79%

ATRACT: A Trustworthy Robotic Autonomous system to support Casualty Triage

ATRACT: 一种可靠的机器人自主系统以支持伤员分诊

Tasweer Ahmad, Rafael Pina, Sandip Pradhan, Arindam Sikdar, Mindula Illeperuma, Khizer Saeed, Peter Lee, Varuna De Silva, Ardhendu Behera

机构 * Department of Computer Science, Edge Hill University(埃德希尔大学计算机科学系) Institute for Digital Technologies, Loughborough University London(洛斯伯勒大学伦敦数字技术研究所) School of Architecture, Technology and Engineering, University of Brighton(布莱顿大学建筑、技术与工程学院) School of Criminology and Criminal Justice, University of Portsmouth(普茅斯大学犯罪学与刑事司法学院)

专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出ATRACT,一种人机协同的决策支持系统,通过多模态学习整合无人机视频与可穿戴传感器数据,以提高战场伤员分诊的准确性,同时减少前线医疗人员的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16300 2026-05-19 cs.CY cs.AI cs.MA cs.RO 79%

Consent Chain Degradation in Embodied Multi-Agent Systems: Bridging the Gap Between AI Agent Governance and Robot Ethics

具身多智能体系统中的同意链退化:弥合人工智能代理治理与机器人伦理之间的鸿沟

Mehmet Haklidir

机构 * Artificial Intelligence Institute, TÜBİTAK BİLGEM(人工智能研究所,TÜBİTAK BİLGEM)

专题命中 人机交互与遥操作 :robotics(abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出同意链退化(CCD)概念,探讨多机器人委托链中人类同意的具体性、有效性及范围如何退化,并通过医疗、家庭和工业机器人场景展示其实际表现,分析现有法规对CCD核心维度的缺失。

Comments Accepted for oral presentation at the 2nd Workshop on Robot Ethics (WoRoBet), ICRA 2026, Vienna, Austria, June 1, 2026. 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16492 2026-05-19 cs.HC cs.RO 70%

FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech

FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Boya Zhang, Benjamin Kiefer, Tianchen Deng, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 人机交互与遥操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。

Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17865 2026-05-19 cs.CV 70%

Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling

通过运动诱导采样用消费级LiDAR成像隐藏物体

Siddharth Somasundaram, Aaron Young, Akshat Dave, Adithya Pediredla, Ramesh Raskar

机构 * Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院)

专题命中 人机交互与遥操作 :robotic(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种多帧融合策略,利用运动诱导孔径采样模型,在消费级LiDAR上实现了非线视成像,实现了隐藏物体的3D重建、多物体跟踪和相机定位,并展示了消费级硬件无需额外设置即可实现非线视成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16059 2026-05-19 cs.RO 57%

Therapist-Exoskeleton-Patient Interaction for Gait Therapy

治疗师-外骨骼-患者互动用于步态治疗

Emek Barış Küçüktabak, Matthew R. Short, Lorenzo Vianello, Daniel Ludvig, Levi Hargrove, Kevin Lynch, Jose Pons

机构 * Shirley Ryan AbilityLab Center for Robotics and Biosystems(机器人与生物系统中心) Department of Biomedical Engineering(生物医学工程系) Department of Mechanical Engineering(机械工程系) Department of Physical Medicine and Rehabilitation(康复医学系)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于物理人机人交互(pHRHI)的步态康复新方法,通过让治疗师和中风患者均佩戴下肢外骨骼,并通过弹簧阻尼元件连接在髋膝处,实现双向互动,从而提高康复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 29 篇

2605.17912 2026-05-19 cs.RO cs.CV 88%

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(title,abstract);robotic(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08567 2026-05-19 cs.CV 85%

ACWM-Phys: Investigating Generalized Physical Interaction in Action-Conditioned Video World Models

ACWM-Phys:探究动作条件化视频世界模型中的广义物理交互

Haotian Xue, Yipu Chen, Liqian Ma, Zelin Zhao, Lama Moukheiber, Yuchen Zhu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :world model(title,abstract);robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出ACWM-Phys基准,用于评估动作条件化预测在多样物理动态下的性能,通过系统实验发现模型在物理规则和任务复杂度上存在泛化差异,指导了物理基础世界模型的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14504 2026-05-19 cs.AI 84%

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

当机器人做家务:一个基准和代理用于长期家庭任务执行

Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);manipulation(abstract);navigation(abstract)

AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18407 2026-05-19 cond-mat.mes-hall cond-mat.mtrl-sci cs.AI cs.RO 84%

Qumus: Realization of An Embodied AI Quantum Material Experimentalist

Qumus: 一种具身人工智能量子材料实验家的实现

Lihan Shi, Zhaoyi Joy Zheng, Xinzhe Juan, Yimin Wang, Ming Yin, Mayank Sengupta, Kristina Wolinski, Yanyu Jia, Jingzhi Shi, Derek Saucedo, Neill Saggi, Haosen Guan, Kenji Watanabe, Takashi Taniguchi, Ali Yazdani, Mengdi Wang, Sanfeng Wu

专题命中 机器人数据与评测 :embodied AI(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Qumus,首个能够进行真实世界科学发现的具身人工智能量子材料实验家,通过机器人微型实验室实现了原子薄二维材料和范德瓦耳斯结构的制备与纳米加工,首次实现了AI生成石墨烯和原子薄场效应晶体管的AI制造。

Comments 29 Pages in total. Supplementary Demo Videos are available at https://qumus.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17451 2026-05-19 cs.CV 83%

DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking

DeTrack:一种无人机具身跟踪的基准及海拔感知双世界模型

Guyue Hu, Haoming Liu, Siyuan Song, Chenglong Li, Feng Chen, Jin Tang

机构 * Hefei Si Valley Technology Development Co., Ltd(合肥蜀山科技发展有限公司) Institute of Embodied Intelligence, Anhui University(embodied intelligence研究院,安徽大学)

专题命中 机器人数据与评测 :world model(title,abstract);embodied agent(abstract);分类 cs.CV

AI总结 本文提出DeTrack任务,要求无人机在交互式3D环境中利用在线自体观察和主动飞行控制进行目标跟踪,并提出AaDWorlds框架以解决海拔相关的可见性与飞行安全矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14009 2026-05-19 cs.RO 82%

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++: 基于视觉-语言模型的视觉无人机导航:高斯辐射场与可微动力学

Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)

专题命中 机器人数据与评测 :navigation(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 GRaD-Nav++提出一种轻量级视觉-语言-动作框架,通过可微强化学习在3D高斯点云模拟器中训练,实现基于自然语言指令的实时无人机导航,展示在多任务和多环境下的高效导航能力。

Comments Published in: IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

Journal ref Chen, Qianzhong, et al. "Grad-nav++: Vision-language model enabled visual drone navigation with gaussian radiance fields and differentiable dynamics." IEEE Robotics and Automation Letters 11.2 (2025): 1418-1425

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18373 2026-05-19 cs.RO cs.LG math.DS math.OC 82%

Dynamic robotic cloth folding with efficient Koopman operator-based model predictive control

动态机器人布料折叠与高效的Koopman算子基于模型预测控制

Edoardo Caldarelli, Franco Coltraro, Adrià Colomé, Lorenzo Rosasco, Carme Torras

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) Institut de Robòtica i Informàtica Industrial(机器人与信息技术研究所) MaLGa Center, DIBRIS, Università degli Studi di Genova(MaLGa中心,DIBRIS,热那亚大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出了一种基于Koopman算子的模型预测控制方法,用于快速生成布料折叠轨迹,结合物理仿真和高效的核基Koopman算子回归,以提高折叠任务的效率和精度。

Comments Accepted for presentation at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17580 2026-05-19 cs.AI 79%

ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation

ECG-WM: 一种基于生理的ECG世界模型用于临床干预模拟

Zhikang Chen, Yue Wang, Sen Cui, Yu Zhang, Changshui Zhang, Tianling Ren, Tingting Zhu

机构 * University of Oxford(牛津大学) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于ECG的世界模型,用于条件化预测心脏电生理学,通过整合生理学普通微分方程先验知识,提升干预后ECG轨迹的生理合理性,并引入不确定性评估策略以更可靠地评估候选干预方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17070 2026-05-19 cs.CV 77%

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准

Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

机构 * X-Humanoid Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Monash University(墨尔本大学) Celonis AI University of New South Wales(新南威尔士大学)

专题命中 机器人数据与评测 :embodied agent(abstract);manipulation(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08925 2026-05-19 cs.CV 77%

ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings

ClickSeg3D: 通过语义嵌入实现少点击交互分割

Xueyang Kang, Zijian Yu, Kourosh Khoshelham, Liangliang Nan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) University of Science and Technology of China(中国科学技术大学) Faculty of Architecture and the Built Environment, Delft University of Technology(代尔夫特理工大学建筑与环境学院)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出ClickSeg3D,通过语义嵌入实现高效3D实例分割,采用点集直接处理和多对象点击联合推理,提升分割精度与效率,适用于实时应用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09826 2026-05-19 cs.AI cs.MA 74%

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

EnactToM:一种用于具身智能体功能理论之心的演进基准

Gurusha Juneja, Dylan Lu, Saaket Agashe, Parth Diwane, Edward Gunn, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Yali Du, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) King’s College London(伦敦国王学院) Cisco Research(思科研究)

专题命中 机器人数据与评测 :embodied agent(title);分类 cs.AI

AI总结 本文提出EnactToM基准,用于测试具身智能体的功能理论之心能力,通过300个3D家庭环境任务验证解决能力和认知深度,揭示了现有模型在隐含信念上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG 67%

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18132 2026-05-19 cs.CV cs.AI 62%

Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models

谁生成了这个3D资产?学习生成3D模型的来源归属

Sihan Ma, Siyuan Liang, Dacheng Tao

机构 * College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 该研究提出了一种方法,用于确定给定3D资产是由哪种生成模型创建的,通过构建首个被动来源归属基准,发现生成3D模型留下稳定的指纹特征,从而建立了可信的3D内容来源的新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18045 2026-05-19 cs.RO cs.AI 62%

Confidence-Gated Robot Autonomy: When Does Uncertainty Actually Help?

置信度门控机器人自主性:不确定性何时真的有帮助?

Johannes A. Gaus, Jhon P. F. Charaja, Daniel Haeufle

机构 * Hertie Institute for Clinical Brain Research & Center for Integrative Neuroscience, University of Tübingen(赫尔特研究所临床脑研究与整合神经科学中心,图宾根大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了不确定性在机器人自主性决策中的作用,发现当基础模型具备一定能力时,简单的不确定性代理足以实现选择性门控,但无法用于语义新颖性检测。

Comments ICRA 2026 workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏