arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-28 至 2026-04-28 共收录 110 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 7 篇

2603.17834 2026-04-28 cs.RO cs.AI 81%

Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control

生成控制作为优化:用于自适应和鲁棒机器人控制的时间无条件流匹配

Zunzhe Zhang, Runhan Huang, Yicheng Liu, Shaoting Zhu, Linzhan Mou, Hang Zhao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Department of Computer Science, Princeton University, New Jersey, US(普林斯顿大学计算机科学系) Galaxea Inc., Beijing, China(Galaxea公司)

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 GeCO通过将动作合成转化为迭代优化,解决了传统流匹配在状态复杂度上计算效率低的问题,实现了自适应的计算分配和无监督的安全检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15483 2026-04-28 cs.LG cs.RO 81%

$π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

$π_{0.7}$: 一种可定向的通用机器人基础模型与涌现能力

Physical Intelligence, Bo Ai, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Greg Balke, Kevin Black, George Bokinsky, Shihao Cao, Thomas Charbonnier, Vedant Choudhary, Foster Collins, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Maitrayee Dhaka, Jared DiCarlo, Danny Driess, Michael Equi, Adnan Esmail, Yunhao Fang, Chelsea Finn, Catherine Glossop, Thomas Godden, Ivan Goryachev, Lachlan Groom, Haroun Habeeb, Hunter Hancock, Karol Hausman, Gashon Hussein, Victor Hwang, Brian Ichter, Connor Jacobsen, Szymon Jakubczak, Rowan Jen, Tim Jones, Gregg Kammerer, Ben Katz, Liyiming Ke, Mairbek Khadikov, Chandra Kuchi, Marinda Lamb, Devin LeBlanc, Brendon LeCount, Sergey Levine, Xinyu Li, Adrian Li-Bell, Vladislav Lialin, Zhonglin Liang, Wallace Lim, Yao Lu, Enyu Luo, Vishnu Mano, Nandan Marwaha, Aikys Mongush, Liam Murphy, Suraj Nair, Tyler Patterson, Karl Pertsch, Allen Z. Ren, Gavin Schelske, Charvi Sharma, Baifeng Shi, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, Will Stoeckle, Jiaming Tang, Jimmy Tanner, Shalom Tekeste, Marcel Torne, Kyle Vedder, Quan Vuong, Anna Walling, Haohuan Wang, Jason Wang, XuDong Wang, Chris Whalen, Samuel Whitmore, Blake Williams, Charles Xu, Sukwon Yoo, Lili Yu, Wuming Zhang, Zhuoyang Zhang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 $π_{0.7}$通过多样化的上下文条件训练,实现跨环境任务执行与零样本泛化,支持多阶段任务和复杂操作,如咖啡机操作,性能媲美专门强化学习微调模型。

Comments Website: https://www.pi.website/blog/pi07

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01581 2026-04-28 cs.RO cs.LG 62%

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV:基于运动学的具身VLA模型的推测解码

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan), Wuhan, China(中国地质大学(武汉)计算机科学学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出KERV框架,结合token域和运动学域预测,通过运动学卡尔曼滤波和动态调整策略提升VLA模型的推理速度,实验显示在多种任务中加速27%-37%且成功率损失极小。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 62%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 57%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 3 篇

2509.25358 2026-04-28 cs.RO 85%

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

SARM:面向长时间 horizon 的机器人操控阶段感知奖励建模

Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于视频的阶段感知奖励建模框架,通过自然语言子任务标注实现一致标签,提升长horizon任务的鲁棒性和泛化能力,实验表明其在真实世界和人类验证中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11218 2026-04-28 cs.RO 57%

Humanoid Whole-Body Badminton via Multi-Stage Reinforcement Learning

人形机器人多阶段强化学习实现全身体育羽毛球

Chenhao Liu, Leyun Jiang, Yibo Wang, Kairan Yao, Jinchen Fu, Xiaoyu Ren

机构 * Beijing Phybot Technology Co., Ltd(北京 Phybot 技术有限公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出多阶段强化学习框架,实现人形机器人羽毛球全身体术控制,通过三阶段课程学习协调步伐与击球,实验验证在仿真和硬件上均取得高精度击球性能。

Comments Project Page: https://humanoid-badminton.github.io/Humanoid-Whole-Body-Badminton-via-Multi-Stage-Reinforcement-Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23000 2026-04-28 cs.RO 57%

Learning from the Best: Smoothness-Driven Metrics for Data Quality in Imitation Learning

向最佳学习:用于模仿学习中数据质量的平滑驱动度量

Soham Kulkarni, Raayan Dhar, Yuchen Cui

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出RINSE框架,通过轨迹平滑度评估演示数据质量,改进模仿学习中的数据筛选与重加权,实验证明在不同任务中提升性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 7 篇

2505.20562 2026-04-28 cs.RO 81%

Developing a Robotic Surgery Training System for Wide Accessibility and Research

开发一种具有广泛可及性的机器人手术培训系统

Walid Shaker, Mustafa Suphi Erden

机构 * School of Engineering and Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫里奥特-沃森大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文提出了一种低成本的机器人腹腔镜培训系统,通过设计低成本的机器人末端执行器和数字孪生平台,提升远程和本地用户的训练效果,优化了遥操作控制,实现了高精度轨迹跟踪和实时监控。

Comments 6 pages, 2025 International Conference on Advanced Robotics and Mechatronics (ICARM), published

Journal ref 2025 International Conference on Advanced Robotics and Mechatronics (ICARM), pp. 7-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24648 2026-04-28 cs.RO 79%

Computational Design and Co-Robotic Fabrication for Material Reuse in Architecture

建筑中材料再利用的计算设计与协作机器人制造

Arash Adel, Daniel Ruan, Ruxin Xie

机构 * Princeton University(普林斯顿大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出整合数据驱动设计与反馈驱动协作机器人制造的框架,用于实现非标准结构的再利用木材加工,通过Timbrelyn案例展示木材再利用如何提升建筑表达。

Comments Accepted for publication in Proceedings of the 45th Annual Conference of the Association for Computer Aided Design in Architecture (ACADIA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23402 2026-04-28 cs.HC cs.RO 79%

Otherness as a Quality in Designing Expressive Robotic Touch

其他性作为设计表现性机器人触觉的特性

Ran Zhou, Laurens Boer, Daniel Leithinger, Madeline Balaam

机构 * KTH Royal Institute of Technology(皇家理工学院) IT University of Copenhagen(哥本哈根大学) Cornell University(康奈尔大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出将机器人触觉的固有其他性作为设计质量,通过分析艺术和设计先例,探讨如何通过设计策略塑造其他性,以促进表达性和启发性的触觉设计。

Comments Full paper accepted to 2026 ACM Designing Interactive Systems Conference (DIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23039 2026-04-28 cs.RO 70%

Control Barrier Functions Solved with Hierarchical Quadratic Programming for Safe Physical Human-Robot Interaction

通过分层二次规划解决控制屏障函数以实现安全的物理人机交互

Rui Luo, Jonas Mariager Jakobsen, Wesley Roozing, Federico Califano, Cheng Fang

专题命中 人机交互与遥操作 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出利用分层二次规划框架在物理人机交互中设计性能和安全任务,平衡安全与性能。通过实验证明该方法的有效性、灵活性和通用性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24527 2026-04-28 cs.AI 57%

Interoceptive machine framework: Toward interoception-inspired regulatory architectures in artificial intelligence

躯体觉机器框架:迈向人工智能中的躯体觉启发调节架构

Diego Candia-Rivera

机构 * Sorbonne Université(索邦大学) Paris Brain Institute (ICM)(巴黎脑研究所) CNRS(国家科学研究中心) INSERM(国家医学研究院) AP-HP(法国国家公共卫生机构)

专题命中 人机交互与遥操作 :embodied AI(abstract);分类 cs.AI

AI总结 本文提出基于躯体觉和具身AI的整合框架,旨在将生物体内状态调节原理转化为计算架构,提升人工智能系统的自我调节和情境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24002 2026-04-28 cs.HC cs.AI cs.MM 57%

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI

AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23803 2026-04-28 cs.CV 57%

Bringing a Personal Point of View: Evaluating Dynamic 3D Gaussian Splatting for Egocentric Scene Reconstruction

融入个人视角:评估动态3D高斯散射在眼动场景重建中的应用

Jan Warchocki, Xi Wang, Jonas Kulhanek, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学) TUM/MCML(慕尼黑工业大学/麦克斯·普朗克研究所) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.CV

AI总结 本文评估了动态单目3DGS模型在眼动和非眼动视频中的重建效果,发现眼动视角重建质量较低,原因在于模型更擅长静态内容而非动态场景。

Comments Accepted at the EgoVis Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 25 篇

2604.24039 2026-04-28 cs.LG cs.AI cs.CL 84%

AgenticCache: Cache-Driven Asynchronous Planning for Embodied AI Agents

AgenticCache: 基于缓存的异步规划用于具身AI代理

Hojoon Kim, Yuheng Wu, Thierry Tambe

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 机器人数据与评测 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticCache框架,利用缓存重用计划以减少LLM调用,提升任务成功率22%并降低延迟与成本。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23696 2026-04-28 cs.RO cs.SY eess.SY 79%

Real-Time Non-Contact Force Compensation for Wrist-Mounted Force/Torque Sensors in Haptic-Enabled Robotic Surgery Training

用于力/扭矩传感器在触觉增强外科手术培训中的实时非接触力补偿

Walid Shaker, Mustafa Suphi Erden

机构 * School of Engineering and Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞-瓦特大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种基于递归最小二乘法的实时补偿方法,用于解决腕部力/扭矩传感器在触觉反馈训练中的非接触力干扰问题,实验显示其在力和扭矩补偿上的误差降低率分别超过95%和91%。

Comments Submitted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23570 2026-04-28 cs.RO 77%

EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

EgoLive:一个大规模的第一人称视角数据集,源自现实世界的人类任务

Yihang Li, Xuelong Wei, Jingzhou Luo, Yingjing Xiao, Yibo Bai, Guangyuan Zhou, Teng Zou, Chenguang Gui, Jiajun Wen, He Zhang, Kangliang Chen, Xing Pan, Shuaiyan Liu, Daming Wang, Tao An, Jiayi Li, Shibo Jin, Wanwan Zhang, Tianyu Wang, Boren Wei, Zhixuan Huang, Fangsheng Liu, Ruodai Li, Hui Zhang, Anson Li, Yicheng Gong, Peng Cao, Jiaming Liang, Liang Lin

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出EgoLive数据集,用于机器人操作学习,具有大规模、高质量、真实场景采集等优势,推动通用机器人模型突破和实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 76%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI 73%

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23432 2026-04-28 cs.CV cs.AI 73%

Sphere-Depth: A Benchmark for Depth Estimation Methods with Varying Spherical Camera Orientations

球面深度:一种用于具有变化球面相机姿态的深度估计方法的基准

Soulayma Gazzeh, Giuseppe Mazzola, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering, University of Palermo, Palermo, Italy(帕尔梅罗大学工程系)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Sphere-Depth基准,评估单目深度估计模型在球面图像中的鲁棒性,通过模拟相机姿态扰动和深度校准误差协议,发现即使专门处理球面图像的模型在姿态变化下也表现不佳。

Comments Preprint

Journal ref CAIP 2025, LNCS, vol 15621. Springer (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24729 2026-04-28 cs.LG 70%

SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning

SpecRLBench: 一种用于规范引导强化学习中泛化能力的基准测试

Zijian Guo, İlker Işık, H. M. Sabbir Ahmad, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出SpecRLBench基准测试,用于评估基于线性时序逻辑的规范引导强化学习方法的泛化能力,涵盖导航和操作领域多个难度层级,包含静态和动态环境、多样机器人动力学和观测模态,通过实验揭示现有方法的优缺点及复杂性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24706 2026-04-28 eess.SY cs.LG cs.RO cs.SY 62%

Exploiting Differential Flatness for Efficient Learning-based Model Predictive Control of Constrained Multi-Input Control Affine Systems

利用微分平坦性实现受限多输入控制仿射系统的高效基于学习的模型预测控制

Tobias A. Farger, Adam W. Hall, Angela P. Schoellig

机构 * Learning Systems and Robotics Lab at the Technical University of Munich(慕尼黑技术大学学习系统与机器人实验室) Learning Systems and Robotics Lab at the University of Toronto Institute for Aerospace Studies (UTIAS) and the Vector Institute for Artificial Intelligence(多伦多航空航天研究所(UTIAS)和向量人工智能研究所的学习系统与机器人实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出利用微分平坦性改进基于学习的模型预测控制,通过系统扩展和块对角成本公式,有效控制多输入非线性仿射系统,并保证概率Lyapunov减小。

Comments Accepted for publication in 2026 European Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21421 2026-04-28 cs.RO cs.AI 62%

HyReach: Vision-Guided Hybrid Manipulator Reaching in Unseen Cluttered Environments

HyReach:基于视觉的混合机械臂在未见的杂乱环境中实现稳健的开放世界物体抓取

Shivani Kamtikar, Kendall Koe, Justin Wasserman, Samhita Marri, Benjamin Walt, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Skild AI

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种实时混合刚柔连续机械臂系统,通过视觉感知与3D场景重建结合形状感知运动规划,实现鲁棒的开放世界物体抓取,实验表明在杂乱环境中误差低于2厘米。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23604 2026-04-28 cs.CV cs.RO 62%

Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

学习识别分布外对象以进行3D激光雷达异常分割

Simone Mosco, Daniel Fusaro, Alberto Pretto

机构 * University of Padova(帕多瓦大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种高效方法,直接在特征空间中操作,通过建模内类特征分布来约束异常样本,同时引入混合真实-合成数据集以解决3D激光雷达异常分割中的领域差距问题。

Comments This paper has been accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07371 2026-04-28 cs.RO cs.AI 62%

ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning

ESPADA:通过语义感知演示数据下采样提升执行速度的模仿学习

Byung-ju Kim, Jinu Pahk, Chungwoo Lee, Jaejoon Kim, Jangha Lee, Theo Taeyeong Kim, Kyuhwan Shim, Jun Ki Lee, Byoung-Tak Zhang

机构 * Tommoro Robotics(Tommoro机器人公司) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 ESPADA通过语义和空间感知框架,利用VLM-LLM管道对演示进行分段,仅在非关键部分进行激进下采样,保持关键阶段的精度,无需额外数据或架构修改,实现约2倍的执行速度提升。

Comments project page: https://project-espada.github.io/espada/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13713 2026-04-28 cs.RO cs.CV 62%

SLAM&Render: A Benchmark for the Intersection Between Neural Rendering, Gaussian Splatting and SLAM

SLAM&Render: 一个用于神经渲染、高斯点绘和SLAM交叉领域的基准数据集

Samuel Cerezo, Gaetano Meli, Tomás Berriel Martins, Kirill Safronov, Javier Civera

机构 * Technology \& Innovation Center KUKA Deutschland GmbH Augsburg, Germany

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SLAM&Render数据集,用于评估神经渲染和SLAM在多模态、多视角和光照条件下的交叉方法,包含40个序列的RGB-D图像、IMU数据和机器人运动数据,验证了该数据集在新兴研究领域的相关性。

Comments 9 pages, 8 figures, 7 tables. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 62%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 62%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24674 2026-04-28 cs.RO 57%

Pushing Radar Odometry Beyond the Pavement: Current Capabilities and Challenges

超越路面的雷达里程计:当前能力和挑战

Shaunak Kolhe, Peng Jiang, Maggie Wigness, Philip Osteen, Timothy Overbye, Chrisitan Ellis, Srikanth Saripalli

机构 * Texas A&M University(德克萨斯理工大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文研究雷达在非公路环境中的里程计潜力,提出两个基线方法以应对复杂运动和地面回波问题,实验表明其在挑战性路线中提升轨迹估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏