arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-28 至 2026-04-28 共收录 25 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 25 篇

2604.24039 2026-04-28 cs.LG cs.AI cs.CL 84%

AgenticCache: Cache-Driven Asynchronous Planning for Embodied AI Agents

AgenticCache: 基于缓存的异步规划用于具身AI代理

Hojoon Kim, Yuheng Wu, Thierry Tambe

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 机器人数据与评测 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticCache框架,利用缓存重用计划以减少LLM调用,提升任务成功率22%并降低延迟与成本。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23696 2026-04-28 cs.RO cs.SY eess.SY 79%

Real-Time Non-Contact Force Compensation for Wrist-Mounted Force/Torque Sensors in Haptic-Enabled Robotic Surgery Training

用于力/扭矩传感器在触觉增强外科手术培训中的实时非接触力补偿

Walid Shaker, Mustafa Suphi Erden

机构 * School of Engineering and Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞-瓦特大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种基于递归最小二乘法的实时补偿方法,用于解决腕部力/扭矩传感器在触觉反馈训练中的非接触力干扰问题,实验显示其在力和扭矩补偿上的误差降低率分别超过95%和91%。

Comments Submitted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23570 2026-04-28 cs.RO 77%

EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

EgoLive:一个大规模的第一人称视角数据集,源自现实世界的人类任务

Yihang Li, Xuelong Wei, Jingzhou Luo, Yingjing Xiao, Yibo Bai, Guangyuan Zhou, Teng Zou, Chenguang Gui, Jiajun Wen, He Zhang, Kangliang Chen, Xing Pan, Shuaiyan Liu, Daming Wang, Tao An, Jiayi Li, Shibo Jin, Wanwan Zhang, Tianyu Wang, Boren Wei, Zhixuan Huang, Fangsheng Liu, Ruodai Li, Hui Zhang, Anson Li, Yicheng Gong, Peng Cao, Jiaming Liang, Liang Lin

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出EgoLive数据集,用于机器人操作学习,具有大规模、高质量、真实场景采集等优势,推动通用机器人模型突破和实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 76%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI 73%

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23432 2026-04-28 cs.CV cs.AI 73%

Sphere-Depth: A Benchmark for Depth Estimation Methods with Varying Spherical Camera Orientations

球面深度:一种用于具有变化球面相机姿态的深度估计方法的基准

Soulayma Gazzeh, Giuseppe Mazzola, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering, University of Palermo, Palermo, Italy(帕尔梅罗大学工程系)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Sphere-Depth基准,评估单目深度估计模型在球面图像中的鲁棒性,通过模拟相机姿态扰动和深度校准误差协议,发现即使专门处理球面图像的模型在姿态变化下也表现不佳。

Comments Preprint

Journal ref CAIP 2025, LNCS, vol 15621. Springer (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24729 2026-04-28 cs.LG 70%

SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning

SpecRLBench: 一种用于规范引导强化学习中泛化能力的基准测试

Zijian Guo, İlker Işık, H. M. Sabbir Ahmad, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出SpecRLBench基准测试,用于评估基于线性时序逻辑的规范引导强化学习方法的泛化能力,涵盖导航和操作领域多个难度层级,包含静态和动态环境、多样机器人动力学和观测模态,通过实验揭示现有方法的优缺点及复杂性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24706 2026-04-28 eess.SY cs.LG cs.RO cs.SY 62%

Exploiting Differential Flatness for Efficient Learning-based Model Predictive Control of Constrained Multi-Input Control Affine Systems

利用微分平坦性实现受限多输入控制仿射系统的高效基于学习的模型预测控制

Tobias A. Farger, Adam W. Hall, Angela P. Schoellig

机构 * Learning Systems and Robotics Lab at the Technical University of Munich(慕尼黑技术大学学习系统与机器人实验室) Learning Systems and Robotics Lab at the University of Toronto Institute for Aerospace Studies (UTIAS) and the Vector Institute for Artificial Intelligence(多伦多航空航天研究所(UTIAS)和向量人工智能研究所的学习系统与机器人实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出利用微分平坦性改进基于学习的模型预测控制,通过系统扩展和块对角成本公式,有效控制多输入非线性仿射系统,并保证概率Lyapunov减小。

Comments Accepted for publication in 2026 European Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21421 2026-04-28 cs.RO cs.AI 62%

HyReach: Vision-Guided Hybrid Manipulator Reaching in Unseen Cluttered Environments

HyReach:基于视觉的混合机械臂在未见的杂乱环境中实现稳健的开放世界物体抓取

Shivani Kamtikar, Kendall Koe, Justin Wasserman, Samhita Marri, Benjamin Walt, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Skild AI

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种实时混合刚柔连续机械臂系统,通过视觉感知与3D场景重建结合形状感知运动规划,实现鲁棒的开放世界物体抓取,实验表明在杂乱环境中误差低于2厘米。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23604 2026-04-28 cs.CV cs.RO 62%

Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

学习识别分布外对象以进行3D激光雷达异常分割

Simone Mosco, Daniel Fusaro, Alberto Pretto

机构 * University of Padova(帕多瓦大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种高效方法,直接在特征空间中操作,通过建模内类特征分布来约束异常样本,同时引入混合真实-合成数据集以解决3D激光雷达异常分割中的领域差距问题。

Comments This paper has been accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07371 2026-04-28 cs.RO cs.AI 62%

ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning

ESPADA:通过语义感知演示数据下采样提升执行速度的模仿学习

Byung-ju Kim, Jinu Pahk, Chungwoo Lee, Jaejoon Kim, Jangha Lee, Theo Taeyeong Kim, Kyuhwan Shim, Jun Ki Lee, Byoung-Tak Zhang

机构 * Tommoro Robotics(Tommoro机器人公司) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 ESPADA通过语义和空间感知框架,利用VLM-LLM管道对演示进行分段,仅在非关键部分进行激进下采样,保持关键阶段的精度,无需额外数据或架构修改,实现约2倍的执行速度提升。

Comments project page: https://project-espada.github.io/espada/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13713 2026-04-28 cs.RO cs.CV 62%

SLAM&Render: A Benchmark for the Intersection Between Neural Rendering, Gaussian Splatting and SLAM

SLAM&Render: 一个用于神经渲染、高斯点绘和SLAM交叉领域的基准数据集

Samuel Cerezo, Gaetano Meli, Tomás Berriel Martins, Kirill Safronov, Javier Civera

机构 * Technology \& Innovation Center KUKA Deutschland GmbH Augsburg, Germany

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SLAM&Render数据集,用于评估神经渲染和SLAM在多模态、多视角和光照条件下的交叉方法,包含40个序列的RGB-D图像、IMU数据和机器人运动数据,验证了该数据集在新兴研究领域的相关性。

Comments 9 pages, 8 figures, 7 tables. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 62%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 62%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24674 2026-04-28 cs.RO 57%

Pushing Radar Odometry Beyond the Pavement: Current Capabilities and Challenges

超越路面的雷达里程计:当前能力和挑战

Shaunak Kolhe, Peng Jiang, Maggie Wigness, Philip Osteen, Timothy Overbye, Chrisitan Ellis, Srikanth Saripalli

机构 * Texas A&M University(德克萨斯理工大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文研究雷达在非公路环境中的里程计潜力,提出两个基线方法以应对复杂运动和地面回波问题,实验表明其在挑战性路线中提升轨迹估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24590 2026-04-28 cs.LG cs.CE 57%

Fraud Detection in Cryptocurrency Markets with Spatio-Temporal Graph Neural Networks

利用时空图神经网络进行加密货币市场欺诈检测

Lidia Losavio, Luca Persia, Madan Sathe, Dimosthenis Pasadakis

机构 * 1 Faculty of Informatics, Universit\` a della Svizzera italiana , Lugano, Switzerland 2 School of Management Law, Zurich University of Applied Sciences, Zurich, Switzerland

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出利用时空图神经网络检测加密货币市场欺诈,通过聚合小时级数据构建图结构,结合注意力机制和Transformer编码提升欺诈检测性能。

Comments 9 pages, 3 figures, Accepted at the SDS2026: IEEE Swiss Conference on Data Science and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 57%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16518 2026-04-28 cs.CL cs.AI 57%

CUB: Benchmarking Context Utilisation Techniques for Language Models

CUB:语言模型上下文利用技术的基准测试

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Seoul National University(首尔国立大学) University of Copenhagen(哥本哈根大学) Ewha Womans University(成均馆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CUB基准,用于评估语言模型在不同噪声上下文下的上下文利用技术,发现现有方法在真实场景中存在不足,需更全面的测试。

Comments Accepted at ACL 2026, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16958 2026-04-28 cs.CV 57%

TwinLiteNet+: An Enhanced Multi-Task Segmentation Model for Autonomous Driving

TwinLiteNet+: 一种增强的多任务分割模型用于自动驾驶

Quang-Huy Che, Duc-Tri Le, Minh-Quan Pham, Vinh-Tiep Nguyen, Duc-Khai Lam

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出TwinLiteNet+,一种高效的多任务分割模型,用于实时自动驾驶中的可行驶区域和车道标记分割,通过混合编码器架构和轻量级上采样模块提升精度与效率。

Journal ref Computers and Electrical Engineering 128 (2025) 110694

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24188 2026-04-28 cs.RO cs.GR 57%

Generalizable Friction Coefficient Estimation via Material Embedding and Proxy Interaction Modeling

通过材料嵌入和代理交互建模实现通用摩擦系数估计

Zhendong Wang, Huamin Wang

机构 * Style3D Research(Style3D研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出基于代理材料的摩擦系数估计框架,通过材料嵌入和融合函数实现高效预测,减少实验成本并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24018 2026-04-28 cs.RO 57%

Betting for Sim-to-Real Performance Evaluation

为仿真到现实性能评估进行投注

Zaid Mahboob, Yujia Chen, Bowen Weng

机构 * Iowa State University(爱荷华州立大学) U.S. Department of Commerce, National Institute of Standards and Technology(美国商务部国家标准化与技术研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文通过投注视角研究机器人性能评估问题,提出理论支持的实用近似方法,展示如何通过合成分布推断现实中的机械臂抓取精度,验证了方法的有效性。

Comments Accepted to RSS 2026, with DOI pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04424 2026-04-28 cs.CL cs.AI 57%

EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models

EmoBench-M:多模态大语言模型情感智能评估基准

He Hu, Lianzhong You, Hongbo Xu, Qianning Wang, Fei Richard Yu, Fei Ma, Zebang Cheng, Zheng Lian, Yucheng Zhou, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Auckland University of Technology(奥克兰理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SKL-IOTSC, CIS, University of Macau(澳门科学技术大学SKL-IOTSC、CIS)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文提出EmoBench-M,通过建立心理理论基础,评估多模态大语言模型在13种场景中的情感识别、理解及社会复杂情感分析能力,揭示模型在情感智能方面的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23033 2026-04-28 cs.RO 57%

Equivariant Filter for Radar-Inertial Odometry

雷达-惯性里程计的等变滤波器

Giulio Delama, Jan Michalczyk, Morten Nissov, Martin Scheiber, Alessandro Fornasier, Kostas Alexis, Stephan Weiss

机构 * Hexagon Robotics, Zurich, Switzerland(瑞士茨里希霍克斯集团机器人技术有限公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于李群对称性的等变滤波器EqF,用于改进雷达-惯性里程计RIO,通过几何耦合导航状态与IMU偏置,提升鲁棒性和初始化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22973 2026-04-28 cs.RO 57%

Collaborative Trajectory Prediction via Late Fusion

通过晚期融合进行协作轨迹预测

Nadya Abdel Madjid, Murad Mebrahtu, Zakhar Yagudin, Bilal Hassan, Naoufel Werghi, Jorge Dias, Dzmitry Tsetserukou, Majid Khonji

机构 * Khalifa University, Computer Science(卡利法大学,计算机科学) New York University Abu Dhabi, Computer Science(纽约大学阿布扎赫德分校,计算机科学) Khalifa University, Computer and Information Engineering(卡利法大学,计算机与信息工程) Khalifa University, KUCARS-KU Center for Autonomous Robotic Systems, Department of Computer Science(卡利法大学,KUCARS-KU自主机器人系统中心,计算机科学系) Skolkovo Institute of Science, Intelligent Space Robotics Laboratory, Center for Engineering Systems and Sciences, and Technology(斯科尔科沃科学研究所,智能空间机器人实验室,工程系统与科学中心,和技术)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出通过将协作从感知阶段转移到预测模块,并引入晚期融合框架来减少不确定性,提升轨迹预测的准确性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏