arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-28 至 2026-05-28 共收录 17 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 17 篇

2605.27589 2026-05-28 cs.CV 84%

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

What-If World: 具身场景中通用世界模型的因果基准

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

机构 * UCLA(加州大学洛杉矶分校) University of Tennessee(田纳西大学) Amazon(亚马逊)

专题命中 机器人数据与评测 :world model(title,comments);manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出 What-If World 基准,通过成对提示测试视频生成模型在物理变化下的因果一致性,发现现有模型在因果干预上表现不佳。

Comments 38 pages, World Model Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05012 2026-05-28 cs.RO physics.comp-ph physics.flu-dyn 84%

Realizing Robotic Swimming with Unified Fluid-Robot Multiphysics

实现统一流体-机器人多物理场的水下机器人游泳

Jeong Hun Lee, Junzhe Hu, Sofia Kwok, Carmel Majidi, Zachary Manchester

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract,comments);分类 cs.RO

AI总结 提出一个可微分的统一流体-机器人多物理场仿真框架,通过最小作用量原理联合推导耦合的机械臂和不可压缩Navier-Stokes方程,并利用离散变分力学和隐函数定理实现稳定、准确的联合仿真与梯度计算,成功优化仿生鳗鱼机器人的波动游泳和高动态C形逃逸动作,并验证了从仿真到实物的迁移。

Comments 9 pages, 10 figures, accepted to Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28237 2026-05-28 cs.RO cs.CV 81%

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

POINav: 在真实世界视觉语言导航中基准测试与增强最终米级到达

Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao, Mingchao Sun, Yanfen Shen, Zedong Chu, Zhining Gu, Wei Guo, Xiaolong Cheng, Qiming Li, Kangning Niu, Yanqing Zhu, Xiaolong Wu, Tianlun Li, Mu Xu

机构 * Amap CV Lab, Alibaba Group(阿里集团阿里的Amap视觉实验室)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 针对真实世界POI导航的“最后几米”挑战,提出首个闭环评估基准POINav-Bench,并设计脑-动作框架结合70K真实标志-入口数据对,实现高保真度导航。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27759 2026-05-28 cs.RO 77%

Colosseum V2: Benchmarking Generalization for Vision Language Action Models

Colosseum V2:视觉语言动作模型的泛化能力基准测试

Jeremy Morgan, Prajwal Vijay, Hyeonho Oh, Jincen Song, Ashvin Arora, Alina Du, Gaurav Sukhatme, Jesse Thomason, Ishika Singh

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical Engineering, Indian Institute of Technology Madras(印度理工学院Madras分校电子工程系) Fu Foundation School of Engineering and Applied Science, Columbia University(哥伦比亚大学工程与应用科学学院)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出Colosseum V2大规模仿真基准,通过28个任务和两种机器人形态,系统评估VLA模型在分布偏移下的泛化能力,揭示其在高层次理解与鲁棒行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28110 2026-05-28 cs.RO 70%

STR Robot: Design of an Autonomous Mobile Robot from Simulation to Reality

STR机器人:从仿真到现实的自主移动机器人设计

Vinh Nguyen, Gia-Uy Le, Tien-Dat Nguyen, Tri-Tin Nguyen, Vinh-Hao Nguyen

机构 * Faculty of Electrical and Electronic Engineering, Ho Chi Minh City University of Technology, VNU-HCM(电子工程学院,胡志明市技术大学,VNU-HCM)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于现有机械平台的自主移动机器人仿真到现实实现方法,重点开发机载控制、自定位和自主导航系统,并通过仿真和实验验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14075 2026-05-28 cs.RO cs.SY eess.SY 70%

RCM Constraint-Consistent Dynamic Control in Surgical Robots

手术机器人中的RCM约束一致性动态控制

Yu Li, Hamid Sadeghian, Zewen Yang, Valentin Le Mesle, Sami Haddadin

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich, Germany(慕尼黑机器人与机器智能研究所,慕尼黑技术大学,德国) Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 将远程运动中心(RCM)建模为流变完整约束,并集成到基于投影的逆动力学控制器中,实现扭矩层面的约束一致控制,降低RCM残差并平滑扭矩曲线。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28387 2026-05-28 cs.LG cs.AI cs.NE 62%

CLANE: Continual Learning of Actions on Neuromorphic Hardware from Event Cameras

CLANE: 基于事件相机在神经形态硬件上的动作持续学习

Elvin Hajizada, Michael Neumeier, Edward Paxon Frady, Yulia Sandamirskaya, Axel von Arnim, Bing Li, Eyke Hüllermeier

机构 * Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) fortiss GmbH, Neuromorphic Computing(fortiss GmbH 神经形态计算部门) Technical University of Munich, TUM School of CIT(慕尼黑技术大学 CIT 学院) Intel Labs, Intel Corporation(英特尔实验室,英特尔公司) Institute of Computational Life Sciences (ICLS), Zurich University of Applied Sciences (ZHAW)(应用科学大学(ZHAW)计算生命科学研究所) Technische Universität Ilmenau, Resource-Efficient Artificial Intelligence Group(伊门豪大学资源高效人工智能小组) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出CLANE系统,在Intel Loihi 2神经形态芯片上实现端到端的持续学习,用于事件相机动作识别,通过尖峰CNN和新型Loihi 2模块实现高能效和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05642 2026-05-28 cs.RO cs.AI 62%

Relational Semantic Reasoning on 3D Scene Graphs for Open World Interactive Object Search

基于3D场景图的开放世界交互式物体搜索的关系语义推理

Imen Mahdi, Matteo Cassinelli, Fabien Despinoy, Tim Welschehold, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出SCOUT方法,通过从LLM蒸馏的关系探索启发式直接搜索3D场景图,实现高效开放世界交互式物体搜索,性能匹配LLM且计算高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02259 2026-05-28 cs.LG cs.CV 62%

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

聚焦分割:在干扰物存在下引导潜在动作模型

Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV、cs.LG

AI总结 针对动作相关视觉干扰导致潜在动作模型失效的问题,提出MaskLAM方法,利用分割基础模型(如SAM)零样本获取智能体掩码,限制重建目标于智能体像素,迫使潜在动作编码内源动态,显著提升下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02857 2026-05-28 cs.CV cs.AI cs.CY 62%

Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024

Deepfake-Eval-2024:2024年传播的深度伪造多模态野外基准

Nuria Alina Chandra, Hannah Lee, Ryan Murtfeldt, Lin Qiu, Arnab Karmakar, Emmanuel Tanumihardja, Kevin Farhat, Ben Caffee, Changyeon Lee, Jongwook Choi, Sejin Paik, Aerin Kim, Oren Etzioni

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Maryland(马里兰大学) Chung-Ang University(Chung-Ang 大学) Georgetown University(乔治城大学) Miraflow AI

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 针对现有学术基准过时且不反映真实深度伪造的问题,提出包含2024年社交媒体和用户提交的多模态深度伪造基准Deepfake-Eval-2024,评估发现开源模型性能大幅下降,而商业模型和微调模型表现更优但未达到专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28548 2026-05-28 cs.CV 57%

GEM: Generative Supervision Helps Embodied Intelligence

GEM: 生成式监督助力具身智能

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu, Diankun Wu, Zhengyi Wang, Xumin Yu, Yongming Rao, Han Hu, Jun Zhu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出GEM模型,通过在视觉语言模型预训练中引入深度图生成任务,联合训练以提升具身智能的语义理解与物理操作能力,并发布大规模数据集GEM-4M,在多个基准上取得最优结果。

Comments Project Page: https://zhaorw02.github.io/GEM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28330 2026-05-28 cs.RO 57%

Chance-Constrained MPPI under State and Dynamic Object Prediction Uncertainty and the Evaluation of Collision Risk Calibration

状态与动态物体预测不确定性下的机会约束MPPI及碰撞风险校准评估

Benjamin Serfling, Konrad Doll, Kati Radkhah-Lens

机构 * Faculty of Engineering and Informatics, University of Applied Sciences Aschaffenburg(应用科学阿施芬堡大学工程与信息学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 针对机会约束MPPI控制中上游不确定性校准不足导致的过自信或过保守问题,提出DUCCT-MPPI架构,通过无迹变换和蒙特卡洛聚合联合集成定位与动态障碍预测不确定性,在仿真中实现鲁棒导航,成功率提升28%。

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28257 2026-05-28 cs.CV 57%

Category-Level 3D Correspondence in Camera Space via Morphable Object Priors

基于可变形对象先验的相机空间类别级3D对应

Leonhard Sommer, Artur Jesslen, Basavaraj Sunagad, Adam Kortylewski

机构 * University of Freiburg, Germany(弗赖堡大学,德国) CISPA Helmholtz Center for Information Security, Germany(信息安全部署中心,德国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 通过学习共享可变形对象先验,从单张图像预测类别内实例间一致的3D位置,无需显式对应监督,并在新基准HouseCorr3D上达到最优。

Comments 14 pages, 4 figures. Data and code are publicly available at https://github.com/GenIntel/HouseCorr3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14340 2026-05-28 cs.RO 57%

Field evaluation and optimization of a lightweight autonomous lidar-based UAV system based on a rigorous experimental setup in boreal forest environments

基于严格实验设置的轻量级自主激光雷达无人机系统在北方森林环境中的现场评估与优化

Aleksi Karhunen, Teemu Hakala, Väinö Karjalainen, Eija Honkavaara

机构 * Finnish Geospatial Research Institute in National Land Survey of Finland(芬兰地理研究 institute 在芬兰国家土地测绘局)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 提出标准化实验设置评估自主林下无人机系统,通过轻量级激光雷达四旋翼在北方森林中的93次真实飞行验证,优化后系统在中难度森林中1m/s和2m/s速度下成功率分别为12/15和15/15,在困难森林中为12/15和5/15。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12649 2026-05-28 cs.RO cs.SY eess.SY 57%

Bayesian Optimization Parameter Tuning Framework for a Lyapunov Based Path Following Controller

基于Lyapunov的路径跟踪控制器的贝叶斯优化参数调优框架

Zhewen Zheng, Wenjing Cao, Hongkang Yu, Mo Chen, Takashi Suzuki

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对非线性几何控制器中参数相互依赖导致手动调优效率低的问题,提出一种将闭环系统视为黑箱、利用高斯过程代理模型进行贝叶斯优化的数据高效调优方法,并在本田AI-Formula三轮机器人上验证了其在32次试验内提升控制器性能的有效性。

Comments The authors request withdrawal because the current arXiv version does not reflect the complete and finalized authorship record of the manuscript. The author list and contribution record require correction before further public dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14090 2026-05-28 stat.ML cs.LG 57%

Surrogate modeling for Bayesian optimization beyond a single Gaussian process

超越单一高斯过程的贝叶斯优化代理建模

Qin Lu, Konstantinos D. Polyzos, Bingcong Li, Georgios B. Giannakis

机构 * Dept. of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 提出一种基于高斯过程集成(EGP)的自适应代理模型,结合汤普森采样(TS)进行贝叶斯优化,以增强表达能力和并行性,并建立了贝叶斯遗憾分析。

Comments This version added some minor corrections and clarifications to the proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12154 2026-05-28 cs.CL 50%

Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs

基于嵌入的主题建模和LLM分析癌症患者的体验

Teodor-Călin Ionescu, Lifeng Han, Jan Heijdra Suasnabar, Anne Stiggelbout, Suzan Verberne

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS),莱顿,荷兰) Leiden University Medical Center (LUMC), Leiden, The Netherlands(莱顿大学医学中心(LUMC),莱顿,荷兰)

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本研究利用BERTopic和Top2Vec等神经主题建模方法,结合LLM(GPT4)进行主题标注,从癌症患者访谈数据中提取有意义主题,并评估不同嵌入模型的效果,发现领域特定的BioClinicalBERT嵌入能提高主题精度和可解释性。

Comments accepted by the CLIN journal. The CLIN Journal is the journal for research in computational linguistics in The Netherlands and Belgium

详情

展开后加载摘要…

URL PDF HTML 收藏