arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-17 至 2026-04-17 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14 篇

2512.15207 2026-04-17 eess.SY cs.SY 50%

Remote Magnetic Levitation Using Reduced Attitude Control and Parametric Field Models

远程磁悬浮使用简化姿态控制与参数场模型

Neelaksh Singh, Jasan Zughaibi, Denis von Arx, Bradley J. Nelson, Michael Muehlebach

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种利用参数分析模型实现远程磁悬浮控制的方法,通过线性二次调节器稳定平移运动,并采用非线性控制器调节简化姿态,实现大空间角度的可靠跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14637 2026-04-17 cs.HC 50%

Touching Space: Accessible Map Exploration Through Conversational Audio-Haptic Interaction

触碰空间:通过对话式音频-触觉交互实现可访问的地图探索

Li Liu, Jiaming Qu, Marc Jowell Bagaoisan, David T. Lee, Leilani H. Gilpin

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出Touching Space系统,通过触觉和音频反馈帮助视障人士构建环境认知地图,支持在普通硬件上实现空间探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14491 2026-04-17 physics.flu-dyn 50%

Measurements and modeling of swimming speed dependence on stroke frequency in scyphozoan jellyfish

水母的游泳速度与摆动频率的测量与建模

Noa K. Yoder, John O. Dabiri

专题命中 具身导航 :robotics(abstract)

AI总结 研究水母游泳速度与摆动频率的关系,发现两种水母物种在自然摆动频率不同但速度-频率关系相似,提出新的分析模型更符合实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 2 篇

2604.14811 2026-04-17 cs.LG cs.MA cs.NI 79%

Learning Ad Hoc Network Dynamics via Graph-Structured World Models

通过图结构世界模型学习随机网络动态

Can Karacelebi, Yusuf Talha Sahin, Elif Surer, Ertan Onur

机构 * Department of Computer Engineering, Middle East Technical University, Ankara, Turkiye(中东部技术大学计算机工程系) Graduate School of Informatics, Middle East Technical University, Ankara, Turkiye(中东部技术大学信息学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出G-RSSM模型,通过图结构学习无线网络动态,应用于聚类任务,展示在不同规模网络中有效维持连通性。

Comments 6 pages, 4 figures. Submitted to the IEEE Global Communications Conference (GLOBECOM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14268 2026-04-17 cs.CV 79%

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

HY-World 2.0:一个多模态世界模型用于重建、生成和模拟3D世界

Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang, Junta Wu, Zhenyang Liu, Yuning Gong, Yang Liu, Bo Yuan, Chao Zhang, Coopers Li, Dongyuan Guo, Fan Yang, Haiyu Zhang, Hang Cao, Jianchen Zhu, Jiaxin Lin, Jie Xiao, Jihong Zhang, Junlin Yu, Lei Wang, Lifu Wang, Lilin Wang, Linus, Minghui Chen, Peng He, Penghao Zhao, Qi Chen, Rui Chen, Rui Shao, Sicong Liu, Wangchen Qin, Xiaochuan Niu, Xiang Yuan, Yi Sun, Yifei Tang, Yifu Sun, Yihang Lian, Yonghao Tan, Yuhong Liu, Yuyang Yin, Zhiyuan Min, Tengfei Wang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 HY-World 2.0通过多模态输入生成高保真3D场景,改进了先前版本,引入了多项创新以提升全景真实性、3D场景理解和规划能力,并升级了WorldStereo和WorldMirror模型,实现了3D世界交互探索。

Comments Project Page: https://3d-models.hunyuan.tencent.com/world/ ; Code: https://github.com/Tencent-Hunyuan/HY-World-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2511.14178 2026-04-17 cs.RO cs.AI 73%

Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion

迈向无需微调的VLA部署:通过具身进化扩散实现即插即用的推理时VLA策略引导

Zhuo Li, Junjia Liu, Zhipeng Dong, Tao Teng, Quentin Rouxel, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong(协作与多功能机器人实验室,T-Stone机器人研究所,香港中文大学,香港) Φ \Phi -Institute for Physical Human Intelligence(物理人机智能研究所) Center for Embodied Artificial Intelligence and Computer Vision, Shenzhen Loop Area Institute, Shenzhen, China(具身人工智能与计算机视觉中心,深圳环园研究院,深圳,中国) Department of Advanced Robotics, Istituto Italiano di Tecnologia, Genoa, Italy(先进机器人系,意大利理工学院,热那亚,意大利)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出VLA-Pilot方法,通过即插即用的策略引导实现无需微调的零样本部署,提升预训练VLA在不同任务和机器人平台上的表现。

Comments 9 pages, 8 figures, submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 6 篇

2411.00361 2026-04-17 cs.LG 77%

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03897 2026-04-17 cs.RO cs.AI cs.CL cs.HC cs.LG 71%

IROSA: Interactive Robot Skill Adaptation using Natural Language

IROSA: 基于自然语言的交互机器人技能适应

Markus Knauer, Samuel Bustamante, Thomas Eiband, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出IROSA框架,利用预训练大语言模型实现开放词汇技能适应,通过工具架构在语言模型与机器人硬件间保持抽象层,无需微调即可通过自然语言指令调整机器人技能。

Comments Accepted IEEE Robotics and Automation Letters (RA-L) journal, 8 pages, 5 figures, 3 tables, 1 listing. Code available: https://github.com/DLR-RM/IROSA

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 62%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20869 2026-04-17 cs.LG cs.AI 62%

Model-Based Reinforcement Learning under Random Observation Delays

基于模型的强化学习在随机观测延迟下的应用

Armin Karamzade, Kyungmin Kim, JB Lanier, Davide Corsi, Roy Fox

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学尔湾分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了POMDPs中的随机传感器延迟问题,提出了一种基于模型的过滤过程和延迟感知框架,以提升强化学习在随机延迟环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15289 2026-04-17 cs.RO 57%

Abstract Sim2Real through Approximate Information States

通过近似信息状态实现抽象sim2real

Yunfu Deng, Yuhao Li, Josiah P. Hanna

机构 * Prediction and Action Lab (PAL)(预测与行动实验室) University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了在抽象模拟器中通过强化学习训练政策并成功迁移到现实世界的问题,提出了一种利用真实任务数据修正抽象模拟器动力学的方法,实现了sim2sim和sim2real的政策迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15201 2026-04-17 cs.LG 57%

RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning

RL-STPA:将系统理论危害分析适应于安全关键强化学习

Steven A. Senczyszyn, Timothy C. Havens, Nathaniel Rice, Jason E. Summers, Benjamin D. Werner, Benjamin J. Schumeg

机构 * Michigan Technological University(密歇根技术大学) ARiA DEVCOM

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出RL-STPA框架,通过分层子任务分解、覆盖引导扰动测试和迭代检查点,系统分析强化学习中的安全风险,提升安全关键应用的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2601.16870 2026-04-17 cs.RO 80%

A Multimodal Data Collection Framework for Dialogue-Driven Assistive Robotics to Clarify Ambiguities: A Wizard-of-Oz Pilot Study

一种多模态数据收集框架用于对话驱动的辅助机器人以澄清歧义:一项巫师-of-奥兹试点研究

Guangping Liu, Nicholas Hawkins, Billy Madden, Tipu Sultan, Flavio Esposito, Madi Babaiasl

机构 * Aerospace and Mechanical Engineering Department(航空航天与机械工程系) Computer Science Department(计算机科学系) Saint Louis University(圣路易斯大学)

专题命中 人机交互与遥操作 :robotics(title,comments);robotic(abstract);分类 cs.RO

AI总结 本文提出一种多模态数据收集框架,通过对话交互协议和双房间巫师-of-奥兹设置,模拟机器人自主性并捕捉自然用户行为,用于澄清对话驱动控制中的歧义问题。

Comments Accepted to IEEE RAS/EMBS 11th International Conference on Biomedical Robotics and Biomechatronics (BioRob) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 6 篇

2511.07412 2026-04-17 cs.CV cs.RO 81%

TwinOR: Photorealistic Digital Twins of Dynamic Operating Rooms for Embodied AI Research

TwinOR:动态手术室的逼真数字双胞胎用于具身AI研究

Han Zhang, Yiqing Shen, Roger D. Soberanis-Mukul, Ankita Ghosh, Hao Ding, Lalithkumar Seenivasan, Jose L. Porras, Zhekai Mao, Chenjia Li, Wenjie Xiao, Lonny Yarmus, Angela Christine Argento, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 机器人数据与评测 :embodied AI(title,abstract);分类 cs.RO、cs.CV

AI总结 TwinOR通过构建高保真的动态手术室数字双胞胎,为具身AI研究提供安全可控的仿真环境,实现厘米级精度的手术室几何重建与动态交互模拟,验证了其在视觉定位和几何理解任务中的真实感。

Journal ref International Journal of Computer Assisted Radiology and Surgery, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 73%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02738 2026-04-17 cs.RO cs.LG 73%

Flow with the Force Field: Learning 3D Compliant Flow Matching Policies from Force and Demonstration-Guided Simulation Data

流体与力场:从力和示范引导的仿真数据中学习3D顺应性流匹配策略

Tianyu Li, Yihan Li, Zizhe Zhang, Nadia Figueroa

机构 * GRASP Lab, University of Pennsylvania(GRASP实验室,宾夕法尼亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种框架,通过单人示范生成力引导的仿真数据,结合顺应性策略提升视觉模仿学习的性能,验证了在真实机器人任务中的可靠性与适应性。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15052 2026-04-17 cs.RO 57%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 5 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 57%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21025 2026-04-17 cs.CV 57%

CaptionQA: Is Your Caption as Useful as the Image Itself?

CaptionQA: 你的描述是否和它所代表的图像一样有用?

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Stanford University(斯坦福大学) Independent Researcher(独立研究者) Northwestern University(西北大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 CaptionQA通过评估生成描述在下游任务中的实用性,揭示了图像与描述之间的效用差距,涵盖四个领域,包含25个顶级和69个子类别,提供33,027个密集标注的多选问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 3 篇

2604.14308 2026-04-17 eess.SY cs.SY 78%

High Order Tuners for Adaptive Safety of Robotic Systems

高阶调节器用于机器人系统的自适应安全性

Mohammad Mirtaba, Max H. Cohen

专题命中 其他机器人 :robotic(title,abstract)

AI总结 本文提出高阶调节器用于改善自适应安全性的理论条件,通过解耦适应增益条件与系统初始条件,提升非线性系统在参数不确定性下的安全性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14868 2026-04-17 cs.RO 61%

4D Radar Gaussian Modeling and Scan Matching with RCS

四维雷达高斯建模与基于RCS的扫描匹配

Fernando Amodeo, Luis Merino, Fernando Caballero

机构 * Service Robotics Laboratory – Universidad Pablo de Olavide (Seville), Spain(奥尔塔大学塞维利亚分校服务机器人实验室)

专题命中 其他机器人 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出将RCS物理特性融入四维雷达高斯建模中,以提升场景信息总结和扫描匹配性能。

Comments This version is an Extended Abstract, sent to the Radar in Robotics: New Frontiers workshop of ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14400 2026-04-17 math.NA cs.CG cs.NA 50%

Bivariate range functions with superior convergence order

双变量范围函数与更优收敛阶

Bingwei Zhang, Thomas Chen, Kai Hormann, Chee Yap

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出基于泰勒、拉格朗日和赫尔米特插值的新双变量范围函数,实现立方和四次收敛阶,通过Julia实现并验证其效率与有效性。

Comments 23pages 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏