arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-22 至 2026-04-22 共收录 53 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 16 篇

2604.19344 2026-04-22 cs.RO 57%

Quadruped Parkour Learning: Sparsely Gated Mixture of Experts with Visual Input

四足Parkour学习:带有视觉输入的稀疏门混合专家

Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文研究了将稀疏门混合专家架构应用于基于视觉的四足机器人Parkour,实验表明MoE架构在克服大障碍物时表现优于传统MLP,且在性能与计算效率之间取得良好平衡。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19148 2026-04-22 cs.RO 57%

Multi-Step Gaussian Process Propagation for Adaptive Path Planning

多步高斯过程传播用于自适应路径规划

Alex Beaudin, Bjørn Andreas Kristiansen, Kristoffer Gryte, Corrado Chiatante, Morten Omholt Alver, Murat Arcak, Tor Arne Johansen

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(挪威科技与自然大学(NTNU)工程控制系) Department of Electronic Systems, Norwegian University of Science and Technology (NTNU)(挪威科技与自然大学(NTNU)电子系统系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于高斯过程的多步路径规划方法OLAhGP,通过融合多模态环境传感数据和状态输入约束,提升自主水面舰在藻类监测中的路径规划效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12439 2026-04-22 cs.AI cs.MA 57%

Multi-agent Self-triage System with Medical Flowcharts

多代理自分级系统与医疗流程图

Yujia Liu, Sophia Yu, Hongyue Jin, Jessica Wen, Alexander Qian, Terrence Lee, Mattheus Ramsis, Gi Won Choi, Lianhui Qin, Xin Liu, Edward J. Wang

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) The Design Lab, University of California San Diego(加州大学圣地亚哥分校设计实验室) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Medicine, Kaiser Permanente(Kaiser 医疗集团医学部) Department of Radiation Oncology, University of California San Francisco(加州大学旧金山分校放射肿瘤学部) Department of Emergency Medicine, University of California San Francisco(加州大学旧金山分校急诊医学部) Division of Cardiology, Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学部心内科分会) Department of Orthopaedic Surgery, Korea University Ansan Hospital(韩国大学安山医院骨科部) Google Research, Seattle, WA, USA(谷歌研究(西雅图,华盛顿州)) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学校)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种多代理自分级系统,利用100个经临床验证的流程图提升医疗决策的准确性与透明度,通过检索、决策和聊天代理实现患者个性化推荐,实验显示在大规模合成数据集上达到高准确率。

Journal ref Nature Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12516 2026-04-22 cs.RO 57%

Zero to Autonomy in Real-Time: Online Adaptation of Dynamics in Unstructured Environments

从零到自主:在无结构环境中动态的在线适应

William Ward, Sarah Etter, Jesse Quattrociocchi, Christian Ellis, Adam J. Thorpe, Ufuk Topcu

机构 * Oden Institute for Computational Engineering & Science, University of Texas at Austin(德纳学院计算工程与科学研究所,德克萨斯大学奥斯汀分校) Department of Computer Science, University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种结合函数编码器和递推最小二乘法的在线适应方法,通过流式里程计更新潜变量,实现实时动态适应,提升在无结构环境中的安全性和规划效率。

Comments Initial submission to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2510.26782 2026-04-22 cs.LG cs.AI cs.CV 89%

Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models

克隆确定性世界:潜在几何在长周期世界模型中的关键作用

Zaishuo Xia, Yukuan Lu, Xinyi Li, Yifan Xu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校) Open Path AI Foundation(Open Path AI基金会)

专题命中 具身推理 :world model(title,summary_cn);embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Geometrically-Regularized World Models (GRWM),通过时间对比学习原理对潜在空间进行几何正则化,提升世界模型的克隆精度和稳定性,解决长周期高保真建模中的几何结构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19639 2026-04-22 eess.SY cs.AI cs.SY 83%

Safety-Critical Contextual Control via Online Riemannian Optimization with World Models

安全关键的上下文控制 via 在线黎曼优化与世界模型

Tongxin Li

机构 * Tongxin Li(李通心)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI

AI总结 本文研究安全关键的上下文控制问题,提出基于在线黎曼优化的样本惩罚预测控制框架,通过世界模型压缩可行性流形为密度,指导规划器梯度下降,建立基于曲率的安全界限。

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18564 2026-04-22 cs.CV 83%

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

多世界:可扩展的多智能体多视角视频世界模型

Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) Sreal AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 多世界框架通过多智能体控制模块和全局状态编码器,实现多智能体多视角视频世界建模,提升视频保真度和多视角一致性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05540 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.NE 77%

Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution

构建环境:通过信念-意图共演的认知规划

Shiyao Sang

机构 * Shiyao Sang(桑世尧)

专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于信念-意图共演的认知规划方法,通过MBCWM和TIWM模型实现环境与现实的认知一致性,提升自动驾驶规划性能并展现类人认知行为。

Comments 12 pages, 8 figures. A paradigm shift from reconstructing the world to understanding it: planning through Belief-Intent Co-Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 57%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2604.18791 2026-04-22 cs.LG cs.AI 81%

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19728 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.SE 70%

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

VLA Foundry:一种统一训练视觉-语言-动作模型的框架

Jean Mercat, Sedrick Keh, Kushal Arora, Isabella Huang, Paarth Shah, Haruki Nishimura, Shun Iwase, Katherine Liu

机构 * Toyota Research Institute(丰田研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。

Comments 32 pages, 16 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 3 篇

2505.21410 2026-04-22 cs.AI cs.LG cs.RO 75%

MRS: Multi-Resolution Skills for HRL Agents

MRS:多分辨率技能用于HRL智能体

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * DeepMind

专题命中 模仿学习与强化学习 :robotics(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出MRS多分辨率技能,通过学习多个固定时间跨度的目标预测模块,解决HRL中子目标选择精度与预测噪声的矛盾,提升长周期任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 70%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19730 2026-04-22 cs.LG cs.AI 62%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2604.19374 2026-04-22 cs.RO 79%

Achieving Interaction Fluidity in a Wizard-of-Oz Robotic System: A Prototype for Fluid Error-Correction

在Wizard-of-Oz机器人系统中实现交互流畅性:一种用于流畅错误纠正的原型

Carlos Baptista De Lima, Julian Hough, Frank Förster, Patrick Holthaus, Yongjun Zheng

机构 * Swansea University(斯旺西大学) University of Hertfordshire(赫特福德大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种满足流畅错误纠正需求的Wizard-of-Oz系统原型,通过引入中断性和纠正性、可轮询性、延迟测量与优化以及动作时间准确可重现性等关键指标,提升人机交互的流畅性。

Comments 5 pages, 1 figure, Workshop on Errors, Mistakes, and Failures in Humans and Robots at 2026 ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 8 篇

2604.19734 2026-04-22 cs.RO cs.AI 84%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11107 2026-04-22 cs.RO cs.LG 81%

Latent Linear Quadratic Regulator for Robotic Control Tasks

隐式线性二次调节器用于机器人控制任务

Yuan Zhang, Shaohui Yang, Toshiyuki Ohtsuka, Colin Jones, Joschka Boedecker

机构 * University of Freiburg(弗赖堡大学) EPFL(苏黎世联邦理工学院) Kyoto University(京都大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出隐式线性二次调节器(LaLQR),通过将状态空间映射到隐空间,使动态模型线性化并使成本函数二次化,从而高效应用LQR。实验表明其在效率和泛化能力上优于其他基线方法。

Comments Accepted at L4DC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19643 2026-04-22 cs.RO 61%

A Gesture-Based Visual Learning Model for Acoustophoretic Interactions using a Swarm of AcoustoBots

基于手势的视觉学习模型用于声学聚沉交互的声学机器人群

Alex Lin, Lei Gao, Narsimlu Kemsaram, Sriram Subramanian

机构 * Department of Computer Science University College London London United Kingdom(计算机科学系伦敦大学学院伦敦英国) Department of Artificial Intelligence University of Malaya Kuala Lumpur Malaysia(人工智能系马来大学吉隆坡马来西亚) University College London(伦敦大学学院) University of Malaya(马来大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出基于手势的视觉学习框架,实现无接触人-机器人群交互,通过多模态AcoustoBot平台实现手势识别与触觉、音频、悬浮等模态映射,验证准确率提升至98%。

Comments This paper has been accepted for publication in the Proceedings of the 2026 4th International Conference on Robotics, Control and Vision Engineering (RCVE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 57%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16662 2026-04-22 cs.RO eess.SP 57%

Joint Magnetometer-IMU Calibration via Maximum A Posteriori Estimation

通过最大后验估计联合磁力计-IMU校准

Chuan Huang, Gustaf Hendeby, Isaac Skog

机构 * Dept. of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(电子工程与计算机科学系,皇家理工学院) Dept. of Electrical Engineering, Linköping University(电子工程系,利尔贝里大学) Dept. of Electrical Engineering and Computer Science, KTH Royal Institute of Technology, and the Div. of Underwater Technology, Swedish Defence Research Agency (FOI)(电子工程与计算机科学系,皇家理工学院,以及瑞典国防研究机构(FOI)的水下技术系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种联合校准磁力计和惯性测量单元的方法,通过最大后验估计框架优化校准参数,提升精度与效率,实验证明其校准精度提高20-30%,且计算效率高。

Comments Accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18790 2026-04-22 cs.CV 57%

EfficientPENet: Real-Time Depth Completion from Sparse LiDAR via Lightweight Multi-Modal Fusion

EfficientPENet:通过轻量多模态融合实现稀疏LiDAR的实时深度补全

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi, Anton Netchaev, Steven Sloan, Ken Pathak, Kendall N. Niles

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics, the University of New Orleans, New Orleans, USA(Canizaro Livingston Gulf States环境信息中心,新奥尔良大学,美国新奥尔良) US Army Corps of Engineers, Engineer Research and Development Center, Vicksburg, Mississippi, USA(美国陆军工程兵团,工程师研究与发展中心,密西西比州维克斯堡,美国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出EfficientPENet,通过轻量级多模态融合网络,在稀疏LiDAR和RGB图像上实现实时深度补全,具有更少的参数和更高的速度,同时保持竞争力的精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19626 2026-04-22 eess.SP 50%

Odour sensing in turbulent plumes with high-speed electronic nose and non-invasive ground truth

湍流中高灵敏度电子鼻的气味传感

Nik Dennler, Elle Stark, Saimon Collaku, Lars Larson, André van Schaik, Michael Schmuker, John Crimaldi, Andreas T. Güntner, Aaron True

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出结合平面激光诱导荧光与定制MEMS电子鼻的实验数据集,用于评估传感器动态特性及开发重建算法,支持高灵敏度气味传感系统的设计与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04925 2026-04-22 cs.CL 50%

Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences

AI生成的说服能否被检测?Persuaficial基准与AI与人类语言差异

Arkadiusz Modzelewski, Paweł Golik, Anna Kołos, Giovanni Da San Martino

机构 * NASK National Research Institute(波兰国家科研 institute) University of Padua(意大利帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文探讨LLM生成的说服内容是否更难自动检测,通过Persuaficial基准对比人类与AI生成文本的语言差异,揭示细微说服策略对检测性能的影响。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏