arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-01 至 2026-04-01 共收录 71 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 3 篇

2603.29192 2026-04-01 cs.RO 74%

Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning

高效的相机姿态增强用于机器人策略学习中的视角泛化

Sen Wang, Huaiyi Dong, Jingyi Tian, Jiayi Li, Zhuo Yang, Tongtong Cao, Anlin Chen, Shuang Wu, Le Wang, Sanping Zhou

机构 * Xi'an Jiaotong University(西安交通大学) Noah's Ark Lab(诺亚方舟实验室)

专题命中 机器人学习 :robotic(title);分类 cs.RO

AI总结 本文提出GenSplat框架,通过新颖视角渲染实现视角泛化的策略学习,利用3D高斯点云重建和3D先验蒸馏策略,增强策略在空间扰动下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 70%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 机器人学习 :robotics(abstract);robot policy(abstract);分类 cs.RO

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28955 2026-04-01 cs.AI 70%

Enhancing Policy Learning with World-Action Model

通过世界-动作模型增强策略学习

Yuci Han, Alper Yilmaz

机构 * Photogrammetry and Computer Vision Lab, The Ohio State University(俄亥俄州立大学摄影测量与计算机视觉实验室)

专题命中 机器人学习 :manipulation(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出World-Action Model,通过联合推理未来视觉观测和驱动状态转移的动作,提升策略学习效果。在CALVIN基准的八项任务中,WAM通过行为克隆和基于模型的PPO优化,显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 19 篇

2603.30022 2026-04-01 cs.RO cs.AI 88%

Hybrid Framework for Robotic Manipulation: Integrating Reinforcement Learning and Large Language Models

机器人操作的混合框架:整合强化学习与大语言模型

Md Saad, Sajjad Hussain, Mohd Suhaib

机构 * Jamia Millia Islamia(贾米亚米利亚伊斯兰大学) University of Brighton(布莱顿大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种结合强化学习与大语言模型的混合框架,用于提升机器人操作任务。通过强化学习实现精确的低层控制,利用大语言模型进行高层任务规划和自然语言理解,有效连接低层执行与高层推理。实验显示任务完成时间减少33.5%,精度和适应性提升18.1%和36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29226 2026-04-01 cs.RO 86%

Long-Reach Robotic Manipulation for Assembly and Outfitting of Lunar Structures

长距离机器人操作用于月球结构的装配与布线

Stanley Wang, Venny Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO

AI总结 本文提出一种紧凑且长距离的机器人操作装置,用于月球结构的装配与布线任务,通过减少结构变形和振动提高操作精度。

Comments 7 pages, 6 figures, to appear in the proceedings of iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24956 2026-04-01 cs.RO cs.AI cs.LG 86%

MSG: Multi-Stream Generative Policies for Sample-Efficient Robotic Manipulation

MSG:多流生成策略用于样本高效的机器人操作

Jan Ole von Hartz, Lukas Schweizer, Joschka Boedecker, Abhinav Valada

机构 * University of Freiburg(弗莱堡大学)

专题命中 机器人操作 :manipulation(title);robotic(title);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出MSG多流生成策略,通过结合多个对象中心策略提升泛化能力和样本效率,实现在五次演示下学习高质量生成策略,性能提升89%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29240 2026-04-01 cs.RO 84%

Long-Reach Robotic Cleaning for Lunar Solar Arrays

月球太阳能板的长距离机器人清洁

Stanley Wang, Velin Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出一种小型移动机器人,配备长距离可展开臂和可更换清洁工具,用于月球太阳能板的温和清洁,减少人工干预,通过 compliant wrist 和速度基 admittance 控制器实现稳定接触。

Comments Extended abstract, 4 pages, 3 figures, accepted to and presented at the Sustainable Space Robotics Workshop at iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29315 2026-04-01 cs.RO cs.AI 81%

IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction

IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现

Yingke Wang, Hao Li, Yifeng Zhu, Hong-Xing Yu, Ken Goldberg, Li Fei-Fei, Jiajun Wu, Yunzhu Li, Ruohan Zhang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28947 2026-04-01 math.NA cs.NA 78%

Toward generalized solutions of the Keller--Segel equations with singular sensitivity and signal absorption via an algebraic manipulation finite element algorithm

迈向具有奇异敏感性和信号吸收的Keller-Segel方程广义解的算法

Juan Vicente Gutiérrez-Santacreu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出一种代数操作有限元算法,用于求解具有奇异敏感性和信号吸收的Keller-Segel方程,通过稳定项和极值检测器保证数值解的收敛性,同时保持物理约束和质量守恒。

Comments 53 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23738 2026-04-01 quant-ph 78%

Coherent manipulation of interacting electron qubitson solid neon

在固态氖上相互作用电子量子比特的相干操控

Xinhao Li, Yizhong Huang, Xu Han, Xianjing Zhou, Amir Yacoby, Dafei Jin

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究通过固态氖表面的自然限制实现了多个相互作用电子量子比特的相干操控,实现了62.5MHz的量子比特耦合强度,并实现了CR和bSWAP双量子比特门,为扩展量子信息处理提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 70%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15126 2026-04-01 cs.RO cs.CV 62%

A Novel Camera-to-Robot Calibration Method for Vision-Based Floor Measurements

一种用于基于视觉的地板测量的新型摄像头到机器人校准方法

Jan Andre Rudolph, Dennis Haitz, Markus Ulrich

机构 * Machine Vision Metrology Lab, \ of Photogrammetry

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种新型手眼校准方法,用于地面观测移动机器人。通过设计参考板结合激光跟踪器的3D测量和摄像头的2D成像,实现高精度定位。实验显示重复精度达到亚毫米级。

Comments 8 pages; accepted for publication in the ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29428 2026-04-01 cs.CV 57%

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

看到证据,却错失答案:基于工具引导的视觉语言模型在视觉错觉中的应用

Xuesong Wang, Harry Wang

机构 * Wayne State University(韦恩州立大学) University of Michigan(密歇根大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种工具引导的推理框架,通过通用图像处理工具和提示系统,解决视觉语言模型在处理视觉错觉时的系统性偏差问题,并展示其在不同结构错觉变体上的跨结构泛化能力。

Comments CVPR 2026 DataCV Workshop, code: https://github.com/Davidxswang/cvpr_2026_datacv_submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29423 2026-04-01 cs.CV 57%

A2BFR: Attribute-Aware Blind Face Restoration

A2BFR:属性感知的盲脸修复

Chenxin Zhu, Yushun Fang, Lu Liu, Shibo Yin, Xiaohong Liu, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出A2BFR框架,结合高保真重建与提示可控生成,通过属性感知学习和语义双训练提升修复精度与可控性,实验显示在恢复保真度和指令遵循上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29363 2026-04-01 cs.RO 57%

Industrial-Grade Robust Robot Vision for Screw Detection and Removal under Uneven Conditions

工业级鲁棒机器人视觉用于在不平整条件下螺钉检测与移除

Tomoki Ishikura, Genichiro Matsuda, Takuya Kiyokawa, Kensuke Harada

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种两阶段任务特定检测方法和基于网格的局部校准策略,实现99.8%的螺钉检测召回率和±0.75mm的高精度操作,实验证明系统在工业应用中的可行性。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29213 2026-04-01 cs.RO 57%

Kilohertz-Safe: A Scalable Framework for Constrained Dexterous Retargeting

千赫兹安全:一种可扩展的受限灵活重定向框架

Yinxiao Tian, Ziyi Yang, Zinan Zhao, Zhen Kan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种可扩展的灵活重定向框架,通过将非线性重定向问题转化为凸二次规划问题,提高计算效率和数值稳定性,并集成控制屏障函数以提供正式的安全保证,实验证明其在复杂操作任务中有效减少自碰撞和穿透。

Comments 8 pages,6 Figures,Under Reiview

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13570 2026-04-01 cs.LG cs.CR 57%

Privacy-Preserving Machine Learning for IoT: A Cross-Paradigm Survey and Future Roadmap

物联网中的隐私保护机器学习:跨范式综述与未来路线图

Zakia Zaman, Praveen Gauravaram, Mahbub Hassan, Sanjay Jha, Wen Hu

机构 * School of CSE, University of NSW(新南威尔士大学计算机科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本文综述了物联网中隐私保护机器学习的跨范式方法,分析了隐私保障、计算复杂度、异构设备参与下的可扩展性及威胁抵御能力,并探讨了无线物联网环境中的部署限制与开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29736 2026-04-01 cs.MM 50%

Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs

生成流形上的编辑:通用扩散图像编辑权衡的理论与实证研究

Yi Hu, Leying Yi, Emily Davis, Finn Carter

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文理论与实证分析了通用扩散图像编辑,通过将编辑视为引导传输在学习图像流形上的过程,探讨了可控性、意图忠实度、语义一致性、局部性和感知质量等核心指标。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12119 2026-04-01 physics.flu-dyn 50%

Controlled particle displacement by hydrodynamic obstacle interaction in non-inertial flows

通过非惯性流中流体动力学障碍相互作用控制粒子位移

Partha Kumar Das, Xuchen Liu, Sascha Hilgenfeldt

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过非惯性流中障碍相互作用实现微流体中粒子偏转,分析了流体动力学与接触相互作用分离对粒子操控的影响,提出新的微流体操控指导原则。

Journal ref J. Fluid Mech. 1032 (2026) A16

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29364 2026-04-01 eess.SP 50%

Intelligent Forensics in Next-Generation Mobile Networks: Evidence, Methods, and Applications

下一代移动网络中的智能取证:证据、方法与应用

Jiacheng Wang, Weihong Qin, Jialing He, Changyuan Zhao, Dusit Niyato, Tao Xiang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨了下一代移动网络中的智能取证,提出以证据为中心的框架,系统化取证流程,并分析了传统方法与AI技术的互补作用,涵盖异常检测、溯源与时间线重建等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29286 2026-04-01 cond-mat.mtrl-sci 50%

Atomically Reconfigurable Single-Molecule Optoelectronics

原子可重构单分子光电子学

Atif Ghafoor, Santeri Neuvonen, Thinh Tran, Oscar Moreno Segura, Yitao Sun, Yaroslav Pavlyukh, Riku Tuovinen, Jose L. Lado, Shawulienu Kezilebieke

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过原子级结构调控,实现单分子过渡偶极矩的精确控制,展示了单分子发光的可调谐开关及异二聚体的共振能量转移调控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13946 2026-04-01 quant-ph cond-mat.mes-hall 50%

Design and Dynamics of Two-Qubit Gates with Motional States of Electrons on Helium

双电子在氦气上的双量子位门设计与动力学

Oskar Leinonen, Jonas B. Flaten, Stian D. Bilek, Øyvind S. Schøyen, Morten Hjorth-Jensen, Niyaz R. Beysengulov, Zachary J. Stewart, Jared D. Weidman, Angela K. Wilson

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了利用超流氦气中的电子运动状态实现双量子位门的操作,通过数值模拟展示了如何通过时间依赖的势能调节来实现高保真度的量子门操作,并评估了不同门操作的保真度和执行时间。

Comments 21 pages, 13 figures

Journal ref Phys. Rev. A 113, 032624 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 16 篇

2603.29165 2026-04-01 cs.CV cs.AI cs.RO 82%

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29990 2026-04-01 cs.CV 79%

SurgNavAR: An Augmented Reality Surgical Navigation Framework for Optical See-Through Head Mounted Displays

SurgNavAR: 一种用于光学透视头戴显示器的增强现实手术导航框架

Abdullah Thabit, Mohamed Benmahdjoub, Rafiuddin Jinabade, Hizirwan S. Salim, Marie-Lise C. van Veelen, Mark G. van Vledder, Eppo B. Wolvius, Theo van Walsum

机构 * Biomedical Imaging Group Rotterdam, Department of Radiology & Nuclear Medicine, Erasmus MC(鹿特丹伊拉斯姆斯大学医学中心放射与核医学系鹿特丹生物医学成像组) Department of Oral and Maxillofacial Surgery, Erasmus MC(鹿特丹伊拉斯姆斯大学医学中心口腔颌面外科) University of Groningen(格罗宁根大学) Department of High Performance Compute & Visualization, SURF bv(SURF bv高性能计算与可视化部) Department of Neurosurgery, Erasmus MC(鹿特丹伊拉斯姆斯大学医学中心神经外科) Trauma Research Unit, Department of Surgery, Erasmus MC(鹿特丹伊拉斯姆斯大学医学中心外科创伤研究单元)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于HMD的增强现实手术导航框架,通过2D模式跟踪、校准技术和点匹配实现手术导航,实现了1mm的校准精度和3mm的图像注册精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28890 2026-04-01 cs.RO 79%

Bootstrap Perception Under Hardware Depth Failure for Indoor Robot Navigation

基于硬件深度故障的室内机器人导航 bootstrap 感知系统

Nishant Pushparaju, Vivek Mattam, Aliasghar Arab

机构 * New York University(纽约大学) City College of New York(纽约市立学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种在硬件深度故障情况下用于室内机器人导航的 bootstrap 感知系统,通过自参照性质校准单目深度,提升障碍物感知覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00552 2026-04-01 cs.RO 79%

Generation of Indoor Open Street Maps for Robot Navigation from CAD Files

从CAD文件生成用于机器人导航的室内开放街图

Jiajie Zhang, Shenrui Wu, Xu Ma, Sören Schwertfeger

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种自动化系统,将CAD文件转换为分层拓扑OpenStreetMap表示,以提升机器人在复杂室内环境中的长期导航能力。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03639 2026-04-01 cs.RO 70%

Context-Triggered Contingency Games for Strategic Multi-Agent Interaction

基于情境触发的应急游戏用于战略多智能体交互

Kilian Schweppe, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于时序逻辑规范的战略游戏与实时动态应急游戏结合的新型框架,通过双层架构和因子图求解器实现多智能体在不确定环境中的安全与进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06285 2026-04-01 cs.RO 70%

DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration

DCReg: 用于高效退化LiDAR配准的解耦表征

Xiangcheng Hu, Xieyuanli Chen, Mingkai Jia, Jin Wu, Ping Tan, Steven L. Waslander

机构 * Hong Kong University of Science and Technology(香港科技大学) National University of Defense Technology(国防科技大学) University of Science and Technology Beijing(北京科技大学) University of Toronto(多伦多大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出DCReg方法,通过解耦配准问题中的退化因素,提高配准稳定性与精度,实验显示在多种环境中实现更高的定位精度和更快的计算速度。

Comments 27 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02381 2026-04-01 cs.RO 61%

Where to Look Next: Learning Viewpoint Recommendations for Informative Trajectory Planning

下一步在哪里寻找:为信息轨迹规划学习视角推荐

Max Lodel, Bruno Brito, Álvaro Serra-Gómez, Laura Ferranti, Robert Babuška, Javier Alonso-Mora

机构 * Delft University of Technology(代尔夫特理工大学) Czech Technical University in Prague(捷克理工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出一种基于深度强化学习的信息感知策略,用于指导递推时间 horizon轨迹优化规划器,以在动态可行且无碰撞的轨迹中最大化信息增益并减少环境不确定性。

Comments accepted to ICRA2022

Journal ref 2022 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29999 2026-04-01 cs.SE cs.AI cs.PL 57%

Phyelds: A Pythonic Framework for Aggregate Computing

Phyelds: 一个用于聚合计算的Pythonic框架

Gianluca Aguzzi, Davide Domini, Nicolas Farabegoli, Mirko Viroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 具身导航 :robotics(abstract);分类 cs.AI

AI总结 本文提出Phyelds,一个针对数据科学实践者的Python库,旨在整合机器学习与聚合计算,提供轻量级的字段 calculus 模型实现,支持联邦学习和多智能体强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏