arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-10 至 2026-03-10 共收录 183 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 52 篇

2603.07981 2026-03-10 cs.HC cs.CV 57%

Extend Your Horizon: A Device-Agnostic Surgical Tool Tracking Framework with Multi-View Optimization for Augmented Reality

拓展视野:一种多视角优化的设备无关手术工具跟踪框架用于增强现实

Jiaming Zhang, Mingxu Liu, Hongchao Shu, Ruixing Liang, Yihao Liu, Ojas Taskar, Amir Kheradmand, Mehran Armand, Alejandro Martin-Gomez

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出一种多视角优化的设备无关手术工具跟踪框架,通过融合多种传感模式提升增强现实中的遮挡鲁棒性与可视化一致性。

Comments accepted by IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07796 2026-03-10 cs.RO 57%

Inverse Resistive Force Theory (I-RFT): Learning granular properties through robot-terrain physical interactions

逆电阻力理论(I-RFT):通过机器人与地形的物理互动学习颗粒特性

Shipeng Liu, Feng Xue, Yifeng Zhang, Tarunika Ponnusamy, Feifei Qian

机构 * University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 I-RFT通过机器人与地形的物理互动学习颗粒特性,结合颗粒电阻力理论与高斯过程,实现对地形属性的准确估计与不确定性量化,提升自主探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07795 2026-03-10 cs.RO 57%

A Robust Antenna Provides Tactile Feedback in a Multi-legged Robot

一种鲁棒的天线为多足机器人提供触觉反馈

Zhaochen J. Xu, Juntao He, Delfin Aydan, Malaika Taylor, Tianyu Wang, Jianfeng Lin, Wesley Dyer, Daniel I. Goldman

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本研究提出了一种用于多足机器人的触觉天线,通过实时感知周围环境几何形状,提高在狭窄空间中的导航能力和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07699 2026-03-10 cs.RO 57%

C$^2$-Explorer: Contiguity-Driven Task Allocation with Connectivity-Aware Task Representation for Decentralized Multi-UAV Exploration

C$^2$-Explorer: 基于连通性的任务分配与连接感知的任务表示用于分布式多无人机探索

Xinlu Yan, Mingjie Zhang, Yuhao Fang, Yanke Sun, Jun Ma, Youmin Gong, Boyu Zhou, Jie Mei

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学深圳研究院) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) Department of Mechanical and Energy Engineering, Southern University of Science and Technology, Shenzhen, Guangdong, China(南方科技大学机械与能源工程系)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 C$^2$-Explorer通过连接感知的任务表示和基于连续性的分配策略,提升多无人机探索效率,减少探索时间和路径长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07650 2026-03-10 cs.RO 57%

Multi-Agent Off-World Exploration for Sparse Evidence Discovery via Gaussian Belief Mapping and Dual-Domain Coverage

多智能体非世界探索用于稀疏证据发现的高斯信念映射与双域覆盖

Zhuoran Qiao, Tianxin Hu, Thien-Minh Nguyen, Shenghai Yuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于高斯信念映射和双域覆盖的多智能体路径规划框架,用于非世界稀疏证据发现,通过平衡信息获取与操作安全,提升探索效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07393 2026-03-10 cs.RO cs.SY eess.SY 57%

Underwater Embodied Intelligence for Autonomous Robots: A Constraint-Coupled Perspective on Planning, Control, and Deployment

水下具身智能:一种约束耦合视角下的规划、控制与部署

Jingzehua Xu, Guanwen Xie, Jiwei Tang, Shuai Zhang, Xiaofan Li

机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 具身导航 :world model(abstract);分类 cs.RO

AI总结 本文提出一种约束耦合视角下的水下具身智能方法,探讨了规划、控制与部署中的紧密耦合约束,旨在实现更可靠和可扩展的自主性。

Comments This article is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23488 2026-03-10 cs.AI cs.CL 57%

Mapping Overlaps in Benchmarks through Perplexity in the Wild

通过在野 perplexity 映射重叠关系

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 具身导航 :world model(abstract);分类 cs.AI

AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06898 2026-03-10 cs.RO 57%

Collaborative Planning with Concurrent Synchronization for Operationally Constrained UAV-UGV Teams

具有并发同步的协同规划用于受操作约束的无人机-地面车辆团队

Zihao Deng, Qianhuang Li, Peng Gao, Maggie Wigness, John Rogers, Donghyun Kim, Hao Zhang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) North Carolina State University(北卡罗来纳州立大学) U.S. Army DEVCOM Army Research Laboratory (ARL)(美国陆军 DEVCOM 军事研究实验室 (ARL))

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出CoPCS方法,通过集成异构图Transformer和Transformer解码器,实现无人机与地面车辆的同步并发协同规划,提升团队任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10851 2026-03-10 cs.RO 57%

Preference-Conditioned Multi-Objective RL for Integrated Command Tracking and Force Compliance in Humanoid Locomotion

基于偏好条件的多目标强化学习用于人形机器人集成指令跟踪与力合规

Tingxuan Leng, Yushi Wang, Tinglong Zheng, Changsheng Luo, Mingguo Zhao

机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) Beijing Jiaotong University, Beijing 100044, China(北京交通大学,北京100044,中国)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于偏好的多目标强化学习框架,用于实现人形机器人在指令跟踪与力顺应性之间的平衡,通过用户指定偏好输入实现稳定训练和可部署的运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04436 2026-03-10 cs.RO cs.SY eess.SY 57%

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

PAD-TRO: 用于直接轨迹优化的投影增强扩散模型

Jushan Chen, Santiago Paternain

机构 * Department of Electrical, Computer, and Systems Engineering, Rensselaer Polytechnic Institute(电气、计算机与系统工程系,罗切斯特理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 PAD-TRO提出了一种基于模型的扩散方法,通过无梯度投影机制直接生成状态序列,实现了在四旋翼航点导航中零动态可行性误差和更高的成功率。

Comments Final manuscript. Accepted for publication at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12468 2026-03-10 cs.RO 57%

Bio-inspired tail oscillation enables robot fast crawling on deformable granular terrains

生物启发的尾部摆动使机器人在变形颗粒地形上快速爬行

Shipeng Liu, Meghana Sagare, Shubham Patil, Feifei Qian

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 生物启发的尾部摆动设计提升了机器人在变形颗粒地形上的运动效率,通过流体化基质减少阻力并提高速度,为农业、救援和环境探索提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08138 2026-03-10 cs.HC 50%

Toward Governing Perception in Safety-Critical Mediated Reality on the Move

迈向移动安全关键媒介现实中的感知治理

Pascal Jansen

专题命中 具身导航 :navigation(abstract)

AI总结 本文探讨了移动安全关键环境中媒介现实的感知治理问题,提出需通过可配置机制提升情境意识与信任校准,以应对动态环境中的交互挑战。

Comments Position Paper at the CHI 2026 Workshop Next Steps for Augmented Reality On-the-Move: Challenges & Opportunities. April 14, 2026. Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08107 2026-03-10 cs.HC 50%

''I don't want to break it'': An Exploration of Perceived Fragility in Shape-Changing Interfaces

“我不想打破它”:对形状变化界面中感知脆弱性的探索

Eva Mackamul, Tom Maillard, Noé Marceaul, Yelli Coulibaly, Julien Pansiot, Laurence Boissieux, Dominique Vaufreydaz, Anne Roudaut, Céline Coutrix

专题命中 具身导航 :manipulation(abstract)

AI总结 研究通过实验探讨形状变化界面中用户对脆弱性的感知,提出影响因素框架并优化界面设计的稳健性。

Journal ref CHI Conference on Human Factors in Computing Systems, Apr 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07446 2026-03-10 cs.HC 50%

GeoVisA11y: An AI-based Geovisualization Question-Answering System for Screen-Reader Users

GeoVisA11y: 一种基于AI的地理可视化问答系统,用于屏幕阅读用户

Chu Li, Rock Yuren Pang, Arnavi Chheda-Kothary, Ather Sharif, Henok Assalif, Jeffrey Heer, Jon E. Froehlich

专题命中 具身导航 :navigation(abstract)

AI总结 GeoVisA11y通过自然语言交互为屏幕阅读用户提供可访问的地理可视化系统,并揭示了不同用户群体的交互模式差异。

Comments This manuscript has been accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07349 2026-03-10 physics.flu-dyn 50%

Improving Hydrodynamic Modeling of Free-Swimming Algae Using a Modified Three-Sphere Approach

利用改进的三球方法提高自由游动藻类的流体动力学建模

Md Iftekhar Yousuf Emon, Gregorius R. Pradipta, Xiang Cheng, Xin Yong

专题命中 具身导航 :navigation(abstract)

AI总结 改进三球模型以更准确模拟自由游动藻类的流体动力学行为

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11461 2026-03-10 cond-mat.soft 50%

Universal Scaling Laws for Deep Indentation Beyond the Hertzian Regime

深压入中的普遍标度定律超越赫茨区域

Tong Mu, Changhong Linghu, Yanju Liu, Jinsong Leng, Huajian Gao, K. Jimmy Hsia

专题命中 具身导航 :robotics(abstract)

AI总结 本文提出了一种通用框架,用于预测极端变形下软材料的压入行为,通过实验和模拟验证了适用于超弹性材料的普遍标度定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10040 2026-03-10 astro-ph.IM astro-ph.EP 50%

Operational Mass Measurement for Flyby Reconnaissance Missions of Potentially Hazardous Asteroid

飞掠侦察任务中潜在危险小行星的操作质量测量

Justin A. Atchison, Gael Cascioli, Anivid Pedros-Faura, Erwan Mazarico, Rylie A. Bull, Jay McMahon, Evan J. Smith, Daniel R. Cremons

专题命中 具身导航 :navigation(abstract)

AI总结 研究提出通过激光或高精度多普勒系统实现小行星质量测量,以应对行星防御任务中的快速侦察需求。

Comments Submitted to the Journal of the Astronautical Sciences

Journal ref Journal of the Astronautical Sciences, March 2026, Vol 73

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 14 篇

2505.14357 2026-03-10 cs.CV cs.LG 86%

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Vid2World: 构建视频扩散模型以交互式世界模型

Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, Mingsheng Long

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。

Comments Project page: http://knightnemo.github.io/vid2world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 85%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 84%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 83%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 具身推理 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08455 2026-03-10 cs.AI cs.LG 81%

The Boiling Frog Threshold: Criticality and Blindness in World Model-Based Anomaly Detection Under Gradual Drift

青蛙沸腾阈值:世界模型基于异常检测中的临界性与盲目性

Zhe Hong

机构 * National University of Singapore(新加坡国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了世界模型在异常检测中的临界阈值,发现检测阈值受噪声底座、检测器和环境动态的三重交互影响,且正弦漂移无法被检测到。

Comments 10 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11682 2026-03-10 cs.RO cs.AI cs.SY eess.SY 81%

Ego-Vision World Model for Humanoid Contact Planning

人形机器人接触规划的视角世界模型

Hang Liu, Yuman Gao, Sangli Teng, Yufeng Chi, Yakun Sophia Shao, Zhongyu Li, Maani Ghaffari, Koushil Sreenath

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种结合学习世界模型与MPC的框架,用于提升人形机器人在复杂环境中的接触规划能力,实现更高效和稳健的多任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07264 2026-03-10 cs.RO cs.AI 81%

Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving

具备运动学意识的潜在世界模型用于数据高效的自动驾驶

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(道路与交通工程重点实验室,教育部,同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种具备运动学意识的潜在世界模型框架,通过整合车辆运动学信息提升自动驾驶的样本效率和驾驶性能。

Comments 6 pages, 5 figures. Under review at IEEE ITSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19195 2026-03-10 cs.CV cs.AI 81%

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

重新思考驾驶世界模型作为感知任务的合成数据生成器

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 Dream4Drive通过生成高质量的合成数据提升自动驾驶感知任务性能

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07039 2026-03-10 cs.AI 80%

Self-Supervised Multi-Modal World Model with 4D Space-Time Embedding

具有4D空间-时间嵌入的自监督多模态世界模型

Lance Legel, Qin Huang, Brandon Voelker, Daniel Neamati, Patrick Alan Johnson, Favyen Bastani, Jeff Rose, James Ryan Hennessy, Robert Guralnick, Douglas Soltis, Pamela Soltis, Shaowen Wang

机构 * Ecological Intelligence Lab(生态智能实验室) School of Complex Adaptive Systems(复杂适应系统学院) University of Houston(休斯顿大学) Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院) Spatial Intelligence Lab(空间智能实验室) Department of Computer Science(计算机科学系) Georgia Institute of Technology(佐治亚理工学院) Florida Museum of Natural History(佛罗里达自然历史博物馆) University of Florida(佛罗里达大学) NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。

Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07562 2026-03-10 cs.CV 79%

Brain-WM: Brain Glioblastoma World Model

Brain-WM: 脑部胶质瘤世界模型

Chenhui Wang, Boyun Zheng, Liuxin Bao, Zhihao Peng, Peter Y. M. Woo, Hongming Shan, Yixuan Yuan

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 Brain-WM通过统一治疗预测与MRI生成,实现了肿瘤与治疗的共进化动态建模,提升了治疗计划的准确率和MRI生成的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10480 2026-03-10 cs.CL 78%

Neuro-Symbolic Synergy for Interactive World Modeling

神经符号协同用于交互世界建模

Hongyu Zhao, Siyu Zhou, Haolin Yang, Zengyi Qin, Tianyi Zhou

专题命中 具身推理 :world model(title,abstract)

AI总结 NeSyS通过结合LLMs的概率语义先验与可执行符号规则,实现交互世界建模的表达力与鲁棒性,提升预测准确性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11892 2026-03-10 cs.CL 78%

R-WoM: Retrieval-augmented World Model For Computer-use Agents

R-WoM:基于检索的世界模型用于计算机使用代理

Kai Mei, Jiang Guo, Shuaichen Chang, Mingwen Dong, Dongkyu Lee, Xing Niu, Jiarong Jiang

机构 * Rutgers University(罗杰斯大学) AWS Agentic AI(亚马逊敏捷人工智能)

专题命中 具身推理 :world model(title,abstract)

AI总结 R-WoM通过整合外部检索知识提升世界模型能力,有效改善长周期模拟中的决策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21243 2026-03-10 cs.RO 61%

RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models

RetoVLA: 通过重用寄存器令牌在视觉-语言-动作模型中实现空间推理

Jiyeon Koo, Taewan Cho, Hyunjoon Kang, Eunseom Pyo, Tae Gyun Oh, Taeryang Kim, Andrew Jaeyong Choi

机构 * School of Computing, Gachon University(高丽大学计算机学院)

专题命中 具身推理 :robotic(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 RetoVLA通过重用注册令牌提升视觉-语言-动作模型的空间推理能力,实验显示在7自由度机械臂任务中平均成功率提升17.1%。

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏