arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-18 至 2026-03-18 共收录 75 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2603.16542 2026-03-18 cs.RO 79%

Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting

通过后过渡重加权实现保守的离线机器人策略学习

Wanpeng Zhang, Hao Luo, Sipeng Zheng, Yicheng Feng, Haiweng Xu, Ziheng Xi, Chaoyi Xu, Haoqi Yuan, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

专题命中 机器人学习 :robot policy(title,abstract);分类 cs.RO

AI总结 本文提出PTR方法,通过后验过渡重加权实现保守的离线机器人策略学习,根据样本后作用后果的可归因性分配信用,提升对异质机器人数据的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 22 篇

2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD 87%

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

专题命中 机器人操作 :manipulation(title,abstract);embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13644 2026-03-18 cs.RO cs.AI cs.CV 85%

World Models for Learning Dexterous Hand-Object Interactions from Human Videos

为从人类视频学习灵巧手-物体交互构建世界模型

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, Yann LeCun

机构 * FAIR at Meta(Meta 的 FAIR 部门) New York University(纽约大学)

专题命中 机器人操作 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DexWM模型,通过手部关键点提取实现对精细手部动作的建模,提升未来状态预测和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09021 2026-03-18 cs.RO cs.CV 84%

$χ_{0}$: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies

$χ_{0}$:通过驯服分布不一致性实现资源感知的鲁棒操作

Checheng Yu, Chonghao Sima, Gangcheng Jiang, Hai Zhang, Haoguang Mai, Hongyang Li, Huijie Wang, Jin Chen, Kaiyang Wu, Li Chen, Lirui Zhao, Modi Shi, Ping Luo, Qingwen Bu, Shijia Peng, Tianyu Li, Yibo Yuan

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出$χ_{0}$框架,通过模型算术、阶段优势和训练部署对齐三个技术支柱,解决人示范分布、策略学习偏倚与测试分布之间的分布不一致性问题,实现长周期衣物操作的高可靠性自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 83%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 83%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16772 2026-03-18 cs.RO cs.HC 77%

Beyond Cybathlon: On-demand Quadrupedal Assistance for People with Limited Mobility

超越Cybathlon:为行动受限者提供按需四足辅助系统

Carmen Scheidemann, Andrei Cramariuc, Changan Chen, Jia-Ruei Chiu, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Robotic Systems Lab(机器人系统实验室)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种按需四足辅助机器人系统,结合半自主任务执行与人机协作,通过语义导航和碰撞感知实现环境移动与拾取放置任务,验证了其在日常生活中帮助行动受限者提高独立性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV 75%

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16853 2026-03-18 cs.RO cs.GR 70%

BrickSim: A Physics-Based Simulator for Manipulating Interlocking Brick Assemblies

BrickSim:一种基于物理的操纵互锁砖块组的模拟器

Haowei Wen, Ruixuan Liu, Weiyi Piao, Siyu Li, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 BrickSim通过紧凑的力基力学模型和凸二次规划解决互锁砖块的snap-fit机制,实现高保真的实时模拟,支持机器人构建和结构坍塌仿真,具有开源特性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 70%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16609 2026-03-18 cs.RO 61%

Dexterous grasp data augmentation based on grasp synthesis with fingertip workspace cloud and contact-aware sampling

基于指尖工作空间云和接触感知采样的灵巧抓取数据增强

Liqi Wu, Haoyu Jia, Kento Kawaharazuka, Hirokazu Ishida, Kei Okada

机构 * The Department of Mechano-Informatics, Graduate School of Information Science and Technology, The University of Tokyo(机械信息学系,信息科学与技术研究生院,东京大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出基于远程操作的框架,通过FSG生成抓取姿态数据,结合AutoWS自动生成指尖工作空间云,提升抓取数据生成效率与鲁棒性。

Comments Accepted to Advanced Robotics, GitHub: https://github.com/W567/FSG, YouTube: https://youtu.be/rFCDl9SxSSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16444 2026-03-18 cs.CV 57%

Fast-HaMeR: Boosting Hand Mesh Reconstruction using Knowledge Distillation

Fast-HaMeR: 通过知识蒸馏提升手形重建

Hunain Ahmed Jillani, Ahmed Tawfik Aboukhadra, Ahmed Elhayek, Jameel Malik, Nadia Robertini, Didier Stricker

机构 * RPTU(鲁尔大学) DFKI-AV(达姆施塔特德国研究院-人工智能实验室) UPM(乌拉尔理工大学) NUST-SEECS(纳全国科技大学-信息与电子工程学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 本文提出Fast-HaMeR,通过轻量神经网络与知识蒸馏提升3D手形重建效率,采用MobileNet等轻量模型替代原ViT-H,并验证了输出级和特征级蒸馏策略的有效性,实现速度提升1.5倍且精度损失仅0.4mm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16218 2026-03-18 cs.RO 57%

Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward

通过时间离散和时间连续速度前馈实现视觉-语言-动作模型中的动态跟踪

Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

机构 * Siemens Foundational Technologies(西门子基础技术) Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出两种方法提取VLAs中的速度目标,通过有限差分和连续三次B样条空间,改进VLA策略以解决合规性与响应性之间的权衡,提升任务执行速度和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15863 2026-03-18 cs.HC cs.AI 57%

Interpretative Interfaces: Designing for AI-Mediated Reading Practices and the Knowledge Commons

解释性界面:为AI中介的阅读实践和知识公共领域进行设计

Gabrielle Benabdallah

机构 * University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文探讨通过设计解释性界面促进用户与AI模型的交互,使非专家用户能干预语言模型的表示空间,通过直接操作观察和注释模型内部表示的变化,从而推动AI解释性作为交互设计而非纯技术问题。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22579 2026-03-18 cs.RO cs.SE 57%

Metamorphic Testing of Vision-Language Action-Enabled Robots

视觉-语言-动作机器人元测试

Pablo Valle, Sergio Segura, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙达龙大学) University of Seville(塞维利亚大学) Simula Research Laboratory(Simula研究实验室)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文探讨元测试能否缓解视觉-语言-动作机器人测试 oracle 问题,提出两种关系模式和五种关系,通过实验证明其有效性,并展示其在不同任务和机器人上的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19142 2026-03-18 cs.RO 57%

BiGraspFormer: End-to-End Bimanual Grasp Transformer

BiGraspFormer:端到端双臂抓取Transformer

Kangmin Kim, Seunghyeok Back, Geonhyup Lee, Sangbeom Lee, Sangjun Noh, Kyoobin Lee

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,全州科学技术学院(GIST)) Department of AI Machinery, Korea Institute of Machinery & Materials (KIMM)(人工智能机械系,韩国机械材料研究院(KIMM))

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出BiGraspFormer,一种端到端的双臂抓取Transformer框架,通过单引导双臂策略生成协调的双臂抓取方案,有效解决现有方法在协调性和效率上的不足。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03992 2026-03-18 cs.RO 57%

GeoFIK: A Fast and Reliable Geometric Solver for the IK of the Franka Arm based on Screw Theory Enabling Multiple Redundancy Parameters

GeoFIK:基于螺旋理论的Franka臂逆运动学快速可靠求解器

Pablo C. Lopez-Custodio, Yuhe Gong, Luis F. C. Figueredo

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出GeoFIK,一种基于螺旋理论的Franka臂逆运动学求解器,通过几何方法处理冗余参数,解决复杂逆运动学问题,验证了其速度、鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15809 2026-03-18 cs.MA cs.AI 57%

Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks

不要信任固执的邻居:代理网络的安全框架

Samira Abedini, Sina Mavali, Lea Schönherr, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多代理系统中恶意代理传播虚假信息的风险,提出理论框架并通过实验验证了增加良性代理、提升固执度或降低对敌方信任可增强系统安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15695 2026-03-18 physics.flu-dyn 50%

Non-inertial hydrodynamics of manipulating particle transport

非惯性流体中操控粒子运输的流体动力学

Partha Kumar Das

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究非惯性流体中微流体操控粒子轨迹的机制,探讨障碍物对粒子轨迹影响的物理原理,揭示流体动力学效应在粒子偏转中的作用。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02750 2026-03-18 quant-ph nucl-ex 50%

Coupling of a Nuclear Transition to a Surface Acoustic Wave

核态跃迁与表面声波的耦合

Albert Nazeeri, Chiara Brandenstein, Chengjie Jia, Lorenzo Magrini, Giorgio Gratta

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过高效耦合富集的$^{57}$Fe薄膜与97.9MHz表面声波,实现远高于核线宽的高频控制,产生莫塞莱谱中的吸收侧带,展示最高频率的机械驱动莫塞莱共振。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16405 2026-03-18 cs.CR 50%

Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation

污染像素:重新审视语义分割中的后门攻击

Guangsheng Zhang, Huan Tian, Leo Zhang, Tianqing Zhu, Ming Ding, Wanlei Zhou, Bo Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了语义分割中的后门攻击,提出四种粗粒度攻击向量和两种细粒度攻击向量,通过BADSEG框架验证攻击有效性,并发现现有防御措施无法有效缓解攻击,揭示了语义分割的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15996 2026-03-18 physics.acc-ph 50%

Advanced Control of Electron Beams: Tailoring X-ray Production with Programmable Laser Shaping

电子束高级控制:通过可编程激光成型定制X射线产生

Jack Hirschman, Randy Lemons, Hao Zhang, Razib Obaid, River Robles, Paris Franz, Benjamin Mencer, Nicole Neveu, Matthew Britton, David Cesar, Nicolas Sudar, Zhen Zhang, Justin Baker, Chad Pennington, Kurtis Borne, Taran Driver, Kirk A. Larsen, Veronica Guo, Yuantao Ding, Gabriel Just, Feng Zhou, James Cryan, Joseph Robinson, Ryan Coffee, Agostino Marinelli, Sergio Carbajo

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出通过可编程激光成型实现电子束控制,以定制X射线产生。利用非线性频率转换与空间光调制器结合的架构,生成用户定义的时间结构,并通过高分辨率时间域诊断观察其对电子束的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00996 2026-03-18 stat.ME 50%

Generalized Geographically Weighted Regression Model within a Modularized Bayesian Framework

基于模块化贝叶斯框架的广义地理加权回归模型

Yang Liu, Robert J. B. Goudie

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出基于模块化贝叶斯框架的广义地理加权回归模型,解决传统GWR模型在处理部分模型不规范性时的局限性,通过地理加权核和KL散度优化实现空间数据的高效处理。

Comments 34 pages, 11 figures

Journal ref Bayesian Anal. (2024) 19(2):465-500

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 17 篇

2511.10376 2026-03-18 cs.CV cs.RO 84%

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18546 2026-03-18 cs.RO cs.AI 84%

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

EfficientNav: 面向设备端目标物体导航的导航地图缓存与检索

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EfficientNav,通过语义感知记忆检索和离散记忆缓存技术,在设备端实现零样本目标物体导航,提升成功率并降低规划延迟。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO 82%

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16166 2026-03-18 cs.RO cs.CV 81%

SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments

SignNav:利用标识信息在大规模室内环境中实现语义视觉导航

Jian Sun, Yuming Huang, He Li, Shuqi Xiao, Shenyan Guo, Maani Ghaffari, Qingbiao Li, Chengzhong Xu, Hui Kong

机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出SignNav任务,通过解读标识信息进行语义导航,构建LSI-Dataset并提出START模型,实现端到端决策,达到80%的成功率和0.74 NDTW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02976 2026-03-18 cs.RO 79%

DreamFlow: Local Navigation Beyond Observation via Conditional Flow Matching in the Latent Space

DreamFlow:通过条件流匹配在潜在空间中超越观测的局部导航

Jiwon Park, Dongkyu Lee, I Made Aswin Nahrendra, Jaeyoung Lim, Hyun Myung

机构 * Robotics Program, KAIST(韩国科学技术院机器人学系) School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) URobotics(URobotics公司) KRAFTON(KRAFTON公司) Dept. of Electrical Engineering and Computer Science, UC Berkeley(伯克利大学电子工程与计算机科学系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出DreamFlow框架,通过条件流匹配扩展机器人感知范围,提升局部导航性能,实验显示其在仿真和现实环境中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06698 2026-03-18 cs.RO 79%

Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation

Crowd-FM: 基于学习的条件流匹配生成轨迹的最优选择用于人群导航

Antareep Singha, Laksh Nanwani, Mathai Mathew P., Samkit Jain, Phani Teja Singamaneni, Arun Kumar Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Tartu, Estonia(爱沙尼亚塔尔图大学) Inria, Université de Lorraine, France(法国里尔大学Inria研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出Crowd-FM方法,通过条件流匹配学习碰撞自由的轨迹生成策略,提升机器人在人群中的安全性和人似性。

Comments Accepted at IEEE ICRA 2026. Authors Antareep Singha and Laksh Nanwani have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16685 2026-03-18 cs.RO cs.CV 73%

vAccSOL: Efficient and Transparent AI Vision Offloading for Mobile Robots

vAccSOL:面向移动机器人高效且透明的AI视觉卸载

Adam Zahir, Michele Gucciardom Falk Selker, Anastasios Nanos, Kostis Papazafeiropoulos, Carlos J. Bernardos, Nicolas Weber, Roberto Gonzalez

机构 * University Carlos III of Madrid(卡洛斯三世大学) Nubificus Ltd(Nubificus有限公司)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出vAccSOL框架,通过SOL神经网络编译器和vAccel执行框架实现AI视觉任务的高效透明执行,减少能耗并提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏