arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-09 至 2026-06-09 共收录 171 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 52 篇

2606.08828 2026-06-09 cs.RO 新提交 70%

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Pennsylvania(宾夕法尼亚大学) Toyota Research Institute(丰田研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。

Comments Website: https://video2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08743 2026-06-09 cs.RO 新提交 70%

Guided Discovery of New Behaviors using Diffusion Policies

使用扩散策略引导发现新行为

Dian Yu, Sebastian Sanokowski, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。

Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02274 2026-06-09 cs.RO 版本更新 70%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23592 2026-06-09 cs.RO cs.HC cs.SY eess.SY 70%

Human-Exoskeleton Kinematic Calibration to Improve Hand Tracking for Dexterous Teleoperation

人-外骨骼运动学校准以提高手部跟踪用于灵巧遥操作

Haiyun Zhang, Stefano Dalla Gasperina, Saad N. Yousaf, Toshimitsu Tsuboi, Tetsuya Narita, Ashish D. Deshpande

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学机械工程系) Sony Group Corporation, Tokyo, Japan(索尼集团公司,日本东京) Meta Reality Labs Research, Redmond, WA, USA(Meta现实实验室研究)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出一种针对手部外骨骼的个性化校准框架,通过残差加权优化估计虚拟链接参数,减少关节和指尖跟踪误差,提升遥操作精度。

Comments 8 pages, 10 figures, 1 supplementary video, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20591 2026-06-09 cs.RO 版本更新 70%

LightTact: A Visual-Tactile Fingertip Sensor for Deformation-Independent Contact Sensing

LightTact: 一种用于变形无关接触感知的视觉-触觉指尖传感器

Changyi Lin, Boda Huo, Mingyang Yu, Emily Ruppel, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出LightTact传感器,通过环境光阻断光学配置实现变形无关的接触检测,在无宏观变形下(如液体、超软材料)实现高对比度接触分割,并解锁轻接触机器人操作。

Comments Project website: https://linchangyi1.github.io/LightTact

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09811 2026-06-09 cs.RO cs.AI cs.CV 新提交 67%

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

AHA-WAM:异步自适应时域世界-动作建模与观测引导的上下文路由

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Baidu AI Cloud(百度智能云) The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出AHA-WAM,一种基于双扩散Transformer的异步时域自适应世界-动作模型,通过低频世界规划器和高频动作执行器解耦时序,实现高效闭环控制,在RoboTwin和真实任务上达到SOTA性能。

Comments Project page: https://serene-sivy.github.io/aha-wam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09615 2026-06-09 cs.RO cs.CV 新提交 62%

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience

DexPIE:基于真实世界经验的稳定灵巧策略改进

Ruizhe Liao, Wenrui Chen, Liangji Zeng, Haoran Lin, Fan Yang, Kailun Yang, Yaonan Wang

机构 * Hunan University(湖南大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出DexPIE后训练框架,通过灵巧手适配干预系统、多阶段DAgger数据收集、相对动作空间异步推理和连续最优性指标条件化,在三个真实灵巧操作任务上成功率提升37%。

Comments Project website: https://siiuuuuuu.github.io/DexPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 62%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01324 2026-06-09 cs.RO 版本更新 61%

Integrated Hierarchical Decision-Making in Inverse Kinematic Planning and Control

集成化分层决策在逆运动学规划与控制中

Kai Pfeiffer, Quan Zhang, Yuqing Chen, Gordon Boateng, Yuquan Wang, Vincent Bonnet, Aberrahmane Kheddar

机构 * University of Cambridge(剑桥大学)

专题命中 机器人操作 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出一种高效的非线性规划框架,整合分层决策与全身逆运动学规划控制,解决逆运动学规划中同时选择端效应器位置的问题。

Comments Accepted paper to "Robotics: Science and Systems" (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09645 2026-06-09 cs.RO cs.PL cs.SE 新提交 57%

Modeling Components and Connections in Cyber-Physical Systems

信息物理系统中的组件与连接建模

Kate Sanborn, Tanuj Kenchannavar, Vakul Nath, Jonathan Sprinkle

机构 * Vanderbilt University(范德堡大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 提出基于WebGME的模型集成工具ROSLaunchVisual,通过图形界面可视化ROS启动文件中的节点、发布者、订阅者和参数,提升开发效率和系统理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08678 2026-06-09 cs.SD cs.LG 新提交 57%

Speaker-Invariant Representation Learning for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck

基于梯度反转和变分信息瓶颈的说话人不变表示学习用于欺骗检测

Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier, Nicholas Evans

机构 * Avignon Universite(阿维尼翁大学) EURECOM

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 针对欺骗检测中说话人偏差导致泛化差的问题,提出教师-学生框架,利用梯度反转层和变分信息瓶颈解耦身份信息,在9个数据集上EER相对降低25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08267 2026-06-09 cs.GT cs.AI 新提交 57%

Post-AGI Economies: Superposition and the Second Fundamental Theorem of Welfare Economics

后AGI经济:叠加性与福利经济学第二基本定理

Elija Perrier

机构 * Centre for Quantum Software & Information(量子软件与信息中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 针对后AGI经济中自治权、自我修改和叠加偏好对经典福利第二定理的挑战,提出自治限定第二福利定理,给出可分散化的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07963 2026-06-09 cs.AI cs.CL 新提交 57%

Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

共享潜在结构实现大语言模型中的统一后门检测与缓解

Omar Mahmoud, Aly M. Kassem, Thommen George Karimpanal, Buddhika Laknath Semage, Negar Rostamzadeh, Golnoosh Farnadi, Santu Rana

机构 * Deakin University(迪肯大学) Mila, Quebec AI Institute(魁北克人工智能研究所Mila)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 发现大语言模型中多种后门攻击共享潜在机制,通过稀疏自编码器检测因果特征,并提出双向激活操控和概念消融微调实现统一检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07857 2026-06-09 cs.CR cs.AI 新提交 57%

Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices

边缘设备上小语言模型训练中对抗检测的模型多重性

Stefan Behfar, Richard Mortier

机构 * Computer Lab, University of Cambridge(剑桥大学计算机实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 针对边缘设备上分布式微调语言模型易受投毒攻击的问题,提出基于模型多重性的系统级防御,通过旋转或并行训练多个小语言模型并量化其差异来检测异常,实验表明比经典单模型防御更早更可靠地检测投毒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06497 2026-06-09 cs.GR cs.CV cs.HC 版本更新 57%

Real-Time AttentionBender: Granular Interactive Network Bending of Video Diffusion Transformers

实时注意力弯曲:视频扩散变换器的粒度交互式网络弯曲

Adam Cole, Rebecca Fiebrink, Mick Grierson

机构 * Creative Computing Institute(创意计算研究所) University of the Arts London(伦敦艺术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出实时注意力弯曲工具,通过操纵视频扩散变换器的自注意力、交叉注意力及前馈网络,实现逐层、逐步、逐令牌的交互式生成控制,增强艺术家的创作代理与模型材料亲密性。

Comments 5 pages, 4 figures. Accepted to ACM Creativity & Cognition XAIxArts Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08304 2026-06-09 cs.CR cs.AI 版本更新 57%

Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions

保障检索增强生成:攻击、防御与未来方向的分类法

Yuming Xu, Mingtao Zhang, Zhuohan Ge, Haoyang Li, Nicole Hu, Yongqi Zhang, Zhiyuan Wen, Jason Chen Zhang, Qing Li, Lei Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出SLOT分类法,从攻击面、防御层、目标(遵循CIA属性)和攻击目标四个维度系统化梳理检索增强生成(RAG)的安全风险与防御,并指出知识访问管道中的结构性错配,最后展望未来方向。

Comments We have curated a paper list on RAG security in https://github.com/TreeAI-Lab/Awesome-RAG-Security, and we warmly welcome authors who wish to have their new work included to contact us via email

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17245 2026-06-09 cs.AI 版本更新 57%

Web Agents Should Use Typed Actions Instead of Click-Based Browsing

Web 智能体应使用类型化动作而非基于点击的浏览

Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出通过语义层支持的类型化动作(web verbs)替代低层交互原语,以构建可靠、可审计的Web智能体,并通过案例展示其优势。

Comments Accepted to the ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03256 2026-06-09 cs.CV 版本更新 57%

Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training

Muses: 无需训练的设计、组合与生成不存在的幻想3D生物

Hexiao Lu, Xiaokun Sun, Zeyu Cai, Hao Guo, Ying Tai, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) China Agricultural University(中国农业大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出Muses,首个无需训练的馈送式幻想3D生物生成方法,利用3D骨架实现结构感知的设计、组合与生成,在视觉保真度和文本对齐方面达到最优。

Comments Project page: https://luhexiao.github.io/Muses.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09232 2026-06-09 cond-mat.mes-hall 新提交 50%

Strain-Induced Tuning of Third-Harmonic Generation in Monolayer Black Phosphorene

单层黑磷烯中应变诱导的三次谐波产生调谐

Yan Meng, Kainan Chang, Wei Song, Yuwei Shan, Jin Luo Cheng, Luxia Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 基于紧束缚模型和半导体布洛赫方程,揭示了应变工程调控单层黑磷烯三次谐波产生的微观机制,发现面内压缩和面外拉伸应变增强THG并导致红移,而面内拉伸和面外压缩则抑制THG并导致蓝移,调谐效率遵循z>y>x顺序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08004 2026-06-09 cond-mat.stat-mech cond-mat.mtrl-sci 新提交 50%

Tracking metastable phases by complex Lee-Yang zeros

通过复李-杨零点追踪亚稳相

Yi-Hua Dong, Ling Liu, Fang-Cheng Wang, Qi-Jun Ye, Xin-Zheng Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过复李-杨零点(LYZs)在复热场平面中刻画亚稳相(MPs),并在可调态密度玩具模型和周期性驱动系统中数值验证,揭示了MP随参数增大而稳定化的机制,为相图分析和非平衡态调控提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06399 2026-06-09 cs.CL 版本更新 50%

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

CollabSim: 一种基于CSCW的方法,通过受控多智能体实验研究LLM智能体的协作能力

Jiaju Chen, Bo Sun, Yuxuan Lu, Yun Wang, Dakuo Wang, Bingsheng Yao

机构 * Northeastern University(东北大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出CollabSim框架,结合CSCW理论定义协作能力、控制交互条件并探测智能体内部状态,以系统分析LLM多智能体系统的协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02676 2026-06-09 physics.optics 版本更新 50%

Valley-locked Optical Spin Merons in Valley Photonic Crystal Waveguides

谷锁定的光旋磁体在谷光子晶体波导中的研究

Lvjin He, Shanshan Chen, Ziyang Chen, Lan Zhang, Lipeng Wan, Weimin Deng, Tianbao Yu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出利用拓扑保护的谷边态实现光旋磁体在芯片上的稳健定向传输,通过谷自由度实现谷锁定的旋磁体,为光子系统中的应用提供新途径。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07906 2026-06-09 physics.flu-dyn 版本更新 50%

Tuning Cross-stream Lift in Viscoelastic Shear: Distinct Hydrodynamic Signatures of Force-bearing and Force-free Mechanisms

调节粘弹性剪切中的跨流提升:力承载与力自由机制的水动力特征

Soumyodeep Chowdhury, Kushagra Tiwari, Jitendra Dhakar, Akash Choudhary

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究了粒子在粘弹性剪切流中受外力驱动时的升力和阻力修正,发现驱动机制决定升力方向,力承载机制与力自由机制产生相反的升力。通过推导流场和应力,证明其差异源于不同的水动力扰动,产生不同的聚合物应力分布。

Comments Four figures, revised version of manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04464 2026-06-09 cs.CY econ.GN q-fin.EC 版本更新 50%

Bounded by Risk, Not Capability: Quantifying AI Occupational Substitution Rates via a Tech-Risk Dual-Factor Model

受风险限制而非能力:通过技术-风险双因素模型量化AI职业替代率

Shuyao Gao, Minghao Huang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过技术-风险双因素模型量化AI职业替代率,揭示了职业替代并非瞬间发生,而是渐进过程,并指出算法概率无法涵盖专家受专业责任限制的'机构溢价'。

Comments 32 pages, 4 figures. v2: added link to the reproducibility repository (https://github.com/ShuyaoGao/bounded-risk-oai), updated author email, and updated several references

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14402 2026-06-09 cs.SI cs.GT 版本更新 50%

A Unified Framework for Scalable and Robust Paper Assignment

可扩展且稳健的论文分配统一框架

Michael Cui, Chenxin Dai, Yixuan Even Xu, Fei Fang

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出RAMP框架,通过线性化扰动最大化目标和属性感知采样,在大型会议中平衡分配质量、多样性和鲁棒性,实现20分钟内处理2万篇论文和审稿人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23457 2026-06-09 cs.CR 版本更新 50%

Future-Proofing Authentication Against Insecure Bootstrapping for 5G Networks: Feasibility, Resiliency, and Accountability

面向5G网络的不安全启动认证的未来防护:可行性、弹性与可问责性

Saleh Darzi, Mirza Masfiqur Rahman, Imtiaz Karim, Rouzbeh Behnia, Attila A Yavuz, Elisa Bertino

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对5G初始启动阶段缺乏基站认证导致易受虚假基站攻击的问题,提出BORG框架,采用分层身份基门限签名与故障停止属性,实现分布式信任、可验证伪造检测和抗量子审计日志,并在真实5G测试平台上验证了其低开销和紧凑签名。

Comments 21 pages, 3 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 31 篇

2606.08729 2026-06-09 cs.RO cs.LG 新提交 88%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);robot learning(abstract);robotic(abstract)

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09292 2026-06-09 cs.RO cs.SY eess.SY 新提交 83%

Dual Quaternion-Based Unscented Kalman Filter with Visual Inertial Odometry for Navigation in GPS-Denied Environments

基于对偶四元数的无迹卡尔曼滤波与视觉惯性里程计在GPS拒止环境中的导航

Mohamed Khalifa, Hashim A. Hashim

机构 * Carleton University(卡尔顿大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出一种基于对偶四元数的无迹卡尔曼滤波(DQUKF)结合视觉惯性里程计(VIO),在GPS拒止环境下实现高精度状态估计,在EuRoC数据集上位置RMSE达0.2584米。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 83%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08992 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Central South University(中南大学) Jiangsu University(江苏大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏