arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-05 至 2026-05-05 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 7 篇

2508.02046 2026-05-05 cs.RO cs.LG 81%

NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks

NaviMaster: 学习GUI和具身导航任务的统一策略

Zhihao Luo, Wentao Yan, Jingyu Gong, Min Wang, Zhizhong Zhang, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出NaviMaster,通过统一框架整合GUI导航和具身导航,采用视觉目标轨迹收集管道、统一强化学习框架和距离感知奖励,提升泛化能力。

Comments ACL 2026 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07557 2026-05-05 cs.RO 79%

AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning

AutoSpatial: 通过高效空间推理学习实现社交机器人导航的视觉-语言推理

Yangzhe Kong, Daeun Song, Jing Liang, Dinesh Manocha, Ziyu Yao, Xuesu Xiao

机构 * George Mason University(乔治·马歇尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出AutoSpatial方法,通过结构化空间接地和大规模VQA对自动生成标签,提升VLMs在社交导航中的空间推理能力,实现更准确的空间感知、运动预测、推理、行动和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00879 2026-05-05 cs.RO cs.SY eess.SY 70%

LiDAR for Rehabilitation: A Comprehensive Survey of Applications, AI Techniques, and Future Directions

激光雷达在康复中的应用:应用、人工智能技术及未来方向的综合调研

Soumia Siyoucef, Najmeddine Dhieb, Hakim Ghazzai, Eleonora Guanziroli, Franco Molteni, Gianluca Setti

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文综述了激光雷达在康复、术后护理和医院环境中的应用,分析了基于学习的方法及统计趋势,揭示了当前方法、AI处理技术和开放挑战。

Comments This paper is accepted for publication in IEEE Sensors Reviews, April, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01562 2026-05-05 cs.SE cs.AI 57%

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

神经符号代理用于无幻觉要求重用

Ahmed Ibrahim

机构 * Western University(西部大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出神经符号多代理系统,通过模型驱动 elicitation 过程实现无幻觉的要求重用,结合 LLM 和符号验证器确保结构有效性,实验显示 100% 覆盖率和 0.2% 违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01477 2026-05-05 cs.RO 57%

Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

动作代理:代理视频生成与流约束扩散的结合

Jeffrin Sam, Nguyen Khang, Yara Mahmoud, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00861 2026-05-05 eess.AS cs.AI eess.SP 57%

Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment

语音映射在文本到语音系统中的应用:基于指标的语音质量评估方法

Huanchen Cai, Sten Ternström

机构 * Division of Speech, Music and Hearing, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(语音、音乐和听觉系,电气工程与计算机科学学院,皇家理工学院)

专题命中 具身导航 :robotic(abstract);分类 cs.AI

AI总结 本文基于指标分析六种TTS模型,发现语音范围是评估模型能力的主要指标,VITS表现最佳,Glow-TTS在软发音方面表现优异,CPPs值在7-8dB时语音自然,超过10dB则显得机械。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01540 2026-05-05 eess.SP 50%

A Time-Synchronized Video Reference System for Data Analysis of Body-Attached Sensor Nodes in Outdoor Scenarios

一种用于户外场景中身体附加传感器节点数据分析的时间同步视频参考系统

Lukas Schulthess, Fabian Pleisch, Matheo Käch, Björn P. Bruhin, Michele Magno, Luca Benini, Christoph Leitner

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种轻量级时间码生成器,通过将GNSS时间转换为线性时间码信号,实现视频录制中与传感器数据的同步,减少功耗并支持更小的电池和无感硬件设计。

详情

展开后加载摘要…

URL PDF HTML 收藏