arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-29 至 2026-06-29 共收录 11 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2603.09241 2026-06-29 cs.CV cs.RO 版本更新 88%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16947 2026-06-29 cs.CV cs.RO 版本更新 87%

Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

基于图像的机器人地理定位:黑盒视觉语言模型是否已经足够?

Sania Waheed, Bruno Ferrarini, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * University of Southampton(南安普顿大学) MyWay srl Queensland University of Technology(昆士兰科技大学) University of Essex(埃塞克斯大学)

专题命中 具身导航 :robotics(title,abstract);navigation(abstract,comments);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文首次系统研究黑盒生成式视觉语言模型作为独立零样本地理定位系统的潜力,发现其在粗粒度定位上表现良好,但在细粒度定位上因现实变化而显著退化。

Comments Accepted to the ICRA 2026 Workshop on Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding (MM-SpatialAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27871 2026-06-29 cs.RO 新提交 83%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27929 2026-06-29 cs.RO 新提交 81%

When Multi-Robot Systems Meet Agentic AI:Towards Embodied Collective Intelligence

当多机器人系统遇见智能体AI:迈向具身集体智能

Yuxuan Yan, Yuanyuan Jia, Qianqian Yang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 具身导航 :robotics(abstract);embodied AI(abstract);embodied agent(abstract);navigation(abstract)

AI总结 本文提出具身集体智能(ECI)范式,通过共感知、共行动和共演化使机器人团队共享世界上下文、任务进度和技能经验,并以导航实验验证共享世界记忆继承的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27783 2026-06-29 q-bio.NC cs.LG cs.NE 新提交 57%

CANNs: A Toolkit for Research on Continuous Attractor Neural Networks

CANNs:连续吸引子神经网络研究工具包

Sichao He, Aiersi Tuerhong, Shangjun She, Tianhao Chu, Yuling Wu, Junfeng Zuo, Si Wu

机构 * School of Psychological and Cognitive Sciences, Peking–Tsinghua Center for Life Sciences, PKU-IDG/McGovern Institute for Brain Research, Center of Quantitative Biology(心理与认知科学学院,北京清华大学生命科学中心,北京大学IDG/麦克戈文脑科学研究院,定量生物学中心)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 提出统一连续吸引子神经网络(CANN)研究流程的开源工具包,包含Python库、Rust加速后端和吸引子结构分析器,支持从仿真到实验数据分析的完整工作流。

Comments Code: https://github.com/Routhleck/canns ; Rust backend: https://github.com/Routhleck/canns-lib

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27964 2026-06-29 cs.CV 新提交 57%

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Directing the World: 具有组合式人体-相机控制的快速自回归视频生成

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 具身导航 :world model(abstract);分类 cs.CV

AI总结 提出一种快速自回归框架,通过解耦控制学习并保持统一视频先验,实现人体运动和相机轨迹的组合控制,支持稳定长程生成与高视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27897 2026-06-29 cs.CV cs.HC 新提交 57%

A Multi-Attribute Latent Space for Visual Analysis of Watches

用于手表视觉分析的多属性潜在空间

Kai Lawonn, Tobias Günther, Monique Meuschke

机构 * Leipzig University(莱比锡大学) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) Otto von Guericke University of Magdeburg(马格德堡奥托·冯·格里克大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出一种多属性潜在空间模型与交互式可视化系统,通过分离表盘颜色、设计等属性图并融合UMAP,支持手表集合的开放式探索与比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27656 2026-06-29 eess.SY cs.RO cs.SY 新提交 57%

Characterizing Driver Interactions with Autonomous Vehicles via Response Maps

通过响应图刻画驾驶员与自动驾驶车辆的交互

Dave Broaddus, Rachel DiPirro, Chishang, Yang, Dan Calderone, Wendy Ju, Meeko Oishi

机构 * University of New Mexico(新墨西哥大学) Cornell Tech(康奈尔科技)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文基于博弈论中的响应图概念,利用驾驶模拟器数据线性表示驾驶员行为,发现驾驶员加速行为可被响应图捕获,且对自动驾驶车辆的让行、不让行和响应行为有显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23959 2026-06-29 cs.CL cs.LG 新提交 57%

Does My Embedding Reflect That $A = B$? Evaluating Mathematical Equivalence in Embedding Models

我的嵌入是否反映了 $A = B$?评估嵌入模型中的数学等价性

Jiaying Ye, Samarth Rao, Leo Carlin, Kedar Chintalapati, Saharsh Bhargava, Rachit Jaiswal, Michael Zhou, Jared Darlington, Jiahe Lu, Jarod Alper, Vasily Ilin, Henry Kvinge

机构 * University of Washington(华盛顿大学) Axiom Math Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 针对当前嵌入模型无法识别数学等价陈述的问题,提出MELD数据集和对比学习方法,使嵌入能对齐不同形式化的数学表述。

Comments 18 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27865 2026-06-29 cs.IR 新提交 50%

From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling

从引导到序列建模:个性化落地页建模的统一生成框架

Fan Li, Chang Meng, Jiaqi Fu, Shuchang Liu, Tianke Zhang, Xueliang Wang, Xiaoqiang Feng, Yongqi Liu, Kaiqiao Zhan

专题命中 具身导航 :navigation(abstract)

AI总结 针对现有强化学习方法在个性化落地页建模中的马尔可夫假设局限和时序差分学习误差累积问题,提出基于决策变换器的统一生成框架GLAN,通过全局-局部视角建模用户跨日消费动态和会话级细粒度信号,在快手平台上线后DAU和用户生命周期分别提升0.158%和0.108%。

Comments arXiv admin note: text overlap with arXiv:2507.23459

详情

展开后加载摘要…

URL PDF HTML 收藏