arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-20 至 2026-08-20 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8 篇

2608.15938 2026-08-20 cs.RO 版本更新 83%

Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies

机器人学中的开环执行再探讨:迈向反应式、高性能策略

Michael Zeng, Abhinav Agarwal, Ajay Bati, Brian Lee, Siddharth Ancha, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Mundane Systems Inc.(芒德系统公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究探讨机器人开环执行机制,发现长开环执行主要助短上下文策略模仿非马尔可夫示范,专家非马尔可夫性影响远超复合误差,长上下文下闭环策略更优,推动反应式策略范式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18672 2026-08-20 cs.RO cs.AI 新提交 76%

Orienteering Problem with Uncertain Time-Varying Rewards: Framework and Benchmark for Everyday Service Robotics

带不确定时变奖励的定向越野问题:面向日常服务机器人的框架与基准

Masafumi Endo, Kohei Honda, Yuu Jinnai, Ryo Yonetani

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.AI

AI总结 针对日常服务机器人的带不确定时变奖励的定向越野问题,本文提出相关框架与基准,采用三种不同规划器并验证了长时域在线适应规划的有效性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09874 2026-08-20 cs.CV cs.AI cs.CL 版本更新 62%

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。

Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18632 2026-08-20 cs.RO 新提交 57%

Evaluation of Monocular SLAM Systems on High-Altitude Nadir UAV Footage

高空天底视角无人机影像下单目SLAM系统的评估

Gašper Spagnolo, Matej Dobrevski, Danijel Skočaj

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 该研究评估5种单目SLAM系统在高空天底视角无人机影像的性能,发现DROID-SLAM表现最优,MASt3R-SLAM水平误差最低,但所有系统垂直位置估计差、大面积轨迹失真,纯视觉单目SLAM不足以可靠应用于航空导航。

Comments 6 pages, submitted to ERK 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18624 2026-08-20 cs.CV 新提交 57%

Evaluation of Image Matching Methods for Visual Odometry on UAVs

无人机视觉里程计的图像匹配方法评估

Gašper Spagnolo, Luka Čehovin Zajc, Matej Dobrevski

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 该研究针对无人机视觉里程计任务,在合成数据集上评估多种图像匹配方法,发现RoMa匹配器性能最优,SIFT特征表现优于部分最新最先进方法,为无人机视觉导航提供参考。

Comments 5 pages, published in the Proceedings of the 33rd International Electrotechnical and Computer Science Conference ERK 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22240 2026-08-20 cs.CV 版本更新 57%

OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space

OccDirector:基于语言的4D占用空间中行为与交互生成

Zhuding Liang, Tianyi Yan, Dubing Chen, Jiasen Zheng, Huan Zheng, Cheng-zhong Xu, Yida Wang, Kun Zhan, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau, Macau, China(SKL-IOTSC、CIS、澳门大学、澳门、中国) Li Auto Inc, Beijing, China(Li Auto Inc、北京、中国)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出OccDirector框架,通过自然语言生成4D占用空间动态,解决复杂多代理交互生成问题,引入多级语言指令数据集和评估基准,实现语言驱动的行为编排。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07464 2026-08-20 cs.RO cs.AI cs.CV 版本更新 56%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 机器人数据与评测 :分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏