arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-24 至 2026-07-24 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 4 篇

2606.23672 2026-07-24 cs.AI 版本更新 79%

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

教LLM字符串匹配、回溯与错误恢复:为组合爆炸的位操作谜题推导基和真值表

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

机构 * NVIDIA

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI

AI总结 提出一种新方法,通过字符串相似性、结构化搜索和自主错误恢复,避免复杂布尔逻辑,解决位操作谜题中的组合爆炸问题,实现96%以上验证准确率。

Comments 22 pages, 4 figures, 2 tables. 7th Place Solution for the NVIDIA Nemotron Model Reasoning Challenge (Kaggle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 70%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13368 2026-07-24 q-bio.NC 版本更新 50%

The Influence of Width Ratios on Structural Beauty in Male Faces

宽度比对男性面孔结构美感的影响

Theresa Tennstedt, Benjamin Knopp, Dominik Endres

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究探讨男性面孔宽度比对美感的影响,发现平均比例与感知吸引力相关,强调控制图像处理和种族变量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02461 2026-07-24 math.OC 版本更新 50%

Maximal entropy in the moment body

矩体中的最大熵

Didier Henrion

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究确定点是否在矩体内的问题,基于量子信息论技术,提出全局最小化光滑严格凸对数划分函数的方法,通过数值实验揭示对矩阵大小的三次方依赖及预言机两种情况,指出主要瓶颈在于梯度存储和操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2607.18042 2026-07-24 cs.CV cs.AI 版本更新 81%

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

行动前预测:基于未来状态条件的视觉语言导航

Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang

机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。

Comments 9 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01043 2026-07-24 cs.RO cs.AI 版本更新 81%

DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation

DART-VLN:离散视觉语言导航的测试时记忆衰减与反循环正则化

Shaoheng Zhang, Zhichen Li, Jie Mei

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出无需训练的测试时控制框架DART-VLN,通过记忆衰减和反循环正则化改善离散视觉语言导航的局部回溯和历史证据过时问题,提升路径效率与导航性能。

Comments Accepted by the 2026 IEEE International Conference on Systems, Man, and Cybernetics (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 81%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 79%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20801 2026-07-24 cs.RO quant-ph 版本更新 79%

Q-SpiRL: Quantum Spiking Reinforcement Learning for Adaptive Robot Navigation

Q-SpiRL:量子脉冲强化学习用于自适应机器人导航

Mohamed Khair Altrabulsi, Nouhaila Innan, Alberto Marchisio, Muhammad Kashif, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出Q-SpiRL框架,结合量子增强的脉冲神经网络,实现了在动态环境中高效稳定的机器人导航,通过实验验证了其在任务完成、轨迹效率和运动平滑度之间的最佳平衡。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11485 2026-07-24 cs.RO 版本更新 79%

i2Nav-Robot: A Large-Scale Indoor-Outdoor Robot Dataset for Multi-Sensor Fusion Navigation

i2Nav-Robot:用于多传感器融合导航的大规模室内外机器人数据集

Hailiang Tang, Tisheng Zhang, Liqiang Wang, Xin Ding, Man Yuan, Zhiyu Xiang, Jujin Chen, Yuhan Bian, Shuangyan Liu, Yuqing Wang, Guan Wang, Xiaoji Niu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对无人地面车辆导航数据集不足,提出i2Nav-Robot数据集,集成多模态传感器,经在线硬件同步和离线校准获取精确时间戳,含十个大规模序列,经评估数据质量高,对推进车辆导航研究实用。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新 62%

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新 62%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 具身导航 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12997 2026-07-24 cs.AI cs.CL 版本更新 57%

WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance

WebCoach:具有跨会话记忆引导的自我进化网络代理

Genglin Liu, Shijie Geng, Sha Li, Hejie Cui, Sarah Zhang, Xin Liu, Tianyi Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00934 2026-07-24 cs.LO cs.RO 版本更新 57%

pacSTL: PAC-Bounded Signal Temporal Logic from Data-Driven Reachability Analysis

pacSTL: 基于数据驱动可达性分析的PAC有界信号时序逻辑

Hanna Krasowski, Elizabeth Dietrich, Emir Cem Gezer, Roger Skjetne, Asgeir Johan Sørensen, Murat Arcak

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出pacSTL框架,结合PAC有界可达集预测与区间STL,通过优化问题计算原子鲁棒性上下界并传播,实现规范级别的PAC有界鲁棒性评估,用于不确定动态系统的验证与监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17781 2026-07-24 math.DS math.OC stat.CO 版本更新 50%

Geometry-Consistent Bayesian Filtering under Structural Model Uncertainty: A Geometric Projection Particle Filter

模型不确定性下的几何投影粒子滤波

Surya Ratna Prakash D, Soumyendu Raha

专题命中 具身导航 :navigation(abstract)

AI总结 研究针对自主GNC系统中模型不确定性下的非线性状态估计问题,提出几何投影粒子滤波器,通过将动力学投影到测量一致子空间减少不匹配,在月球下降导航场景中评估,有效减少粒子退化,提高估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2605.26856 2026-07-24 q-bio.NC cs.AI cs.RO 版本更新 62%

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

感觉调节网络:可停性作为对象导向现象学的架构基础

G. Nagarjuna, Durgaprasad Karnam

机构 * Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那) Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)

专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出感觉调节网络(SMN)作为具身认知的架构,通过对手动力学和可停性机制,将对象导向现象学(胡塞尔意义)的意向性建立在身体组织的结构特征上,从而调和认知主义与4E认知的争论。

Comments 51 pages, main body 39 pages + References 6 pages, Appendices 6 pages, Tables 3, and Figures 16

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 57%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 76%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 85%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :robotics(title);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06954 2026-07-24 cs.RO cs.SY eess.SY 版本更新 70%

Is Your Safe Controller Actually Safe? A Critical Review of CBF Tautologies and Hidden Assumptions

你的安全控制器真的安全吗?CBF永真式和隐藏假设的批判性审查

Taekyung Kim

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文批判性地审查了CBF在机器人安全中的应用,揭示了安全控制器理论与实际实现之间的差距,并提供了构建实际安全论证的实用指南。

Comments Technical Report. Interactive web demo: https://cbf.taekyung.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20220 2026-07-24 cs.RO cs.AI 版本更新 62%

What Matters for Simulation to Online Reinforcement Learning on Real Robots

在真实机器人上在线强化学习中什么至关重要

Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

机构 * ETH Zurich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究探讨了在真实机器人上实现稳定在线强化学习的关键设计选择,发现某些默认设置可能有害,而稳健的设计选择能提高学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 3 篇

2512.19178 2026-07-24 cs.RO cs.AI 版本更新 73%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 62%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04038 2026-07-24 cs.RO 版本更新 57%

Force-Aware Residual DAgger via Trajectory Editing for Precision Insertion with Impedance Control

具备力感知的残差数据集聚合轨迹编辑用于阻抗控制的精确插入

Yiou Huang, Ning Ma, Weichu Zhao, Zinuo Liu, Jun Sun, Qiufeng Wang, Yaran Chen

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TER-DAgger框架,通过优化轨迹编辑学习残差策略,减少协变量偏移,结合力感知的失败预判机制和阻抗控制框架,提升精确插入任务的成功率。

Comments 8 pages, 3 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏