arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-08 至 2026-07-08 共收录 89 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 30 篇

2603.04778 2026-07-08 physics.optics 50%

Total Angular Momentum Coherent State Fields

总角动量相干态场

D. Aguirre-Olivas, G. Mellado-Villaseñor, B. Perez-Garcia, B. M. Rodriguez-Lara

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出基于 $su(2)$ 李代数的总角动量相干态场框架,实现偏振和空间结构的联合控制,通过单一复参数实现连续对称性保持调节。

Comments 14 pages, 5 figures

Journal ref Opt. Lett. 51, 3221--3224 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08906 2026-07-08 quant-ph physics.atom-ph physics.optics 版本更新 50%

A 10 Megahertz Spatial Light Modulator

一个10兆赫兹的空间光调制器

Xin Wei, Zeyang Li, Abhishek V. Karve, Adam L. Shaw, David I. Schuster, Jonathan Simon

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究旨在解决光场快速可编程整形工具缺乏的问题,介绍一种基于宽带光相位调制器和高分辨率二维光谱仪的新空间光调制器,可实现兆赫兹速率等多种功能,为物质快速光学操纵开辟新视野。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 14 篇

2607.05765 2026-07-08 cs.CV cs.RO 新提交 81%

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Image2Sim:通过生成神经模拟器扩展具身导航

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学) HKUST(香港科技大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对具身导航缺乏优质交互环境的问题,提出Image2Sim实时神经模拟框架,通过解耦3D空间锚定与观察合成构建环境,能大规模生成相关数据,训练的导航模型在基准测试中有提升且可迁移,为具身导航提供实用训练基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05794 2026-07-08 cs.AI 新提交 79%

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

从被动检索到主动记忆导航:学习将记忆用作结构化动作空间

Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang

机构 * Alibaba(阿里巴巴) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21046 2026-07-08 cs.CV cs.AI 版本更新 76%

SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation

SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航

Wen Jiang, Kangyao Huang, Li Wang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hanfang Liang, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua University(清华大学) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Jianghan University(江汉大学)

专题命中 具身导航 :navigation(title);分类 cs.AI、cs.CV

AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06248 2026-07-08 cs.RO 新提交 70%

RoboVAST: Automated Scenario-Based Validation of Robots at Scale

RoboVAST:大规模基于场景的机器人自动验证

Frederik Pasch, Samuel Wiest, Argentina Ortega, Nico Hochgeschwender

机构 * Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用技术大学) University of Bremen(不来梅大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对机器人系统验证中场景选择和变化的问题,提出基于场景的方法并引入RoboVAST框架,通过导航数据集演示,可实现声明式规范、插件式场景生成及可扩展执行,能区分系统故障与随机异常。

Comments 8 pages, 4 figures, submitted to CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02547 2026-07-08 cs.RO 70%

Vibration of Soft, Twisted Beams for Under-Actuated Quadrupedal Locomotion

柔顺、扭转梁体的振动用于欠驱动四足运动

Yuhao Jiang, Fuchen Chen, Jamie Paik, Daniel M. Aukes

机构 * Reconfigurable Robotics Laboratory, School of Engineering, EPFL(可重构机器人实验室,工程学院,EPFL) The School of Manufacturing Systems and Networks, Fulton Schools of Engineering(制造系统与网络学院,福尔顿工程学院)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 Flix-Walker利用柔顺螺旋梁和振动驱动实现欠驱动四足运动,通过参数优化提升运动稳健性与自主导航能力。

Comments This manuscript is under revision for possible publication in the IEEE/ASME Transactions on Mechatronics. Copyright may be transferred to IEEE if the manuscript is accepted for publication, without further notice. Supplementary videos: https://youtu.be/T3d6FT3Rx-s, https://youtu.be/nPQrhKlN02E

Journal ref IEEE/ASME Transactions on Mechatronics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06123 2026-07-08 cs.RO 新提交 57%

MP-MPPI: A Motion Primitive Guided Sampling-Based Optimizer for Model Predictive Control

MP-MPPI:一种用于模型预测控制的基于运动原语引导采样的优化器

Marlon Mathisen, Aksel Vaaler, Olav Egeland, Eleni Kelasidi

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出MP-MPPI方法,通过运动原语扩展MPPI进行结构化采样,增强收敛。在实时采样优化循环中评估相关序列,解决路径规划局限。在四旋翼模拟器及导航任务中测试,增强控制空间探索且保持实时控制特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05451 2026-07-08 cs.RO cs.HC 新提交 57%

Quaternion-Averaging-Based Adaptive Complementary Filter for Pedestrian Dead Reckoning With a Foot-Mounted AHRS

基于四元数平均的自适应互补滤波器用于带足部安装AHRS的行人航位推算

Shunsei Yamagishi, Lei Jing

机构 * Graduate School of Computer Science and Engineering, The University of Aizu(日本会津大学计算机科学与工程研究生院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对基于足部安装AHRS的行人航位推算,提出基于四元数平均的自适应互补滤波器QAACF,通过融合多源四元数并自适应调整权重,在降低计算成本的同时提高估算精度,相比现有滤波器有更低均方根误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09570 2026-07-08 cs.LG 57%

End-to-End Keyword Spotting on FPGA Using Graph Neural Networks with a Neuromorphic Auditory Sensor

基于图神经网络的FPGA端到端关键词 spotting 系统研究

Wiktor Matykiewicz, Piotr Wzorek, Kamil Jeziorek, Tomás Muñoz, Antonio Rios-Navarro, Angel Jiménez-Fernández, Tomasz Kryjak

机构 * AGH University of Krakow, Poland(克拉科夫AGH大学,波兰) Embedded Vision Systems Group(嵌入式视觉系统组) Computer Vision Laboratory(计算机视觉实验室) Robotics and Technology of Computers Lab.(机器人与计算机技术实验室) ETSII, EPS, SCORE, I3US, Universidad de Sevilla(塞维利亚大学ETSII、EPS、SCORE、I3US)

专题命中 具身导航 :robotics(abstract);分类 cs.LG

AI总结 本文提出一种基于神经形态听觉传感器和图神经网络的端到端FPGA关键词识别系统,实现低功耗实时音频处理,实验准确率达87.43%。

Comments Accepted for the ARC 2026 conference

Journal ref ARC 2026. Lecture Notes in Computer Science, vol 16514. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新 57%

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身导航 :world model(abstract);分类 cs.RO

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11279 2026-07-08 cs.RO cs.SY eess.SY 57%

N-dimensional Convex Obstacle Avoidance using Hybrid Feedback Control (Extended version)

使用混合反馈控制的N维凸障碍物避障

Mayur Sawant, Ilia Polushin, Abdelhamid Tayebi

机构 * Department of Electrical and Computer Engineering, Lakehead University(电气与计算机工程系,拉科赫大学) Department of Electrical and Computer Engineering, Western University(电气与计算机工程系,西部大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种混合反馈控制方法,用于在未知n维环境中安全避障并全局收敛至目标位置。

Comments 23 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05764 2026-07-08 cs.CL cs.IR 新提交 50%

Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents

注入还是导航?用于交易法律文件大语言模型分析的令牌高效检索

Mahmoud Hany, Mourad ElSheraey, Mahmoud Said, Peter Naoum

机构 * Syntheia Pty Ltd(合成有限公司)

专题命中 具身导航 :navigation(abstract)

AI总结 研究如何在交易法律文件分析中高效检索,对比全语料库注入与两种结构化检索模式(NAVEMBED和NAVINDEX),发现NAVINDEX在令牌占用、上下文及成本方面优势明显,还得出缓存交叉规则。

Comments 17 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05415 2026-07-08 cs.CR stat.AP 新提交 50%

How Stable Is a PNT Resilience Score? Decision-Instability of Single-Number Resilience Ratings under Framework-Aligned Weighting

PNT 弹性评分有多稳定?框架对齐加权下单数弹性评级的决策不稳定性

Chakshu Baweja

专题命中 具身导航 :navigation(abstract)

AI总结 研究 PNT 弹性评分稳定性,构建评分引擎生成子分数,探讨综合分数或成熟度等级能否作为决策稳定基础。发现综合获胜者在特定条件下稳定,重新加权会使其翻转,类别性存在问题,还指出 GNSS 冗余等情况,结论在一定扰动下成立并报告子分数。

Comments 6 pages, 5 figures, 1 table. Open-source scoring engine, study artifact, and figure pipeline (AGPL-3.0); deterministic (fixed seed). Aligned to DHS RPCF v2.0; a simulation-derived self-assessment, not a certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06212 2026-07-08 astro-ph.EP astro-ph.IM cs.SY eess.SP eess.SY 新提交 50%

The Cost of Lunar South-Polar Geometry, and Surface Beacons as the Efficient Fix: A Dilution-of-Precision Analysis

月球南极几何结构的代价以及作为有效定位方法的地面信标:精度稀释分析

Chakshu Baweja

专题命中 具身导航 :navigation(abstract)

AI总结 研究月球南极PNT架构,发现仅靠卫星达到良好几何结构所需数量远超计划,而少量地面测距信标可低成本实现,通过提供近地平线多样性大幅降低GDOP,是该区域PNT成本最低、影响力最大的改进。

Comments 8 pages, 1 figure, 2 tables. Part of the kshana open PNT program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22838 2026-07-08 cs.DB cs.IR 版本更新 50%

OrchANN: Hierarchical Orchestration for Skewed Out-of-Core Vector Search

OrchANN:用于倾斜的核外向量搜索的分层编排

Lizheng Chen, Pinhuan Wang, Shaonan Ma, Jie Zhang, Qing Wang, Zhengyi Yang, Heng Zhang, Mingxing Zhang, Fan Yang, Guihai Chen, Chen Tian, Chengying Huan

专题命中 具身导航 :navigation(abstract)

AI总结 研究在十亿规模下近似最近邻搜索的核外问题,提出OrchANN引擎,通过编排查询路由等,在严格内存限制下存储簇并利用图抽象,提升了QPS并降低延迟,比现有基线在准确性和效率平衡上表现更优。

Comments Substantially revised version; updated title, author order, and abstract

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 6 篇

2607.06401 2026-07-08 cs.AI 新提交 83%

A Definition and Roadmap for World Models

世界模型的定义与路线图

Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 本文针对人工智能领域对世界模型定义、预测内容及构建方式缺乏共识的问题,给出科学定义,讨论关键技术,提供分阶段路线图,以助力有效世界模型的开发。

Comments Technical report, 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 82%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05577 2026-07-08 cs.AI cs.CL cs.IR 新提交 79%

Narrative World Model: Narratology-Grounded Writer Memory for Long-Form Fiction

叙事世界模型:基于叙事学的长篇小说作者记忆

Mohammad Saifullah, Thomas Kornmaier, Taaha Kazi, Vasu Sharma, Aditya Sanjiv Kanade, Aanand Kumar Yadav

机构 * PocketFM(口袋FM)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究针对长篇小说作者记忆问题,提出叙事世界模型(NWM),结合叙事学时间状态图与查询条件混合检索,在多跳叙事学问答上显著优于基线,优势源于其独特表征,非提取方式。

Comments 23 pages, 4 figures; 9-page main text plus appendix. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交 70%

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.RO

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05568 2026-07-08 cs.CV cs.AI 新提交 62%

Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction

利用生成式图像模型进行无训练的原始形状抽象

Gregor Kobsik, Tim Elsner, Leif Kobbelt

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 研究如何利用生成式图像模型进行无训练的原始形状抽象,通过渲染多视图图像、分析语义部分、绘制分割掩码、重新投影和拟合超二次基元的流程,实现与类别无关且方向不变,在相关数据集上Chamfer距离最低。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05966 2026-07-08 cs.RO 新提交 61%

Imagined Rollouts are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure

想象的展开是运动学的,而非动力学的:对长期世界模型失败的诊断

Finn Rasmus Schäfer, Korbinian Moller, Yuan Gao, Christian Oefinger, Sebastian Schmidt, Johannes Betz

机构 * Autonomous Vehicle Systems Lab(自动驾驶车辆系统实验室) Technical University of Munich(慕尼黑技术大学) Data Analytics and Machine Learning Group(数据分析与机器学习小组)

专题命中 具身推理 :world model(abstract,comments);分类 cs.RO

AI总结 研究针对世界模型长期失败问题,提出用运动学与动力学重新构建的方法,通过想象的运动学一致性误差(iKCE)及扰动协议进行诊断,在DreamerV3检查点实例化,区分了运动学与动力学想象,揭示模型长期失败特征。

Comments 9 Pages Workshop Paper accepted at RSS Robot World Model Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 6 篇

2607.06564 2026-07-08 cs.RO cs.CV 新提交 84%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06501 2026-07-08 cs.RO 新提交 72%

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

不确定性下用于开放世界机器人规划的假设驱动模型扩展

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所)

专题命中 机器人基础模型 :world model(abstract);robot foundation model(abstract);分类 cs.RO;robotics(comments)

AI总结 针对开放世界机器人规划中传统方法失效的问题,提出假设驱动模型扩展框架,利用基础模型生成假设,结合自动规划与验证反馈进行迭代优化,实现自主知识扩展,推动家用服务机器人实际部署。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 71%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 70%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新 70%

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 57%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 7 篇

2606.20031 2026-07-08 cs.RO cs.AI 新提交 81%

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19990 2026-07-08 cs.AI 新提交 79%

Reward as An Agent for Embodied World Models

奖励作为具身世界模型的智能体

Pu Li, Zhigang Lin, Qiang Wu, Yongxuan Lv, Fei Wang, Shan You

机构 * ACE Robotics(ACE机器人)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出奖励智能体框架和动态感知 rollout 多样化方法,通过鲁棒验证支持更广泛探索,缓解奖励黑客问题,提升世界模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏