arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-25 至 2026-06-25 共收录 57 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 13 篇

2606.25503 2026-06-25 cs.RO cs.CV 新提交 89%

AISPO: Enhancing Depth Reliability for Robotic Manipulation of Non-Lambertian Objects via Affine-Invariant Shape Prior

AISPO: 通过仿射不变形状先验增强非朗伯体物体机器人操作的深度可靠性

Zhiming Chen, Linfang Zheng, Kun Zhang, Hyung Jin Chang, Wei Zhang, Hongyu Yu, Hua Chen

机构 * The Hong Kong University of Science & Technology(香港科技大学) The University of Hong Kong(香港大学) Southern University of Science & Technology(南方科技大学) Zhejiang University(浙江大学) LimX Dynamics

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 提出AISPO深度补全框架,结合多尺度RGB-D特征融合与仿射不变形状先验,提升非朗伯体物体(如透明、高反光表面)的深度可靠性,显著提高机器人抓取成功率。

Comments Published in IEEE Robotics and Automation Letters. 8 pages. Accepted April 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 7996-8003, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26093 2026-06-25 cs.RO 新提交 83%

ForceBand: Learning Forceful Manipulation with sEMG

ForceBand: 利用表面肌电信号学习有力操作

Botao He, Zhi Wang, Linna Kuang, Ishaan Ghosh, Jitendra Malik, Cornelia Fermuller, Tingfan Wu, Jiayuan Mao, Ruoshi Liu, Haozhi Qi, Yiannis Aloimonos

机构 * Amazon FAR(亚马逊 FAR) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人操作 :manipulation(title,abstract);robot policy(abstract);分类 cs.RO

AI总结 提出ForceBand,一种低成本腕戴式sEMG系统,通过预测手指力来增强人类演示数据,用于机器人有力操作策略学习,在多种物体上实现87%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25575 2026-06-25 cs.RO 新提交 83%

One Body, Two Minds: Variable Autonomy Approach for a Co-embodied Robotic Hand

一个身体,两个心智:共体机械手的可变自主性方法

Piotr Koczy, Yuchong Zhang, Danica Kragic, Michael C. Welle

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) INCAR Robotics AB(INCAR Robotics AB公司)

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出共体可变自主性方法,让人类与机器人共享同一身体并在任务阶段切换自主级别,通过用户研究验证了该方法在辅助机器人中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25295 2026-06-25 cs.RO 新提交 83%

DynaMOMA: Instantaneous Prediction of Grasp Poses for Mobile Manipulation of Dynamic Objects

DynaMOMA:动态物体移动操作的抓取姿态瞬时预测

Zhinan Yu, Junyan Xu, Jiazhao Zhang, Zheng Qin, Yijie Tang, Yuhang Huang, Yihan Cao, Zhiyuan Yu, Yongjun Wang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) CFCS, Peking University(北京大学前沿计算研究中心) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防科技创新研究院) Wuhan University(武汉大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出DynaMOMA框架,结合基于锚点的扩散模型预测瞬时抓取轨迹与全身控制策略,实现动态物体移动操作,在仿真和真实实验中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09457 2026-06-25 cs.RO 新提交 79%

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

$ω$-EVA:基于潜在交互世界模型的构想、验证与行动

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 机器人操作 :world model(title,abstract);分类 cs.RO

AI总结 提出$ω$-EVA框架,通过潜在交互世界模型实现“构想-验证-行动”循环,利用动作条件潜在动力学和语言条件流策略生成动作,无需生成未来视频,在多种机器人操作任务中提升策略性能。

Comments Add some ablation experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 78%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.AI、cs.CV

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 78%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07803 2026-06-25 eess.SY cs.SY 新提交 78%

Stable but Unsafe: Agent-Driven Cyber-Physical Systems Under Gain Manipulation Attacks

无安全性的稳定性:对自主网络物理系统的增益操纵攻击

Ali Eslami, Jiangbo Yu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文形式化自主网络物理系统中的增益操纵攻击,通过三轴攻击模型和分类法,揭示稳定性保持的增益替换仍可产生远超安全限度的瞬态放大,并利用Bauer-Fike特征值界和Kreiss矩阵定理推导隐蔽条件和最坏影响。

Comments 6 pages, 2 figures, 2 tables. Submitted to IEEE L-CSS for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25953 2026-06-25 cs.RO cs.CV 新提交 73%

DSP-SLAM++: A Unified Framework for Multi-Class, High-Fidelity Object SLAM in the Wild

DSP-SLAM++:面向野外多类高保真物体SLAM的统一框架

Ahmad Kourani, Ghina Daoud, Daniel Asmar, Imad Elhajj

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DSP-SLAM++,通过异步建图流水线和单目鱼眼-激光雷达传感器融合,在支持多类物体的同时实现实时高保真物体建模,将最大物体处理延迟降低70%。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25619 2026-06-25 cs.CV 新提交 57%

ScaleHP: Estimating Hand Pose in Metric Space

ScaleHP: 在度量空间中估计手部姿态

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Visincept International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) South China University of Technology(华南理工大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。

Comments 27 pages, 8 figures, 6 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25348 2026-06-25 cs.RO 新提交 57%

Self Capacitive Tactile Sensor System designed for Companion Robots

面向伴侣机器人的自电容触觉传感器系统

Mohsin Ali, Hidenobu Sumioka, Shuhei Ikemoto

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology(九州工业大学 生命体工学研究科) Advanced Telecommunications Research Institute International(国际电气通信基础技术研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种基于自电容原理的简单、可扩展触觉传感器系统,采用单层导电织物和FPGA决策树分类器,实现100点阵列的实时、低延迟触觉检测,满足伴侣机器人全身触觉需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 57%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25533 2026-06-25 cs.CR cs.CL 新提交 50%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 7 篇

2606.25497 2026-06-25 cs.RO 新提交 85%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25206 2026-06-25 cs.RO cs.AI cs.CL 新提交 84%

RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory

RAVEN: 基于视觉-空间-时间记忆的长期推理与导航

Yixun Hu, Zhicheng Zheng, Lihan Zha, Chunwei Xing, Rajdeep Singh, Omar Hossain, Antonio Loquercio, Dhruv Shah

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。

Comments Project website: https://ravenmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26047 2026-06-25 cs.RO 新提交 79%

Learning Robot Visual Navigation in Crowds via Intention-Aware Scene Representations

通过意图感知场景表示学习机器人在人群中的视觉导航

Han Bao, Bingyi Xia, Hanjing Ye, Yu Zhan, Hao Cheng, Baozhi Jia, Wenjun Xu, Jiankun Wang

机构 * Shenzhen Key Laboratory of Robotics Perception and Intelligence, Department of Electronic and Electrical Engineering, SUSTech(南方科技大学电子与电气工程系深圳市机器人感知与智能重点实验室) Jiaxing Research Institute, SUSTech(南方科技大学嘉兴研究院) Research Institute of MA&EI, Peng Cheng Laboratory(鹏城实验室机器人与人工智能研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出iCrowdNav方法,利用时空编码器和Intent-Interact Former从视觉观测中提取场景占用特征和人体姿态意图,通过深度强化学习实现高效人群导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25504 2026-06-25 cs.RO 新提交 79%

GROVE: Grounded Pedestrian Simulation via Natural Language for Interactive Social Robot Navigation

GROVE: 基于自然语言的地面行人仿真用于交互式社交机器人导航

Duc Tai Nguyen, Volodymyr Shcherbyna, Anh Do Duc, Zhengcheng Shen, Teham Buiyan, Linh Kästner

机构 * Singapore Management University(新加坡管理大学) Technical University Berlin(柏林工业大学) National University of Singapore(新加坡国立大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出GROVE框架,通过自然语言指令生成逼真且具有社交挑战性的行人仿真场景,结合多种SotA方法模拟长时人类行为、中时行人导航和短时机器人社交交互,缩小仿真到现实的差距。

Comments Accepted at IROS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25119 2026-06-25 cs.RO 新提交 79%

SurveilNav: Collaborative Object Goal Navigation with Robot and Surveillance System

SurveilNav: 机器人与监控系统协同的目标导航

Ming-Ming Yu, Qunbo Wang, Rongtao Xu, Yanghong Mei, Yirong Yang, Longteng Guo, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学) ATeam University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25366 2026-06-25 cs.RO cs.AI 新提交 62%

Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield

非对称可靠性航天器自主性:协同设计有能力的学得制导导航控制系统与经过验证的、适应感知的运行时防护盾

Alireza Shojaei

机构 * Myers-Lawson School of Construction, Virginia Tech(弗吉尼亚理工大学迈尔斯-劳森建筑学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出AMPLE-GNC三层制导导航控制系统,结合学得组件与运行时防护盾,实现深空任务自主性的能力与可认证性;通过边缘指挥官、故障自适应控制器和适应感知恢复证书,在仿真中验证了高自主性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19190 2026-06-25 cs.RO 新提交 57%

FAST-LIVGO: A Degeneracy-Robust LiDAR-Inertial-Visual-GNSS Fusion Odometry

FAST-LIVGO:一种退化鲁棒的LiDAR-惯性-视觉-GNSS融合里程计

Zhiyu Chen, Chunran Zheng, Jiayu Wen, XiaoLei Zhang, Jiaming Xu, Feng Pan, Yukang Cui

机构 * College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) College of Automation, Harbin Engineering University(哈尔滨工程大学自动化学院)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 提出一种基于误差状态迭代卡尔曼滤波的紧耦合LiDAR-惯性-视觉-GNSS融合框架,通过动态时间规整的时空对齐模块、多普勒和时差载波相位观测模型以及退化感知的双模式异常值拒绝策略,在长期大尺度动态环境中实现高精度鲁棒的状态估计。

Comments Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 6 篇

2606.25473 2026-06-25 cs.CV cs.LG 新提交 81%

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24946 2026-06-25 cs.LG cs.RO 新提交 81%

Conformal Orbit-Valid Trust Horizons for Equivariant World Models

等变世界模型的共形轨道有效信任视界

Hongbo Wang

机构 * Department of Mathematics, Stony Brook University(石溪大学数学系)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 针对具有已知群对称性的潜在世界模型,提出一种共形校准的信任视界认证方法,利用等变性实现轨道常数认证,实验验证了其保守性和非空性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25368 2026-06-25 cs.CV 新提交 79%

Hypergraph Normal World Models for Logical Visual Anomaly Detection

超图常态世界模型用于逻辑视觉异常检测

Weizhi Nie, Zibo Xu, Weijie Wang, Yuting Su

机构 * Tianjin University(天津大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出超图常态世界模型,利用DINOv2补丁令牌构建超图统计,通过信息商分离局部、关系和超边证据,在MVTec LOCO上逻辑异常AUROC从0.8434提升至0.9279。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25421 2026-06-25 cs.CL 新提交 78%

Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making

超越下一观测预测:面向序贯决策的智能体自创世界建模

Guangfeng Cai, Kaibing Yang, Shuo He, Yu Li, Shengtian Yang, Jiaqi Lv, Lei Feng

机构 * Southeast University(东南大学) Meituan(美团)

专题命中 具身推理 :world model(title,abstract)

AI总结 提出智能体自创世界建模(AAWM),根据策略决策需求构建训练目标,而非预测下一观测,实验证明其比下一观测预测提供更有效的学习信号。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25241 2026-06-25 cs.RO 新提交 70%

GRAFT: Graph-Based Affordance Transfer via Part Correspondence

GRAFT: 基于部件对应的图结构功能迁移

Mengying Lin, Utkarsh Mishra, Ajay Mandlekar, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出GRAFT框架,利用部件级图表示和几何感知对应,通过单次演示实现零样本操作迁移,解决泛化到未见物体的挑战。

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 8746-8755

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 62%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 5 篇

2606.25800 2026-06-25 cs.LG cs.RO 新提交 73%

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

ROAD-VLA:通过自蒸馏实现视觉-语言-动作模型的鲁棒在线自适应

Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对稀疏奖励下VLA模型在线自适应困难,提出ROAD-VLA框架,通过优势引导的自蒸馏在动作空间构建近端教师,将稀疏奖励转化为密集token级监督,并在7个机器人操作环境中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 70%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26006 2026-06-25 cs.RO cs.AI 新提交 62%

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调

Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 57%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏