arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2606.23685 2026-06-23 cs.RO 新提交 70%

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23420 2026-06-23 cs.RO 新提交 70%

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

有目的的流动:潜在动作引导的流匹配策略用于机器人操作

Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工学院) LIRIS, UMR5205(LIRIS实验室,UMR5205)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出潜在动作引导流匹配(LAFM)框架,通过自适应先验分布库替代固定高斯分布,利用潜在动作模型选择结构对齐的初始化,解决流匹配策略中向量场纠缠问题,在真实机器人部署中成功率提升23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21188 2026-06-23 cs.RO 新提交 70%

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation

记住你做了什么?:学习部分可观察物体操作的行为记忆

Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对长时域、接触式操作中的部分可观测问题,提出压缩动作记忆策略(CAMP),通过自监督学习动作历史压缩表示,隐式追踪任务进度并从失败中学习,在多个真实和仿真任务上超越现有方法。

Comments Project website: robo-camp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20458 2026-06-19 cs.RO 新提交 70%

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation

慢速大脑,快速规划器:延迟鲁棒的VLM增强城市导航

Zhenghao "Mark'' Peng, Honglin He, Quanyi Li, Yukai Ma, Bolei Zhou

机构 * Amazon FAR(亚马逊 FAR) UCLA(加州大学洛杉矶分校) Independent(独立) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对移动机器人在人行道导航中轨迹评分差距问题,提出一种无需训练的延迟鲁棒轨迹级融合层,利用VLM选择候选轨迹并与规划器输出融合,在挑战场景下降低ADE 30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20274 2026-06-19 cs.AI 新提交 70%

Lagrange: An Open-Vocabulary, Energy-Based Sparse Framework for Generalized End-to-End Driving

Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架

Shihao Ji, HongXi Li, Zihui Song, Mingyu Li

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI

AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05461 2026-06-15 cs.AI 版本更新 70%

Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

先输出类型,后质量:基于标准的自动驾驶安全XAI可接受性评估标准

Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj, Maria Spence

机构 * NVIDIA Corporation(英伟达公司) NVIDIA GmbH(英伟达德国分公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI

AI总结 针对基于ML的自动驾驶安全标准与XAI方法输出类型不匹配的证据类型缺口,从多个安全标准推导出19项可测试证据标准,评估六类XAI方法,发现因果XAI在三个生命周期阶段结构上必需,并提出了结构可接受性概念。

Comments Accepted at SAFECOMP 2026 Workshops (SASSUR); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08666 2026-06-09 cs.RO 新提交 70%

Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

语言作为传感器:从自然语言在3D场景中进行校准的空间信念估计

Aryan Naveen, Jason Xinyu Liu, Luca Carlone, Andreea Bobu

机构 * MIT Laboratory for Information & Decision Systems(麻省理工学院信息与决策系统实验室) MIT Computer Science & Artificial Intelligence Laboratory(麻省理工学院计算机科学与人工智能实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出语言传感器模型(LSM)将自然语言描述转化为校准的空间分布,并融合到VL-Map概率框架中,实现更准确的目标定位。

Comments 18 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27476 2026-06-09 cs.CV 版本更新 70%

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM: 为视觉-语言模型高效边缘推理设计的框架

Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

机构 * Go Further. AI School of Data Science Fudan University(复旦大学数据科学学院) RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) Independent Researcher(独立研究者)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。

Comments Technique Report version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00113 2026-06-02 cs.RO 70%

World Models for Robotic Manipulation: A Survey

机器人操作的世界模型:综述

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

机构 * Department of Mechanical Engineering, The Hong Kong Polytechnic University(香港理工大学机械工程系) Department of Mechanical Engineering and Automation, Harbin Institute of Technology(哈尔滨工业大学机械工程与自动化系) School of Advanced Engineering, Great Bay University(大湾大学先进工程学院) College of Robotics Science and Engineering, Taiyuan University of Technology(太原科技大学机器人科学与工程学院) School of Data Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)数据科学学院) Department of Mechatronic Engineering, Guangdong Polytechnic Normal University(广东 polytechnic 正常大学机电工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Mechanical and Electrical Engineering, Northeast Forestry University(东北林业大学机械与电气工程学院) Greater Bay Area National Center of Technology Innovation(粤港澳大湾区国家技术创新中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文通过三个问题(预测什么未来表示、预测如何与动作连接、何时在机器人学习流程中使用预测)系统综述了机器人操作中的世界模型,将其定义为动作条件预测系统,并分类为五种表示族,提出了功能分类法,总结了基础设施角色、数据集和评估协议,揭示了从任务特定动力学预测器向预测基础设施的演变及开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27491 2026-05-28 cs.RO 70%

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

GE-Sim 2.0:迈向机器人操作综合闭环视频世界模拟器的路线图

Boxiang Qiu, Liliang Chen, Yue Liao, Nan Wang, Lintao Wang, Jiayi Luo, Wenzhi Zhao, Shengcong Chen, Di Chen, Ye Li, Chen Gao, Shuicheng Yan, Si Liu, Maoqing Yao, Guanghui Ren

机构 * AgiBot BUAA(北京航空航天大学) LV-NUS Lab(国立大学理工学院实验室) TJU(天津大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出GE-Sim 2.0,一种基于动作条件视频生成的闭环视频世界模拟器,通过重新训练数千小时真实机器人数据并新增状态专家、世界裁判和加速框架三个模块,实现高保真动作跟随和轨迹覆盖,在WorldArena排行榜上以2B参数超越专用模型和通用视频生成器,并验证了基于其生成轨迹和奖励训练的策略在真实世界中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21273 2026-05-22 cs.CV 70%

DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

DriveMA: 重新思考驾驶VLAs中的语言接口以单步元动作

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang zhao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出DriveMA,通过单步元动作替代传统的自然语言推理,解决了驾驶VLAs中语言接口的三个瓶颈问题,实现了更高效的端到端规划。

Comments We withdraw this submission because the current version contains a mismatch between the paper title, conceptual framing, and the intended contribution of the work. To avoid potential misunderstanding by readers, the authors have decided to withdraw this version and substantially revise the title, organization, and presentation before any future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15195 2026-05-15 cs.CV 70%

VGGT-$Ω$

VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据

Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Meta AI

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11196 2026-05-13 cs.LG 70%

Variational Linear Attention: Stable Associative Memory for Long-Context Transformers

变分线性注意力:适用于长上下文变换器的稳定联想记忆

Vishal Pandey, Gopal Singh

机构 * Independent Researcher(独立研究者) Metriqual

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出变分线性注意力,通过在线正则化最小二乘问题减少内存状态增长,提升长上下文变换器的稳定性与效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21232 2026-05-12 cs.AI 70%

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA:分层预测性修正以缓解级联故障

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) South China Normal University(华南师范大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI

AI总结 ReCAPA通过分层预测修正和对齐架构,缓解多模态环境中多步骤任务执行中的级联故障问题,引入新的指标量化误差传播与恢复过程,实验表明其在多个代理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17887 2026-04-21 cs.RO 70%

StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement

StableIDM:通过时空细化稳定逆动力学模型以对抗机械臂截断

Kerui Li, Zhe Jing, Xiaofeng Wang, Zheng Zhu, Yukun Zhou, Guan Huang, Dongze Li, Qingkai Yang, Huaibo Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所GigaAI研究院) Beijing Institute of Technology(北京理工大学) GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出StableIDM,通过时空细化框架提升逆动力学模型在机械臂截断场景下的稳定性,实验表明其在动作准确性和任务成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25903 2026-04-17 cs.RO 70%

Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories

涌现神经自动机策略:从视觉运动轨迹中学习符号结构

Yiyuan Pan, Xusheng Luo, Hanjiang Hu, Peiqi Yu, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ENAP框架,通过从视觉运动轨迹中自适应推断Mealy状态机,结合行为克隆学习连续控制,实现高效且可解释的机器人策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17097 2026-04-15 cs.RO 70%

Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation

Progress-Think: 语义进展推理用于视觉-语言导航

Shuo Wang, Yucheng Wang, Guoxin Lian, Yongcai Wang, Maiyue Chen, Kaihui Wang, Bo Zhang, Zhizhong Su, Yutian Zhou, Wanting Li, Deying Li, Zhaoxin Fan

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Horizon Robotics

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出语义进展推理方法,通过视觉观察预测指令式进展,提升导航准确性。采用三阶段框架,结合自对齐预训练、进展引导策略预训练和进展-策略联合微调,实现高效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09036 2026-04-13 cs.RO 70%

V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation

V-CAGE:用于机器人操作的视觉闭环代理生成引擎

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * University of Cambridge(剑桥大学) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 V-CAGE通过闭环代理生成框架实现机器人数据合成,结合语义布局规划和视觉自验证,提升环境生成的语义结构和可达性,解决传统方法在场景生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08266 2026-04-10 cs.CV 70%

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

Orion-Lite:将LLM推理能力蒸馏到高效视觉-only驾驶模型

Jing Gu, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出Orion-Lite,通过潜特征蒸馏和真实轨迹监督,在闭环评估中实现高效视觉-only驾驶模型,超越大规模VLA模型ORION,达到Bench2Drive基准的80.6 Driving Score。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07154 2026-04-09 cs.CV 70%

Motion Focus Recognition in Fast-Moving Egocentric Video

眼动视频中运动聚焦识别

Si-En Hong, James Tribble, Alexander Lake, Hao Wang, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Eisa Chaudhary, Brian Canada, Ismahan Arslan-Ari, Abolfazl Razi

机构 * Clemson University(克莱姆森大学) University of South Carolina Beaufort(南卡罗来纳大学博福特分校) University of South Carolina(南卡罗来纳大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出一种实时运动聚焦识别方法,通过相机姿态估计基础模型和系统级优化,实现对眼动视频中主体运动意图的估计,适用于边缘部署的运动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04502 2026-04-07 cs.RO 70%

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act:前沿视频模型在通用机器人操作中能走多远?

Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。

Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01567 2026-04-03 cs.RO 70%

AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation

AnchorVLA:基于锚定扩散的高效端到端移动操作

Jia Syuen Lim, Zhizhen Zhang, Peter Bohm, Brendan Tidd, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Robotics and Autonomous Systems Group, CSIRO(CSIRO机器人与自主系统组)

专题命中 VLA模型 :VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出AnchorVLA,一种基于扩散的VLA策略,通过锚定扩散头在局部去噪以保留多模态动作生成,减少推理成本并提高移动操作的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 70%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01022 2026-03-31 cs.RO 70%

CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding

CycleManip: 通过有效的历史感知和理解实现循环任务操控

Yi-Lin Wei, Haoran Liao, Yuhao Lin, Pengyue Wang, Zhizhao Liang, Guiliang Liu, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出CycleManip框架,通过端到端模仿方法实现循环任务操控,解决了历史利用不足和缺乏评估基准的问题,实验表明方法在模拟和现实环境中均表现出高成功率和良好的适应性。

Comments Accepted by CVPR2026. Project page: https://isee-laboratory.github.io/CycleManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21690 2026-03-24 cs.AI econ.GN q-fin.EC 70%

AI Token Futures Market: Commoditization of Compute and Derivatives Contract Design

AI 令牌期货市场:计算资源的商品化与衍生品合约设计

Yicai Xing

机构 * Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文分析AI令牌作为新商品的属性,提出标准化令牌期货合约设计,通过模型和模拟评估其对计算成本波动的抑制效果,探讨GPU计算期货的可行性及监管框架。

Comments 16 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22579 2026-03-18 cs.RO cs.SE 70%

Metamorphic Testing of Vision-Language Action-Enabled Robots

视觉-语言-动作机器人元测试

Pablo Valle, Sergio Segura, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙达龙大学) University of Seville(塞维利亚大学) Simula Research Laboratory(Simula研究实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨元测试能否缓解视觉-语言-动作机器人测试 oracle 问题,提出两种关系模式和五种关系,通过实验证明其有效性,并展示其在不同任务和机器人上的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 70%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15186 2026-03-17 cs.RO 70%

NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation

NavGSim: 高保真度高斯点扩散模拟器用于大规模导航

Jiahang Liu, Yuanxing Duan, Jiazhao Zhang, Minghan Li, Shaoan Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(中国人工智能研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 NavGSim基于高斯点扩散框架,生成高保真度大规模导航环境,通过高斯点扩散切片技术提取可导航区域,提供多GPU支持的API,提升视觉-语言-动作模型的场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13825 2026-03-17 cs.RO 70%

Building Explicit World Model for Zero-Shot Open-World Object Manipulation

构建显式世界模型以实现零样本开放世界物体操控

Xiaotong Li, Gang Chen, Javier Alonso-Mora

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出基于显式世界模型的框架,通过构建物理基础的数字孪生实现零样本泛化,无需任务特定示范即可完成开放集操控任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08519 2026-03-10 cs.RO 70%

AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models

AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练

Xiaoquan Sun, Zetian Xu, Chen Cao, Zonghe Liu, Yihan Sun, Jingrui Pang, Ruijian Zhang, Zhen Yang, Kang Pang, Dingxin He, Mingqi Yuan, Jiayu Chen

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏