InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
机构 * Intern Robotics Shanghai AI Laboratory(Intern Robotics上海AI实验室)
专题命中 机器人基础模型 :robot policy(title);分类 cs.RO、cs.AI、cs.CV
Comments Technical report
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
机构 * Intern Robotics Shanghai AI Laboratory(Intern Robotics上海AI实验室)
专题命中 机器人基础模型 :robot policy(title);分类 cs.RO、cs.AI、cs.CV
Comments Technical report
VLA 模型能否从现实世界数据中持续学习而不遗忘?
机构 * HKU(香港大学) ; INFIFORCE ; EIT, Ningbo(宁波工程学院) ; HUST(华中科技大学) ; SUSTech(南方科技大学) ; HITSZ(香港理工大学)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本研究通过构建包含四个顺序操作任务的真实世界持续学习数据集,实证发现视觉-语言-动作(VLA)模型在持续学习异构真实世界演示时存在严重灾难性遗忘,并系统评估了经验回放方法的关键实施因素。
在视觉-语言-动作模型中解耦声明性知识与程序性知识
机构 * University of Edinburgh(爱丁堡大学) ; UCL(伦敦大学学院) ; Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。
OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台
机构 * Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。
OneVLA:面向具身任务的统一框架
机构 * Tsinghua University(清华大学) ; Pengcheng Laboratory(鹏城实验室) ; Xiaomi EV(小米电动车) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 机器人基础模型 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出统一架构OneVLA,通过设计统一动作头和渐进式训练策略(含数据构建和思维链微调),在导航与操作任务上实现跨任务正迁移,达到最先进性能。
HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; HKUST(GZ)(香港科技大学(广州)) ; Nanjing University(南京大学) ; Westlake Robotics(西湖机器人)
专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO
AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。
Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA
E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。
增强 VLA 的语言泛化能力:通过合成指令增强细调 OpenVLA
专题命中 机器人基础模型 :embodied AI(abstract);embodied agent(abstract);robotic(abstract);分类 cs.AI
AI总结 本文提出通过合成指令集提升 OpenVLA 的语言泛化能力,利用 LoRA 技术在增强数据上微调,增强复杂自然语言意图与机器人动作之间的桥梁。
SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。
VLA-Reasoner: 通过在线蒙特卡洛树搜索增强视觉-语言-动作模型的推理能力
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)
专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO
AI总结 VLA-Reasoner通过在线蒙特卡洛树搜索增强视觉-语言-动作模型,提升长时间轨迹任务的推理能力与执行效率。
Comments 8 pages, 6 figures, Accepted by ICRA 2026
机器人选择性感知:多模态VLA中的任务感知注意力
机构 * Dongguk University(东国大学)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出了一种动态信息融合框架,通过任务感知注意力提升机器人多模态VLA模型的效率与鲁棒性。
VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中
机构 * Nvidia(Nvidia公司) ; Microsoft(微软公司) ; University of Oxford(牛津大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。
Comments In submission. Project website: https://vista-vla.github.io/
通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练
机构 * Peking University(北京大学) ; Renmin University of China(中国人民大学) ; BeingBeyond
专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO
AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。
一次观看,随后行动:基于单次视频示范的任务学习视觉-语言-行动模型
机构 * Beijing Institute of Technology(北京理工大学) ; LimX Dynamics
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 ViVLA通过单次视频示范高效学习机器人操控任务,实现跨任务和跨身体的显著性能提升。
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Accepted to AAAI 2026. Camera-ready version
机构 * NVIDIA ; National Taiwan University(国立台湾大学)
专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
Comments NeurIPS 2025. Project page: https://jasper0314-huang.github.io/thinkact-vla/
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Project website: https://cot-vla.github.io/
Journal ref CVPR 2025
VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆
机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)
AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE
快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合
机构 * Department of Computer Science(计算机科学系) ; Department of Data Science(数据科学系) ; William & Mary(威廉玛丽学院)
专题命中 机器人基础模型 :robotic(title);分类 cs.AI、cs.CV
AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。
$μ$VLA:部分可观测操作中VLA模型的循环记忆研究
机构 * CogAI Lab, Moscow, Russia(CogAI实验室,莫斯科,俄罗斯) ; MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)
专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG
AI总结 针对VLA模型在部分可观测场景中的记忆缺失问题,提出仅通过可学习记忆令牌和截断反向传播时间实现最小化循环记忆增强,在MIKASA-Robo上将训练任务成功率从0.42提升至0.84,并在LIBERO上保持全可观测性能。
Comments 34 pages, 20 figures, 9 tables
每帧一个令牌:重新考虑世界模型中的视觉带宽
机构 * Zhejiang University(浙江大学) ; Central South University(中南大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) ; E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)
专题命中 机器人基础模型 :world model(title);分类 cs.AI、cs.CV
AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。
CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考
机构 * Afari Intelligent Drive(Afari智能驾驶公司) ; University of Electronic Science and Technology of China(电子科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Tianjin University(天津大学)
专题命中 机器人基础模型 :world model(title);分类 cs.AI、cs.CV
AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。
专题命中 机器人基础模型 :robot foundation model(title);分类 cs.RO、cs.CV
Comments Accepted by ICML 2025. The project page is available at: http://diffusion-vla.github.io
RoboTTT:机器人策略的上下文扩展
机构 * NVIDIA(英伟达公司) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。
Comments Project website: http://research.nvidia.com/labs/gear/robottt/
TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) ; Tongji University(同济大学)
专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。
Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
VOTE:基于轨迹集成投票的视觉-语言-动作优化
机构 * Northeastern University(东北大学) ; Cisco(思科) ; EmbodyX
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。
Comments 12 pages
恢复VLA模型中的语言基础:无需训练的注意力重校准方法
机构 * Tsinghua University(清华大学) ; Singapore Management University(新加坡管理学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。
AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型
机构 * LiAuto Inc.(LiAuto公司) ; Beijing University of Technology(北京理工大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。
Comments Accepted at CVPR 2026 (Highlight)
语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);robotic(abstract)
AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。
Comments Accepted to ACL 2026 Main Conference
PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放
机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) ; AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。
Comments 20 pages, 8 figures, 12 tables