VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
机构 * China, Beijing, Li Auto Inc.(中国北京李自动公司)
专题命中 机器人基础模型 :manipulation(title);robotic(title);分类 cs.AI、cs.CV
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
机构 * China, Beijing, Li Auto Inc.(中国北京李自动公司)
专题命中 机器人基础模型 :manipulation(title);robotic(title);分类 cs.AI、cs.CV
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Xi’an Jiaotong University(西安交通大学) ; HKUST(GZ) Project Lead(香港科技大学(广州)项目负责人)
专题命中 机器人基础模型 :manipulation(title);robotic(title);分类 cs.RO、cs.CV
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
Comments 16 Pages, 10 Figures
专题命中 机器人基础模型 :robotic(title,abstract);robot learning(abstract);分类 cs.RO、cs.CV、cs.LG
专题命中 机器人基础模型 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Project page: https://vis-www.cs.umass.edu/3dvla/
机构 * NASA-JPL, Caltech(美国国家航空航天局喷气推进实验室,加州理工学院) ; CME, Caltech(加州理工学院计算机工程系) ; Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)
专题命中 机器人基础模型 :robot foundation model(title);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI
Journal ref Robotics Science and Systems 2025 Workshop
将视频模型转化为通用机器人策略
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; Amazon FAR(亚马逊公司)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);world model(abstract);robot foundation model(abstract)
AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。
Comments project page: https://vera.csail.mit.edu
DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划
机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) ; School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)
专题命中 机器人基础模型 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。
Comments 24 pages, 6 figures, 3 tables
隐藏于明处:针对视觉-语言-动作模型的基于扩散的无约束机器人攻击
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出基于扩散的无约束机器人攻击方法DURA,针对视觉-语言-动作模型生成自然对抗补丁,实验表明其性能优于现有方法,暴露了物理部署的VLA模型的安全风险。
SkillMemo:用于组合式具身操纵的专家引导技能记忆框架
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Nanyang Technological University(南洋理工大学) ; Beijing Normal University(北京师范大学)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。
Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵
机构 * Peking University(北京大学) ; CUHK(香港中文大学) ; AI² Robotics(智平方科技)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。
Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/
S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型
机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。
Comments Accepted to IJCAI 2026
SC3-Eval: 通过自洽视频生成评估机器人基础模型
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; NVIDIA(英伟达) ; Physical Intelligence ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Allen Institute for AI(艾伦人工智能研究所)
专题命中 机器人基础模型 :robot foundation model(title);manipulation(abstract);world model(abstract);分类 cs.RO、cs.CV
AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。
AttenA+: 纠正机器人基础模型中的动作不平等性
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKU(香港大学) ; USTC(中国科学技术大学) ; IDEA Research(IDEA研究院) ; SUSTech(南方科技大学) ; X-Humaniod
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。
RoboWits:机器人创造性问题解决中的意外挑战
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。
Comments The first two authors contributed equally
RoboMME:机器人通用策略的记忆基准与理解
机构 * University of Michigan(密歇根大学) ; Stanford University(斯坦福大学) ; Figure AI
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出RoboMME基准,通过16个操作任务评估VLA模型在长时程和历史依赖场景中的记忆能力,并基于π0.5骨干网络探索14种记忆增强变体,发现记忆表示的有效性高度依赖于任务。
Comments Accepted to ICML 2026
ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略
机构 * VinRobotics ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) ; Intelligent Autonomous Systems Lab(智能自主系统实验室) ; TU Darmstadt(德累斯顿技术大学) ; Automation & Control Institute(自动化与控制研究所) ; TU Wien(维也纳技术大学) ; Austrian Institute of Technology (AIT)(奥地利技术研究所)
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。
Comments arXiv admin note: substantial text overlap with arXiv:2505.19080
ReconVLA:一种基于不确定性和故障意识的视觉-语言-动作框架用于机器人控制
机构 * Department of Computer Science and Engineering, The University of Texas at Arlington(计算机科学与工程系,德克萨斯理工大学)
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
AI总结 ReconVLA通过引入符合预测方法,为视觉-语言-动作模型提供校准的不确定性估计和故障检测,提升机器人控制的可靠性与安全性。
Comments 17 pages, 9 figures, and 7 tables
LiteVLA-Edge: 量化在设备上多模态控制用于嵌入式机器人
机构 * Clark Atlanta University(克拉克阿特兰大学) ; Siemens Corporation(西门子公司)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 LiteVLA-Edge通过量化和GPU加速,在嵌入式机器人中实现低延迟的多模态控制,提供模块化本地执行方案。
一种类脑的具身智能用于流体和快速反射式机器人控制
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; AI 2 Robotics(AI 2机器人) ; Shenzhen, China(深圳中国)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 NeuroVLA是一种类脑具身智能框架,通过生物启发设计实现机器人快速反射和动态稳定性控制,首次在物理机器人上实现先进性能。
机器人VLA通过与运动图像扩散的联合学习获益
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。
Comments Website: https://vla-motion.github.io/
专题命中 机器人基础模型 :robotics(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI
Comments Plan to resubmit after significant revisions
机构 * Rochester Institute of Technology(罗切斯特技术研究所) ; University of Missouri - Kansas City(密苏里大学-凯撒城分校) ; U.S. Naval Research Laboratory(美国海军研究实验室) ; Lamar University(拉马尔大学) ; Meta AI ; University of Rochester(罗切斯特大学) ; Rutgers University(新泽西罗格斯大学)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
Comments ICCV camera ready; Github: https://github.com/William-wAng618/roboticAttack Homepage: https://vlaattacker.github.io/
机构 * Hugging Face ; Sorbonne University(索邦大学) ; École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学院)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.LG
Comments 24 pages. Code and assets: https://github.com/huggingface/lerobot
专题命中 机器人基础模型 :robot policy(title);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
Comments ICML 2025 Spotlight Paper. The first two authors contribute equally
专题命中 机器人基础模型 :robot policy(title);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
Comments Project website: https://octo-models.github.io
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
部分可观测的对抗性补丁攻击在机器人视觉-语言-动作模型上的应用
机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) ; SmartMore Corporation(SmartMore公司) ; Cyberspace Institute of Advanced Technology, Guangzhou University(广西亚技术空间研究所,广州大学) ; th Medical Center of Chinese PLA General Hospital(中国人民解放军总医院第八医学中心) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO
AI总结 针对机器人VLA模型,提出部分可观测威胁模型下的两阶段攻击框架,利用注意力图定位关键区域并优化补丁以破坏语义接地和增加动作轨迹曲率,导致长期任务失败。
Comments Accepted by IEEE Robotics and Automation Letters, 2026
面向全身遥操作移动操作的全景感知VLA学习
机构 * Beihang University(北京航空航天大学) ; Shandong University(山东大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Delta Intelligence(delta智能公司)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO
AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。
Comments 8 pages, 4 figures
用于批量机器人策略服务的动作块调度
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 机器人基础模型 :robot policy(title,abstract);robot foundation model(abstract);分类 cs.RO
AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。