arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-29 至 2026-05-29 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 1 篇

2605.30350 2026-05-29 cs.RO cs.LG 62%

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

DynaFLIP: 通过三模态动力学引导表示重新思考机器人感知

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * Seoul National University(首尔国立大学) University of Maryland, College Park(马里兰大学学院公园分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);分类 cs.RO、cs.LG

AI总结 提出DynaFLIP,一种动力学感知的多模态预训练框架,通过图像-语言-3D流三元组训练图像编码器,利用单纯形体积最小化与余弦正则化和对比目标对齐三模态,提升机器人操作中的运动理解与泛化能力。

Comments Project website: https://dynaflip-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏