arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-19 至 2026-03-19 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2603.03818 2026-03-19 cs.LG cs.AI cs.RO 89%

Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning

预训练视觉-语言-动作模型在持续学习中出人意料地表现出遗忘抵抗性

Huihan Liu, Changyeon Kim, Bo Liu, Minghuan Liu, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Superintelligence(微软超级智能)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究发现预训练的视觉-语言-动作模型在持续学习中表现出较强的遗忘抵抗性,简单经验回放在这些模型上效果显著,即使数据量小也能实现零遗忘。

Comments Project website: https://continual-vlas.github.io/forget-me-not/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17524 2026-03-19 cs.RO cs.AI 88%

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

KineVLA:面向运动学感知的视觉-语言-动作模型及双层动作分解

Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KineVLA模型,通过双层动作分解实现运动学感知,提升动作执行的精度与可控性,实验表明其在运动学敏感基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17850 2026-03-19 cs.RO 88%

ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models

ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型

Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国) School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 ProbeFlow通过动态调度积分步骤减少冗余网络计算,提升动作解码效率和系统延迟,保持动作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 81%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09513 2026-03-19 cs.RO 77%

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17058 2026-03-19 cs.GT cs.MA cs.RO cs.SY eess.SY math.OC 74%

Asymmetric Nash Seeking via Best Response Maps: Global Linear Convergence and Robustness to Inexact Reaction Models

不对称纳什寻求 via 最佳反应映射:全局线性收敛性与对不精确反应模型的鲁棒性

Mahdis Rabbani, Navid Mojahed, Shima Nazari

机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 本文研究了不对称信息双玩家约束博弈的全局线性收敛性和对不精确反应模型的鲁棒性,提出了一种不对称投影梯度下降-最佳反应迭代方法,证明了在最佳反应映射精确时的全局线性收敛性,并分析了不精确情况下的误差界。

Comments 6 Pages, 2 Figures, Preprint submitted to IEEE L-CSS and CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05186 2026-03-19 cs.RO cs.CV 73%

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏