arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-16 至 2026-04-16 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2510.00695 2026-04-16 cs.RO cs.CV 91%

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

HAMLET: 将视觉-语言-动作模型转换为历史感知策略

Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出HAMLET框架,通过引入时刻标记和轻量记忆模块,使视觉-语言-动作模型能关注历史上下文,提升长周期任务表现,实验显示在多个基准测试中均取得显著提升。

Comments ICLR 2026. Project page: https://myungkyukoo.github.io/hamlet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05672 2026-04-16 cs.RO 89%

A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model

A1: 一个完全透明的开源、自适应和高效的截断视觉-语言-动作模型

Kaidong Zhang, Jian Zhang, Rongtao Xu, Yu Sun, Shuoshuo Xue, Youpeng Wen, Xiaoyu Guo, Minghao Guo, Weijia Liufu, Liu Zihou, Kangyi Ji, Yangsong Zhang, Jiarun Zhu, Jingzhi Liu, Zihang Li, Ruiyi Chen, Meng Cao, Jingming Zhang, Shen Zhao, Xiaojun Chang, Feng Zheng, Ivan Laptev, Xiaodan Liang

机构 * SYSU(华南理工大学) MBZUAI(微软亚洲人工智能研究院) Spatialtemporal AI(时空人工智能)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 A1通过利用预训练的VLM提供隐含的 affordance 先验知识,实现低成本、高吞吐量的推理,同时提高机器人操作的成功率,且在多个基准和真实机器人上实现了最先进的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26259 2026-04-16 cs.IR cs.AI cs.CL 79%

Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models

晚期交互动力学工作笔记:分析晚期交互模型的目标行为

Antoine Edy, Max Conti, Quentin Macé

机构 * Illuin Technology(Illuin技术)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文研究了晚期交互检索中长度偏差和最大相似性操作符外的相似性分布,揭示了因果模型和双向模型的实际性能瓶颈。

Comments Accepted at The 1st Late Interaction Workshop (LIR) @ ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO 77%

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13654 2026-04-16 cs.RO 77%

Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap

面向无人机的视觉与语言导航:进展、挑战与研究路线图

Hanxuan Chen, Jie Zheng, Siqi Yang, Tianle Zeng, Siwei Feng, Songsheng Cheng, Ruilong Ren, Hanzhong Guo, Shuai Yuan, Xiangyue Wang, Kangli Wang, Ji Pei

机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13737 2026-04-16 cs.IR cs.AI 57%

TokenFormer: Unify the Multi-Field and Sequential Recommendation Worlds

TokenFormer:统一多字段和序列推荐领域

Yifeng Zhou, Yuehong Hu, Zhixiang Feng, Junwei Pan, Kaihui Wu, Hanyong Li, Shangyu Zhang, Shudong Huang, Zhangbin Zhu, Chengguo Yin, Haijie Gu, Jie Jiang

机构 * Tencent Inc.(腾讯公司)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 TokenFormer通过引入BFTS注意力机制和NLIR,解决多字段与序列推荐的融合问题,提升模型鲁棒性和表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14045 2026-04-16 cond-mat.supr-con cond-mat.mes-hall cond-mat.str-el 50%

Strong Correlation Drives Zero-Field Josephson Diode Effect

强关联驱动零磁场约瑟夫森二极管效应

Yiheng Sun, Zhenyu Zhang, James Jun He

专题命中 VLA模型 :action model(abstract)

AI总结 研究通过强电子关联诱导时间反演和镜像对称自发破缺,实现零磁场约瑟夫森二极管效应,揭示非 reciprocal 超导输运的新机制。

Comments 4.5 pages, 4 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2604.06168 2026-04-16 cs.CV cs.RO 62%

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏