arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-24 至 2026-03-24 共收录 12 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2603.22280 2026-03-24 cs.CV cs.RO 91%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 90%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 89%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20607 2026-03-24 cs.RO cs.LG 88%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01834 2026-03-24 cs.RO 88%

Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models

基于概念的词典学习用于推理时的安全性在视觉语言动作模型中

Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang

机构 * Beijing Jiaotong University(北京交通大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) University of Auckland(奥克兰大学) RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出基于概念的词典学习框架,用于提升视觉语言动作模型推理时的安全性,通过学习稀疏可解释词典识别有害概念方向并抑制风险组件,实验表明其在多个基准上有效降低攻击成功率70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16666 2026-03-24 cs.CV cs.AI 86%

Fast-WAM: Do World Action Models Need Test-time Future Imagination?

Fast-WAM: 世界动作模型是否需要测试时的未来想象?

Tianyuan Yuan, Zibin Dong, Yicheng Liu, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学院) Galaxea AI

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了世界动作模型是否需要在测试时进行显式未来想象,通过提出Fast-WAM架构,发现训练时的视频共训练对性能影响更大,且Fast-WAM在模拟和现实任务中表现出色,实现实时运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20668 2026-03-24 cs.RO 83%

ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems

以目标区域驱动的视网膜注视用于视觉-语言-动作系统中的统一自体表示

Xinhai Sun, Xiang Shi, Menglin Zou, Wenlong Huang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出了一种以目标区域驱动的数据表示方法,通过单个外部相机投影末端执行器姿态,实现手眼协调的区域划分,提升跨机器人系统的数据重用性和跨体征对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10448 2026-03-24 cs.RO 77%

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

DiT4DiT:联合建模视频动态与动作以实现通用机器人控制

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang, Shuo Yang

机构 * Mondo Robotics(Mondo机器人公司) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。

Comments https://dit4dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21690 2026-03-24 cs.AI econ.GN q-fin.EC 70%

AI Token Futures Market: Commoditization of Compute and Derivatives Contract Design

AI 令牌期货市场:计算资源的商品化与衍生品合约设计

Yicai Xing

机构 * Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文分析AI令牌作为新商品的属性,提出标准化令牌期货合约设计,通过模型和模拟评估其对计算成本波动的抑制效果,探讨GPU计算期货的可行性及监管框架。

Comments 16 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20232 2026-03-24 cs.RO cs.AI cs.LG 67%

Fusing Driver Perceived and Physical Risk for Safety Critical Scenario Screening in Autonomous Driving

融合驾驶员感知与物理风险用于自动驾驶安全关键场景筛选

Chen Xiong, Ziwen Wang, Deqi Wang, Cheng Wang, Yiyang Chen, He Zhang, Chao Gou

机构 * Guangdong Provincial Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东省智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区) school of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院,西南交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种融合驾驶员风险的危险场景筛选方法,通过改进的驾驶员风险场和动态成本模型生成高质量风险监督信号,提升自动驾驶中安全关键场景的筛选效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16963 2026-03-24 cs.RO cs.SY eess.SY 57%

A Tactile-based Interactive Motion Planner for Robots in Unknown Cluttered Environments

基于触觉的交互式运动规划器用于未知杂乱环境中的机器人

Chengjin Wang, Yanmin Zhou, Zheng Yan, Feng Luan, Runjie Shen, Hongrui Sang, Zhipeng Wang, Bin He

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出了一种基于触觉的交互式运动规划框架,通过多模态触觉感知实时构建接触模型,从而在未知杂乱环境中安全扩展自由运动空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21231 2026-03-24 cs.CR cs.AI 57%

When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agents

当便利成为风险:主机作用代理中的语义视角下的不足规范

Di Lu, Yongzhi Liao, Xutong Mu, Lele Zheng, Ke Cheng, Xuewen Dong, Yulong Shen, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文探讨主机作用代理中因目标规范不足导致的安全问题,提出语义威胁模型和风险完成模式分类,并通过案例研究分析如何通过明确执行边界来防御风险。

详情

展开后加载摘要…

URL PDF HTML 收藏