arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-20 至 2026-08-20 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 11 篇

2608.19066 2026-08-20 cs.CV cs.AI 新提交 92%

GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

GS-VLA:基于高斯溅射的冻结VLA策略的即插即用视角规范化方法

Yechan Park, HyunJin Kim

机构 * Dankook University(檀国大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 GS-VLA是首个基于3D高斯的VLA视角规范化即插即用框架,通过轻量4M参数的3D高斯规范化器提升VLA策略视角偏移鲁棒性,无需重训即可在多维度恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18275 2026-08-20 astro-ph.IM 新提交 89%

The VLA and High-Frequency SETI: Expanding the Search for Life

VLA与高频SETI:拓展地外生命搜寻

Talon Myburgh, Noah Stiegler, Chenoa D. Tremblay, Joe S. Bright, Ross A. Donnachie

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究依托VLA的COSMIC系统,运用泰勒树去色散算法搜寻高频窄带漂移技术信号,扩展了SETI的高频搜寻范围。

Comments 15 pages, 8 figures, 4 tables. In press in Acta Astronautica (Special Issue: 76th IAC). Presented at the 76th International Astronautical Congress (IAC 2025), Paper IAC-25-A4,1,6,x95796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18410 2026-08-20 cs.LG 新提交 89%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.LG

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 88%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-20 cs.RO 版本更新 87%

EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19161 2026-08-20 cs.AI cs.CR 新提交 81%

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

超越文本记录:检测潜在多智能体通信中的隐蔽协同

Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy

机构 * MIT Media Lab(麻省理工学院媒体实验室) Westtown School(韦斯顿镇学校) University of Florida(佛罗里达大学) SRI International(SRI国际公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对语言模型智能体通过不可见潜在状态进行隐蔽协同的问题,提出可验证潜在对齐(VLA)框架,设计三层监控器与可引导性框架,在多智能体拍卖基准上实现了高效的隐蔽协同检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-20 cs.RO 版本更新 79%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 73%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18555 2026-08-20 cs.LG cs.AI 新提交 62%

Performance Drift Detection in Machine Learning as a Service (MLaaS) for IoT Environments

物联网环境下机器学习即服务(MLaaS)的性能漂移检测

Deepak Kanneganti, Sajib Mistry, Sheik Mohammad Mostakim Fattah, Erik Elmroth, Aneesh Krishna, Monowar Bhuyan

机构 * Curtin University(科廷大学) Umeå University(于默奥大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 针对物联网环境下MLaaS客户端为黑盒的漂移检测难题,提出MPDD模型与APDDM机制,实验显示二者可显著提升检测准确率、降低漏检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 57%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19143 2026-08-20 cs.CE 新提交 50%

Network-Scale Road Disruption from Liquefaction in Cascadia Subduction Zone Earthquakes

卡斯卡迪亚俯冲带地震中液化引发的路网级道路中断

M.D. Sanger, O. Blaze-Smith, B.W. Maurer, L. Wotherspoon, M.O. Eberhard, J.W. Berman

专题命中 VLA模型 :action model(abstract)

AI总结 该研究构建力学数据驱动框架,模拟卡斯卡迪亚9级地震液化引发的路网中断,经空间蒙特卡洛模拟评估影响,为当地交通韧性规划提供可靠工具。

详情

展开后加载摘要…

URL PDF HTML 收藏