arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-20 至 2026-08-20 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 11 篇

2608.19066 2026-08-20 cs.CV cs.AI 新提交 92%

GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

GS-VLA:基于高斯溅射的冻结VLA策略的即插即用视角规范化方法

Yechan Park, HyunJin Kim

机构 * Dankook University(檀国大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 GS-VLA是首个基于3D高斯的VLA视角规范化即插即用框架,通过轻量4M参数的3D高斯规范化器提升VLA策略视角偏移鲁棒性,无需重训即可在多维度恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18275 2026-08-20 astro-ph.IM 新提交 89%

The VLA and High-Frequency SETI: Expanding the Search for Life

VLA与高频SETI:拓展地外生命搜寻

Talon Myburgh, Noah Stiegler, Chenoa D. Tremblay, Joe S. Bright, Ross A. Donnachie

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究依托VLA的COSMIC系统,运用泰勒树去色散算法搜寻高频窄带漂移技术信号,扩展了SETI的高频搜寻范围。

Comments 15 pages, 8 figures, 4 tables. In press in Acta Astronautica (Special Issue: 76th IAC). Presented at the 76th International Astronautical Congress (IAC 2025), Paper IAC-25-A4,1,6,x95796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18410 2026-08-20 cs.LG 新提交 89%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.LG

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 88%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-20 cs.RO 版本更新 87%

EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19161 2026-08-20 cs.AI cs.CR 新提交 81%

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

超越文本记录:检测潜在多智能体通信中的隐蔽协同

Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy

机构 * MIT Media Lab(麻省理工学院媒体实验室) Westtown School(韦斯顿镇学校) University of Florida(佛罗里达大学) SRI International(SRI国际公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对语言模型智能体通过不可见潜在状态进行隐蔽协同的问题,提出可验证潜在对齐(VLA)框架,设计三层监控器与可引导性框架,在多智能体拍卖基准上实现了高效的隐蔽协同检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-20 cs.RO 版本更新 79%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 73%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18555 2026-08-20 cs.LG cs.AI 新提交 62%

Performance Drift Detection in Machine Learning as a Service (MLaaS) for IoT Environments

物联网环境下机器学习即服务(MLaaS)的性能漂移检测

Deepak Kanneganti, Sajib Mistry, Sheik Mohammad Mostakim Fattah, Erik Elmroth, Aneesh Krishna, Monowar Bhuyan

机构 * Curtin University(科廷大学) Umeå University(于默奥大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 针对物联网环境下MLaaS客户端为黑盒的漂移检测难题,提出MPDD模型与APDDM机制,实验显示二者可显著提升检测准确率、降低漏检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 57%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19143 2026-08-20 cs.CE 新提交 50%

Network-Scale Road Disruption from Liquefaction in Cascadia Subduction Zone Earthquakes

卡斯卡迪亚俯冲带地震中液化引发的路网级道路中断

M.D. Sanger, O. Blaze-Smith, B.W. Maurer, L. Wotherspoon, M.O. Eberhard, J.W. Berman

专题命中 VLA模型 :action model(abstract)

AI总结 该研究构建力学数据驱动框架,模拟卡斯卡迪亚9级地震液化引发的路网中断,经空间蒙特卡洛模拟评估影响,为当地交通韧性规划提供可靠工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2606.07464 2026-08-20 cs.RO cs.AI cs.CV 版本更新 67%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19137 2026-08-20 cs.CE 新提交 50%

U.S. National Liquefaction Hazard Maps and their Implications for Engineering Practice and Policy

美国全国液化灾害图及其对工程实践和政策的启示

Morgan D. Sanger, Victoria P. Zdanovski, Brett W. Maurer

专题命中 动作表示与策略 :action model(abstract)

AI总结 本研究开发美国全国液化灾害图(NLHMs),结合地理空间机器学习模型与2023年美国全国地震灾害模型,分析震级选择、灾害形式差异及液化与社会经济脆弱性的叠加,为工程实践与政策提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2608.18433 2026-08-20 cs.RO cs.LG 新提交 90%

The Embodiment Gap in Robot Foundation Models

机器人基础模型中的具身差距

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究院(AIST))

专题命中 机器人基础模型 :robot foundation model(title,abstract);vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本综述定义机器人基础模型的具身差距,通过双轴图分类方法,从三个研究方向考察近期工作,提出报告框架以助力跨具身学习的评估与未来研究。

Comments 32 pages, 4 figures. Published in Transactions on Machine Learning Research (TMLR), August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2608.18498 2026-08-20 cs.CV 新提交 57%

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏