arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-20 至 2026-08-20 共收录 10 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2608.19066 2026-08-20 cs.CV cs.AI 新提交 92%

GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

GS-VLA:基于高斯溅射的冻结VLA策略的即插即用视角规范化方法

Yechan Park, HyunJin Kim

机构 * Dankook University(檀国大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 GS-VLA是首个基于3D高斯的VLA视角规范化即插即用框架,通过轻量4M参数的3D高斯规范化器提升VLA策略视角偏移鲁棒性,无需重训即可在多维度恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18275 2026-08-20 astro-ph.IM 新提交 89%

The VLA and High-Frequency SETI: Expanding the Search for Life

VLA与高频SETI:拓展地外生命搜寻

Talon Myburgh, Noah Stiegler, Chenoa D. Tremblay, Joe S. Bright, Ross A. Donnachie

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究依托VLA的COSMIC系统,运用泰勒树去色散算法搜寻高频窄带漂移技术信号,扩展了SETI的高频搜寻范围。

Comments 15 pages, 8 figures, 4 tables. In press in Acta Astronautica (Special Issue: 76th IAC). Presented at the 76th International Astronautical Congress (IAC 2025), Paper IAC-25-A4,1,6,x95796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18410 2026-08-20 cs.LG 新提交 89%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.LG

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19161 2026-08-20 cs.AI cs.CR 新提交 81%

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

超越文本记录:检测潜在多智能体通信中的隐蔽协同

Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy

机构 * MIT Media Lab(麻省理工学院媒体实验室) Westtown School(韦斯顿镇学校) University of Florida(佛罗里达大学) SRI International(SRI国际公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对语言模型智能体通过不可见潜在状态进行隐蔽协同的问题,提出可验证潜在对齐(VLA)框架,设计三层监控器与可引导性框架,在多智能体拍卖基准上实现了高效的隐蔽协同检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18555 2026-08-20 cs.LG cs.AI 新提交 62%

Performance Drift Detection in Machine Learning as a Service (MLaaS) for IoT Environments

物联网环境下机器学习即服务(MLaaS)的性能漂移检测

Deepak Kanneganti, Sajib Mistry, Sheik Mohammad Mostakim Fattah, Erik Elmroth, Aneesh Krishna, Monowar Bhuyan

机构 * Curtin University(科廷大学) Umeå University(于默奥大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 针对物联网环境下MLaaS客户端为黑盒的漂移检测难题,提出MPDD模型与APDDM机制,实验显示二者可显著提升检测准确率、降低漏检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 57%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19143 2026-08-20 cs.CE 新提交 50%

Network-Scale Road Disruption from Liquefaction in Cascadia Subduction Zone Earthquakes

卡斯卡迪亚俯冲带地震中液化引发的路网级道路中断

M.D. Sanger, O. Blaze-Smith, B.W. Maurer, L. Wotherspoon, M.O. Eberhard, J.W. Berman

专题命中 VLA模型 :action model(abstract)

AI总结 该研究构建力学数据驱动框架,模拟卡斯卡迪亚9级地震液化引发的路网中断,经空间蒙特卡洛模拟评估影响,为当地交通韧性规划提供可靠工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.19137 2026-08-20 cs.CE 新提交 50%

U.S. National Liquefaction Hazard Maps and their Implications for Engineering Practice and Policy

美国全国液化灾害图及其对工程实践和政策的启示

Morgan D. Sanger, Victoria P. Zdanovski, Brett W. Maurer

专题命中 动作表示与策略 :action model(abstract)

AI总结 本研究开发美国全国液化灾害图(NLHMs),结合地理空间机器学习模型与2023年美国全国地震灾害模型,分析震级选择、灾害形式差异及液化与社会经济脆弱性的叠加,为工程实践与政策提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2608.18433 2026-08-20 cs.RO cs.LG 新提交 90%

The Embodiment Gap in Robot Foundation Models

机器人基础模型中的具身差距

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究院(AIST))

专题命中 机器人基础模型 :robot foundation model(title,abstract);vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本综述定义机器人基础模型的具身差距,通过双轴图分类方法,从三个研究方向考察近期工作,提出报告框架以助力跨具身学习的评估与未来研究。

Comments 32 pages, 4 figures. Published in Transactions on Machine Learning Research (TMLR), August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2608.18498 2026-08-20 cs.CV 新提交 57%

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏