arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-20 至 2026-07-20 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2607.15714 2026-07-20 cs.RO 新提交 91%

AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning

AC-VLA:通过组合学习实现稳健的分布外动作执行

Xiaojiang Peng, Kai Peng, Jie Lu, Zheng Lian, Zitong YU, Xiaobo Wang

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tongji University(同济大学) Great Bay University(大湾区大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究VLA模型在分布外泛化的问题,提出AC-VLA框架,含组合学习模块和状态条件不对称掩码策略,无需修改架构可集成到VLA主干,在LIBERO和LIBERO-OOD基准测试中,该框架在组合OOD任务上有显著改进,分布内性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交 89%

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15468 2026-07-20 astro-ph.GA astro-ph.SR 新提交 78%

A JWST, ALMA and VLA survey of the Ophiuchus-A star-forming region: Unveiling hidden dust mass and connecting infrared outflows to their radio origins

对蛇夫座-A恒星形成区域的詹姆斯·韦布空间望远镜、阿塔卡马大型毫米/亚毫米波阵列和甚大阵巡天:揭示隐藏的尘埃质量并将红外外流与其射电起源联系起来

Isaac C. Radley, John D. Ilee, Gemma Busquet, Hauyu Baobab Liu, Klaus M. Pontoppidan, Alvaro Ribas, Marc Audard, Eleonora Bianchi, Tyler L. Bourke, Claudio Codella, Audrey Coutens, Josep M. Girart, Melvin G. Hoare, Izaskun Jiménez-Serra, Doug Johnstone, Laurent Loinard, Olja Panić, Jaime E. Pineda, Linda Podio, John J. Tobin, David J. Wilner

专题命中 VLA模型 :VLA(title,abstract)

AI总结 对蛇夫座A恒星形成区域进行多波段巡天,结合高分辨率观测数据,用基于物理的模型推导尘埃和电离气体性质等,揭示星周尘埃盘质量,联系外流与起源,解决“缺失盘质量”问题,为相关研究提供潜在方案,但受现有分辨率和灵敏度限制。

Comments Accepted for publication in AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 76%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2607.15641 2026-07-20 cs.RO cs.AI 新提交 73%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏