arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-13 至 2026-08-13 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 8 篇

2608.11671 2026-08-13 cs.RO 新提交 91%

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

StellaVLA:用于通用视觉-语言-动作模型的上下文结构化演示

Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 StellaVLA是一种测试时基于结构化演示适应的VLA框架,通过双训练设计提升泛化性,在VLA-Arena等基准上表现优于现有模型,可助力VLA模型适应OOD任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 85%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 84%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 83%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 82%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12186 2026-08-13 astro-ph.SR astro-ph.GA 新提交 80%

Nascent Embedded-protostar Survey in Taurus (NEST) I: Protostellar Multiplicity

金牛座新生原恒星嵌入巡天(NEST)I:原恒星多重性

Aislinn C. Plante, John J. Tobin, Patrick D. Sheehan, Noshin Yesmin, Nicholas P. Ballering, Tyler L. Bourke, Josh Eisner, Zhi-Yun Li

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究通过ALMA与VLA观测结合档案数据,统计金牛座原恒星多重性,发现其多重性显著高于猎户座、英仙座,暗示金牛座保留更多原始多重系统,且存在两种不同形成途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11708 2026-08-13 cs.HC cs.GR 新提交 50%

A Browser-Based Gesture-Driven Avatar Interaction Framework for Metaverse Onboarding Environments

面向元宇宙入门环境的基于浏览器的手势驱动虚拟化身交互框架

Deepti Parachuri, Chhayank Sahu, Sameer Singh Choudhary

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种面向元宇宙入门环境的基于浏览器的手势驱动交互框架,结合Google MediaPipe手势识别与两种移动技术,经5人评估验证,实现无控制器的轻量交互。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11450 2026-08-13 cond-mat.mes-hall cond-mat.str-el 新提交 50%

Layer-Number-Controlled Symmetry Breaking and Surface-State Transport in Rhombohedral Graphene Multilayers

层数可控的菱面石墨烯多层膜中的对称性破缺与表面态输运

Bosai Lyu, Jian Zheng, Kai Liu, Yulu Ren, Size Wu, Yating Sha, Shuhan Liu, Youngju Park, Kenji Watanabe, Takashi Taniguchi, Jinfeng Jia, Zhiwen Shi, Jeil Jung, Weidong Luo, Guorui Chen

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过电输运测量发现菱面石墨烯多层膜的相变临界位移场具有特殊层依赖关系,确立层数为调控其关联与拓扑相的关键旋钮,还观测到表面态主导的输运特征。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏