arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-25 至 2026-06-25 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2606.25800 2026-06-25 cs.LG cs.RO 新提交 94%

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

ROAD-VLA:通过自蒸馏实现视觉-语言-动作模型的鲁棒在线自适应

Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 针对稀疏奖励下VLA模型在线自适应困难,提出ROAD-VLA框架,通过优势引导的自蒸馏在动作空间构建近端教师,将稀疏奖励转化为密集token级监督,并在7个机器人操作环境中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 92%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26006 2026-06-25 cs.RO cs.AI 新提交 91%

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调

Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25215 2026-06-25 cs.CV cs.RO 新提交 91%

Reflective VLA: In-Context Action Consequences Make VLAs Generalize

Reflective VLA:上下文动作后果使VLA具备泛化能力

Qing Lian, Kent Yu, Lei Zhang

机构 * Futian Laboratory(福田实验室) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) Visincept

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出Reflective VLA,通过引入观察-动作-后果三元组作为上下文,使VLA模型能感知动作的环境特异性映射,在分布偏移下平均成功率提升5.4和4.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 89%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24815 2026-06-25 cs.SE cs.RO 新提交 89%

MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

MANGO: 面向视觉-语言-动作模型的自动化多智能体测试预言生成

Pablo Valle, Shaukat Ali, Aitor Arrieta, Lionel Briand

机构 * Mondragon University(蒙得龙大学) Simula Research Laboratory(Simula研究实验室) University of Ottawa(渥太华大学) Research Ireland Lero Centre for Software(爱尔兰Lero软件研究中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出MANGO多智能体框架,从自然语言任务描述自动生成细粒度测试预言,通过协作智能体迭代精炼,在机器人基准测试中有效检测故障并定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14945 2026-06-25 cs.RO cs.AI 版本更新 89%

TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

TIDAL: 时间交错扩散与动作循环用于高频VLA控制

Yuteng Sun, Haoran Wang, Ruofei Bai, Zhengguo Li, Jun Li, Meng Yee Michael Chuah, Wei Yun Yau

机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 86%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交 77%

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07892 2026-06-25 cs.RO 版本更新 77%

RoboRouter: Training-Free Policy Routing for Robotic Manipulation

RoboRouter: 机器人操作的无训练策略路由

Yiteng Chen, Zhe Cao, Hongjia Ren, Chenjie Yang, Wenbo Li, Shiyi Wang, Yemin Wang, Li Zhang, Yanming Shao, Zhenjun Zhao, Huiping Zhuang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Nanjing University(南京大学) University of New South Wales(新南威尔士大学) Southwest Jiaotong University(西南交通大学) Xiamen University(厦门大学) The Hong Kong Polytechnic University(香港理工大学) ShanghaiTech University(上海科技大学) University of Zaragoza(巴塞罗那大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出RoboRouter,一种无需训练的策略路由框架,通过维护异构策略池并基于历史经验选择最优策略,在模拟和真实环境中分别提升平均成功率超过3%和13%。

Comments We need to withdraw the paper as some of the reference papers are incorrect and need to be removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26044 2026-06-25 astro-ph.GA astro-ph.SR 新提交 67%

Jets and Outflows in Young Stellar Objects with the SKAO

年轻恒星天体中的喷流与外流与SKAO

Giovanni Sabatini, Gemma Busquet, Carlos Carrasco-González, Adriana Rodríguez-Kamenetzky, Codella Claudio, Linda Podio, Antonio Martínez-Henares, Josep Miquel Girart, Marta De Simone, Luca Cacciapuoti, Guillem Anglada, Lukasz Tychoniec, Lisa Giani, Manoj Puravankara, Francesca Bacciotti, Rafael Bachiller, Eleonora Bianchi, Guillermo Blázquez-Calero, Tyler L. Bourke, Stefano Bovino, Paola Caselli, Francesco Cavallaro, Cecilia Ceccarelli, Elena Diaz-Marquez, Stefano Facchini, Antonio Garufi, Greta Guidi, Tomoya Hirota, John D. Ilee, Adriano Ingallinera, Izaskun Jiménez-Serra, Valerio Lattanzi, Chin-Fei Lee, Manuela Lippi, Alessandro Lupi, Liton Majumdar, Mayank Narang, Mayra Osorio, Marco Padovani, Jaime Pineda, Isaac Radley, Basmah Riaz, Luis Felipe Rodríguez, Alvaro Sánchez-Monge, Alberto Sanna, Silvia Spezzano, Leonardo Testi, Claudia Toci, Alessio Traficante, Himanshu Tyagi, Grazia Maria Umana

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文综述了SKAO如何通过高分辨率厘米波观测、射电复合线和同步辐射,解决年轻恒星天体喷流/外流的加速、准直及化学影响等关键问题。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Sabatini01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25434 2026-06-25 cs.LG cs.AI 新提交 62%

Interpretable Concept-Guided Polynomial Tabular Kolmogorov-Arnold Network for EEG-Based Mild Cognitive Impairment Detection

可解释概念引导的多项式表格Kolmogorov-Arnold网络用于基于EEG的轻度认知障碍检测

Yosef Bernardus Wirian, Qiang Cheng

机构 * Computer Science Department, University of Kentucky(肯塔基大学计算机科学系) Institute for Biomedical Informatics, University of Kentucky(肯塔基大学生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出CPTabKAN模型,通过概念编码、二阶多项式交互和傅里叶参数化TabKAN分类器,在睡眠EEG数据上实现MCI检测,F1达0.9038。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25753 2026-06-25 cs.LG cs.AI math.OC physics.comp-ph physics.optics 新提交 62%

Gradient-based inverse lithography for EUV masks via the waveguide method and a physics-informed neural operator

基于梯度方法的EUV掩模逆光刻:波导方法与物理信息神经算子

Vasiliy A. Es'kin, Egor V. Ivanov

机构 * University of Nizhny Novgorod(下诺夫哥罗德大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于梯度方法的极紫外掩模逆光刻技术,利用可微波导方法和波导神经算子作为端到端物理引擎,通过自动微分恢复掩模吸收体介电常数,实验验证了在多种材料下实现所需晶圆场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06111 2026-06-25 hep-ph astro-ph.HE 版本更新 50%

Dark Matter Heating of Compact Stars Beyond Capture: A Relativistic Framework for Energy Deposition by Particle Beams

超出捕获的致密星暗物质加热:粒子束能量沉积的相对论框架

Jaime Hoefken Zink, Shihwen Hor, Maura E. Ramirez-Quezada

专题命中 VLA模型 :action model(abstract)

AI总结 提出一个广义相对论框架,用于计算定向粒子束在致密星(如中子星和白矮星)中的能量沉积,并应用于耀变体产生的增强暗物质束,评估其加热效应。

Comments 26 pages, 4 figures, version for JHEP (accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏