arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2605.10821 2026-07-17 cs.RO 版本更新 91%

UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

统一噪声引导用于高效的人类引导VLA适应

Junjie Lu, Xinyao Qin, Yuhua Jiang, Kaixin Wang, Chuheng Zhang, Bin Liang, Jun Yang, Min Xu, Li Zhao

机构 * University of Technology Sydney(悉尼技术大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出UniSteer框架,结合人类纠正指导与噪声空间RL,通过近似动作到噪声的逆向转换提升VLA在真实世界中的适应效率,实验显示成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 91%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交 91%

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02865 2026-07-07 cs.RO 新提交 91%

DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning

DREAMSTEER:潜在世界模型可在部署期间引导VLA策略,无需任何微调

Hanchen Cui, Sergio Arnaud, Arjun Majumdar, Daniel Dugas, Elie Aljalbout, Karthik Desingh, Krishna Murthy Jatavallabhula, Franziska Meier

机构 * Fundamental AI Research (FAIR), Meta(基础人工智能研究(FAIR),Meta公司) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对预训练视觉语言动作(VLA)策略在部署时分布偏移的问题,提出DREAMSTEER框架,利用潜在世界模型和价值模型引导策略,无需微调或修改参数,提升了任务成功率和指令遵循准确率。

Comments 19 pages, 12 figures. Project page: https://dream-steer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24182 2026-07-07 cs.RO 版本更新 91%

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力

Siyao Xiao, Yuhong Zhang, Zhifang Liu, Zihan Gao, Jingye Zhang, Sinwai Choo, Dake Zhong, Mengzhe Wang, Xiao Lin, Xianfeng Zhou, Jia Jia, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) Synapath

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交 91%

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18953 2026-06-18 cs.RO 新提交 91%

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

面向零样本仿真到现实VLA增强的以对象为中心的残差强化学习

Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita

机构 * KAIST(韩国科学技术院) Microsoft Research Asia - Tokyo(微软亚洲研究院-东京) The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出以对象为中心的残差强化学习框架,在仿真中训练策略,零样本迁移到真实机器人,将VLA模型成功率从42%提升至76%。

Comments 8 pages, 7 figures, 2 tables; 8-page appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 91%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 91%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12706 2026-06-12 cs.CV 新提交 91%

VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving

VLADriveBench:评估自动驾驶VLA中的CoT-动作关系

Thach Nguyen, Danhua Guo, Tom Lampo, Fei Wu, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV

AI总结 提出VLADriveBench框架,结合观察指标和CoT干预协议评估VLA模型中思维链与驾驶动作的相关性和因果性,发现不同模型表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12616 2026-06-12 cs.AI cs.CL 新提交 91%

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.AI

AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16013 2026-06-12 cs.RO cs.SE 版本更新 91%

Safety Case Patterns for VLA-based driving systems: Insights from SimLingo

基于VLA的驾驶系统的安全案例模式:来自SimLingo的见解

Gerhard Yu, Fuyuki Ishikawa, Oluwafemi Odu, Alvine Boaye Belle

机构 * York University(约克大学) National Institute of Informatics(国家信息研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对VLA驾驶系统提出RAISE安全案例设计方法,通过扩展HARA和定制模式,结合SimLingo案例验证其构建基于证据的安全声明的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09258 2026-06-09 cs.RO 新提交 91%

Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection

回到熟悉的未来:通过预想里程碑选择实现VLA策略的故障恢复

Suyeon Shin, Juwon Kim, Hyeonbin Park, Hyunseo Kim, Hyundo Lee, Hyung-Sin Kim, Byoung-Tak Zhang

机构 * Seoul National University(首尔大学) Yonsei University(延世大学) Soongsil University(崇实大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出B2FF框架,通过预生成熟悉未来状态里程碑并选择恢复目标,使VLA策略在偏离轨迹时无需微调即可稳健恢复,成功率从56.3%提升至74.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19183 2026-06-09 cs.RO 版本更新 91%

Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models

稀疏自编码器揭示VLA模型中可解释且可操控的特征

Aiden Swann, Lachlain McGranahan, Hugo Buurmeijer, Monroe Kennedy, Mac Schwager

机构 * Department of Mechanical Engineering(机械工程系) Department of Computer Science(计算机科学系) Department of Aeronautics & Astronautics(航空与航天系)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文通过训练稀疏自编码器揭示VLA模型中可解释且可操控的特征,验证了其在不同任务和场景中的可迁移性。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05773 2026-06-05 cs.RO 91%

PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation

PiL-World: 用于VLA策略环内评估的块式世界模型

Chong Ma, Taiyi Su, Jian Zhu, Jianjun Zhang, Zitai Huang, Yi Xu, Hanli Wang

机构 * Tongji University(同济大学) AIRC, Midea Group(美的集团人工智能研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出PiL-World,一种块式世界模型,通过交替VLA推理和世界模型预测实现闭环评估,无需真实机器人执行,显著降低成功率估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12628 2026-06-05 cs.RO 91%

Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models

超越模仿:基于强化学习的仿真-现实协同训练用于VLA模型

Liangzhi Shi, Shuaihang Chen, Feng Gao, Yinuo Chen, Kang Chen, Tonghe Zhang, Hongzhi Zang, Jiakai Zhou, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出基于强化学习的仿真-现实协同训练框架,通过结合仿真交互与真实世界数据,提升VLA模型的现实应用能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02486 2026-06-02 cs.RO 91%

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

拦截未来:用于动态VLA操作的潜在空间预测世界模型

Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出AHEAD框架,通过潜在空间世界模型预测未来视觉特征,使冻结的VLA模型在动态场景中实现高成功率操作。

Comments 28 pages, 7 figures, 16 tables, Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02313 2026-06-02 cs.RO 91%

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

迈向精确意图对齐的VLA空中导航:基于专家引导的GRPO

Tianyang Chen, Wenjun Li, Xin zhou, Yuze Wu, Fei Gao

机构 * Zhejiang University Differential Robotics(浙江大学差分机器人实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出EG-GRPO框架,通过专家数据增强在线rollout和异构并行流水线,解决VLA模型在无人机导航中因数据稀缺和探索低效导致的意图对齐问题,成功率提升至SFT基线的2.13倍,意图对齐性能提升60.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02277 2026-06-02 cs.RO 91%

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

RoboSemanticBench: 诊断 VLA 模型在动作预测中的语义基础

Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究所) WHU(武汉大学) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出 RoboSemanticBench 基准,通过多选问答任务评估 VLA 模型是否利用指令语义选择正确物体,发现模型在语义正确选择上接近随机,揭示语义理解与动作预测之间的差距。

Comments GitHub: https://github.com/ZGC-EmbodyAI/RoboSemanticBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29710 2026-05-29 cs.RO 91%

PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology

PhAIL:一个真实机器人VLA基准测试与分布性方法论

Sergey Arkhangelskiy

机构 * Positronic Robotics(positronic机器人)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA策略评估中样本量小、统计比较不可靠的问题,提出PhAIL基准测试,采用时间-成功累积分布函数作为评估基元,通过人类相对吞吐量评分和Kolmogorov-Smirnov显著性检验,在少量rollout下实现更可靠的模型比较。

Comments 22 pages, 10 figures, 8 tables. Dataset, analysis pipeline, and paper source: https://phail.ai and https://github.com/Positronic-Robotics/phail-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01194 2026-05-29 cs.RO 91%

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

VLA-ATTC:基于相对动作评判模型的VLA模型自适应测试时计算

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu

机构 * University of Sydney(悉尼大学) Central South University(中央南大学) University of Science and Technology of China(中国科学技术大学) Sensetime Research(商汤科技研究院) Hong Kong University of Science and Technology(香港理工大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出VLA-ATTC框架,通过不确定性驱动的“认知离合器”和相对动作评判模型(RAC)实现自适应测试时计算,在LIBERO-LONG基准上将SOTA模型PI0.5的失败率降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01191 2026-05-29 cs.RO 91%

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

Sentinel-VLA:一种具有主动状态监控的元认知VLA模型,用于动态推理和错误恢复

Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu

机构 * University of Sydney(悉尼大学) Central South University(中央南大学) University of New South Wales(新南威尔士大学) Sensetime Research(商汤科技研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Sentinel-VLA模型,通过主动哨兵模块监控执行状态,仅在必要时触发动态推理或错误恢复,结合自进化持续学习算法和正交持续适配器,在44个任务上提升成功率30%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27461 2026-05-28 cs.RO 91%

A Factory-Floor Deployment Case Study of VLA Pipelines for Industrial Packaging Task: Workflow, Failures, and Lessons

工业包装任务的VLA流水线工厂部署案例研究:工作流、故障与经验教训

Brian Zhu, Philipp Schmitt, Philine Meister, Lukas Gensler, Momen Khalil, Emmanuele Poggi, Johannes Hechtl, Carsten Braunroth, Kai Wurm, Gokul Narayanan, Eugen Solowjow, Georg von Wichert, Andre Scholz, Felix Albrecht, Maxmillian Metzner

机构 * Siemens Corporation(西门子公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本研究通过在西门子工厂部署预训练Pi0.5策略执行工业包装任务,迭代微调并收集2535个现场数据片段,总结了VLA流水线部署中的常见故障模式与改进工作流的经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25802 2026-05-26 cs.CV 91%

Rethinking VLM Representation for VLA Initialization

重新思考用于VLA初始化的VLM表示

Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

机构 * CUHK(香港中文大学) PolyU Peking University(北京大学) ACE Robotics(ACE机器人)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV

AI总结 本文通过控制表示设计问题,沿能力级具身VQA监督、参数更新策略和机器人数据预训练三个轴,研究VLA初始化,发现保留预训练VLM表示对动作性能至关重要,而LoRA比全微调提供更可靠的初始化,分阶段基于LoRA的训练获得最强变体。

Comments 9 main-text pages, 5 appendix pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06508 2026-05-26 cs.RO 91%

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

World-VLA-Loop: 视频世界模型与VLA策略的闭环学习

Xiaokang Liu, Zechen Bai, Hai Ci, Kevin Yuchen Ma, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出World-VLA-Loop框架,通过状态感知视频世界模型联合预测未来帧和二元奖励,并采用协同进化范式迭代优化VLA策略,减少对真实环境交互的依赖。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24203 2026-05-26 cs.RO 91%

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance

Afford-VLA:通过内化可操作性实现动作对齐的视觉规划

Runze Wang, Yuqian Fu, Yu Li, Tao Lin, Tianwen Qian, Mohamed Elhoseiny, Bo Zhao, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) KAUST(康斯坦丁·亚历山大科研大学) SJTU(上海交通大学) East China Normal University(华东师范大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Afford-VLA框架,通过内化任务条件可操作性作为显式视觉规划接口,利用可学习<AFF>令牌查询交互区域并解码为紧凑嵌入以直接条件化动作生成,在多个模拟基准上取得最先进性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19282 2026-05-20 cs.LG 91%

Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

重新思考Muon超越预训练:VLA和RLVR中的频谱失败及高频修复

Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu

机构 * Michigan State University(密歇根州立大学) Cisco(思科) University of Minnesota(明尼苏达大学) IBM Research(IBM研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.LG

AI总结 本文研究了Muon优化器在预训练之外的局限性,提出Pion通过高频NS迭代机制改进VLA和RLVR任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13757 2026-05-14 cs.RO 91%

FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

FrameSkip: 从更信息丰富的较少帧中学习以在VLA训练中提升性能

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Changti Wu, Hang Yuan, Haishan Liu, Bailing Wang, Cong Huang, Kai Chen

机构 * Harbin Institute of Technology(哈尔滨理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北航) DeepCybo

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出FrameSkip框架,通过选择高重要性帧来优化VLA训练,提升成功率与保留率的平衡,实现在三个基准测试中达到76.15%的成功率。

Comments GitHub: https://github.com/ZGC-EmbodyAI/FrameSkip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13105 2026-05-14 cs.RO 91%

What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调

Yuanfang Peng, Jingjing Fu, Chuheng Zhang, Li Zhao, Jiang Bian, Mingyu Liu, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 91%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏