arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9119 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9119 篇

2602.09849 2026-02-12 cs.RO 83%

BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation

BagelVLA: 通过交错视觉-语言-动作生成增强长时程操作

Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu Sun, Kun Feng, Qingzhou Lu, Sheng Chen, Yangang Zhang, Wei Li, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 BagelVLA通过整合语言规划、视觉预测和动作生成,提升复杂长时程操作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09722 2026-02-11 cs.RO 83%

Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization

重新思考视觉-语言-动作模型的扩展:对齐、混合与正则化

Ye Wang, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Haoqi Yuan, Chaoyi Xu, Haiweng Xu, Yicheng Feng, Mingyang Yu, Zhiyu Kang, Zongqing Lu, Qin Jin

机构 * Renmin University of China(中国人民大学) BeingBeyond Peking University(北京大学)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本研究重新审视视觉-语言-动作模型的扩展问题,探讨了对齐、混合与正则化在机器人控制中的关键作用,挑战了传统假设并提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01811 2026-02-03 cs.RO 83%

From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models

从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型

Wentao Zhang, Aolan Sun, Wentao Mo, Xiaoyang Qu, Yuxin Zheng, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12142 2026-01-30 eess.AS cs.MM cs.RO 83%

Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving

Listen, Look, Drive: 通过用户意识的VLA基于自主驾驶的音频指令耦合

Ziang Guo, Feng Yang, Xuefeng Zhang, Jiaqi Guo, Kun Zhao, Yixiao Zhou, Peng Lu, Sifa Zheng, Zufeng Zhang

机构 * SuZhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Hyundai Motor Advanced Tech. R&D Center School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO

AI总结 EchoVLA通过结合音频指令与视觉信息,提升自动驾驶对用户意图和情绪的感知能力,显著降低误差和碰撞率。

Comments Accepted by IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 83%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02013 2025-12-02 cs.RO 83%

ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

ManualVLA: 一种统一的VLA模型用于链式思维手动生成和机器人操作

Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Zhuoyang Liu, Xiaoqi Li, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Project(Simplexity机器人项目)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 ManualVLA通过融合多模态手册生成与动作执行,提升机器人长周期任务中的规划与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16233 2025-11-21 cs.RO 83%

FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models

FT-NCFM: 一种面向影响的数据蒸馏框架用于高效VLA模型

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 FT-NCFM通过智能数据蒸馏框架提升VLA模型效率,实现训练数据减少80%的同时成功率达85-90%

Comments Accepted at the AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23511 2025-10-28 cs.RO 83%

Dexbotic: Open-Source Vision-Language-Action Toolbox

Bin Xie, Erjin Zhou, Fan Jia, Hao Shi, Haoqiang Fan, Haowei Zhang, Hebei Li, Jianjian Sun, Jie Bin, Junwen Huang, Kai Liu, Kaixin Liu, Kefan Gu, Lin Sun, Meng Zhang, Peilong Han, Ruitao Hao, Ruitao Zhang, Saike Huang, Songhan Xie, Tiancai Wang, Tianle Liu, Wenbin Tang, Wenqi Zhu, Yang Chen, Yingfei Liu, Yizhuang Zhou, Yu Liu, Yucheng Zhao, Yunchao Ma, Yunfei Wei, Yuxiang Chen, Ze Chen, Zeming Li, Zhao Wu, Ziheng Zhang, Ziming Liu, Ziwei Yan, Ziyu Zhang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

Comments Authors are listed in alphabetical order. The official website is located at https://dexbotic.com/. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10845 2025-10-15 cs.CV 83%

CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving

Hidehisa Arai, Keita Miwa, Kento Sasaki, Yu Yamaguchi, Kohei Watanabe, Shunsuke Aoki, Issei Yamamoto

机构 * Turing Inc.(图灵公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV

Comments WACV 2025, Project Page: https://turingmotors.github.io/covla-ad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07067 2025-10-09 cs.RO 83%

Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models

Daria Pugacheva, Andrey Moskalenko, Denis Shepelev, Andrey Kuznetsov, Vlad Shakhuro, Elena Tutubalina

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02152 2025-10-09 cs.RO 83%

Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions

Cunxin Fan, Xiaosong Jia, Yihang Sun, Yixiao Wang, Jianglan Wei, Ziyang Gong, Xiangyu Zhao, Masayoshi Tomizuka, Xue Yang, Junchi Yan, Mingyu Ding

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(伯克利大学) UNC, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25718 2025-10-01 cs.RO 83%

VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cloning

Si-Cheng Wang, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Ao-Qun Jin, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19752 2025-09-30 cs.RO 83%

Beyond Human Demonstrations: Diffusion-Based Reinforcement Learning to Generate Data for VLA Training

Rushuai Yang, Hangxing Wei, Ran Zhang, Zhiyuan Feng, Xiaoyu Chen, Tong Li, Chuheng Zhang, Li Zhao, Jiang Bian, Xiu Su, Yi Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Microsoft Research Asia(微软亚洲研究院) Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14687 2025-09-19 cs.RO 83%

RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI

Cong Tai, Zhaoyu Zheng, Haixu Long, Hansheng Wu, Haodong Xiang, Zhengbin Long, Jun Xiong, Rong Shi, Shizhuang Zhang, Gang Qiu, He Wang, Ruifeng Li, Jun Huang, Bin Chang, Shuai Feng, Tao Shen

机构 * ZTE Corporation(中通服科技有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13774 2025-09-18 cs.RO 83%

Dual-Actor Fine-Tuning of VLA Models: A Talk-and-Tweak Human-in-the-Loop Approach

Piaopiao Jin, Qi Wang, Guokang Sun, Ziwen Cai, Pinjia He, Yangwei You

机构 * Beijing Xiaomi Robot Technology Co., Ltd.(北京小米机器人科技有限公司) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07957 2025-09-10 cs.RO 83%

Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation

Shunlei Li, Longsen Gao, Jiuwen Cao, Yingbai Hu

机构 * Machine Learning and I-health International Cooperation Base of Zhejiang Province, Artificial Intelligence Institute, Hangzhou Dianzi University, Zhejiang(浙江省机器学习与健康国际合作基地、人工智能学院、杭州电子大学) Electrical and Computer Engineering Department, The University of New Mexico(新墨西哥大学电气与计算机工程系) School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

Comments This paper is submitted to IEEE IROS 2025 Workshop AIR4S

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04996 2025-09-08 cs.RO 83%

FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies

Moritz Reuss, Hongyi Zhou, Marcel Rühle, Ömer Erdinç Yağmurlu, Fabian Otto, Rudolf Lioutikov

机构 * Intuitive Robots Lab(直观机器人实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

Comments Published at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00508 2025-05-13 cs.RO 83%

CLIP-RT: Learning Language-Conditioned Robotic Policies from Natural Language Supervision

Gi-Cheon Kang, Junghyun Kim, Kyuhwan Shim, Jun Ki Lee, Byoung-Tak Zhang

专题命中 VLA模型 :language-conditioned robot(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments Accepted to RSS 2025. Project website: https://clip-rt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04163 2025-03-07 cs.RO 83%

VLA Model-Expert Collaboration for Bi-directional Manipulation Learning

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duang, Si-Cheng Wang, Zheng Lei, Zeng-Guang Hou

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04999 2026-07-31 cs.RO cs.AI cs.LG 版本更新 83%

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

CLAM:基于未标记演示的连续潜在动作模型用于机器人学习

Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CLAM通过连续潜在动作标签和联合训练动作解码器,有效解决复杂连续控制任务中未标记数据的学习问题,实现在DMControl和MetaWorld等基准及真实机器人上的性能提升。

Comments Latent Action Models, Self-supervised Pretraining, Learning from Videos

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03682 2026-08-17 cs.AI cs.RO 版本更新 82%

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

PhyAI:边缘端实时物理人工智能,云端可扩展部署

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Junbo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Ruixin Liu, Shangguang Wang, Tam Sikyuen, Tianyue Zhang, Weikai Xie, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Yuxin Zheng, Ziqi Guo

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对物理AI多部署场景推理程序不统一的问题,提出PhyAI推理引擎,实现多模型跨端部署,在多个基准上取得1.40-4.65倍加速,还引入控制时间屋顶线分析模型特性。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 82%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 82%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 82%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12936 2026-07-17 cs.RO cs.AI 版本更新 82%

Pipette: An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics

面向湿实验室机器人的具身仿真平台、基准测试及数据高效增强框架

Zhe Liu, Huanbo Jin, Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, He Xu, Peijia Li, Jiaming Gu, Quan Lu, Qi Wang, Bin Ji, Ting Xiao

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education(能源化工过程智能制造国家重点实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Laboratory Medicine(实验室医学系) Shanghai Jiao Tong University School of Medicine(上海交通大学医学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Pipette平台,包含可编辑资产、仿真数据增强管道和11任务基准测试,将30次演示的VLA成功率从44.1%提升至74.7%。

Comments 19 pages, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11270 2026-07-14 cs.RO cs.AI 新提交 82%

Towards Predictive, Aligned, and Scalable Robot Learning

迈向可预测、对齐且可扩展的机器人学习

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28545 2026-07-03 cs.RO cs.CV 版本更新 82%

ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation

ManipArena: 通用机器人操作的综合现实世界评估

Yu Sun, Meng Cao, Yang Ping, Kaidong Zhang, Qingxuan Chen, Rongtao Xu, Liangwang Ruan, Xuecheng Chen, Dongxiu Liu, Yunxiao Yan, Zunnan Xu, Runze Xu, Charles Yang, Peilun Zhang, Xiaofan Li, Ruyi Gan, Liang Ma, Yuehao Yin, Jincheng Yu, Lufang Chen, Yuxin Liang, Peng Zhai, Hao Wang, Ivan Laptev, Ian Reid, Qian Wang, Xiaodan Liang

机构 * SYSU(中山大学) X SQUARE ROBOT MBZUAI(穆罕默德·本·扎耶德人工智能大学) Thsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 ManipArena通过标准化框架解决现有评估不足问题,提供真实场景下的多任务测试与多级泛化能力,支持长时移动操作与传感诊断,促进视觉-语言-动作模型和世界模型的发展。

Comments Technical report for CVPR 2026 Challenge ManipArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05226 2026-06-24 cs.RO cs.AI 版本更新 82%

Reward-Centered ReST-MCTS: A Robust Decision-Making Framework for Robotic Manipulation in High Uncertainty Environments

以奖励为中心的ReST-MCTS:高不确定性环境下机器人操作的鲁棒决策框架

Xibai Wang

机构 * Xibai Wang(王西拜)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Reward-Centered ReST-MCTS框架,通过分解中间反馈为中心信号并引导搜索,解决高不确定性环境下MCTS因稀疏奖励和噪声导致的决策脆弱性问题,实验验证其在同骨干VLA上的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22966 2026-06-23 cs.LG cs.AI cs.CR 新提交 82%

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

攻击可信想象:对“先想象后行动”世界模型的预言机级完整性攻击

Linghan Chen, Kaiyan Ji, Minyu Guo

机构 * Adelaide University(阿德莱德大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 针对“先想象后行动”的视觉-语言-动作策略,发现世界模型中的想象轨迹是暴露的攻击面,通过有界观测扰动破坏想象,并设计无参数去噪检测器,实验显示非定向破坏效果显著,但定向控制受限。

Comments 13 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 82%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(summary_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏