arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-26 至 2026-06-26 共收录 16 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 14 篇

2606.27079 2026-06-26 cs.RO 新提交 94%

ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models

ForesightSafety-VLA:视觉-语言-动作模型的统一诊断安全基准

Mingyang Lyu, Yinqian Sun, Yiyang Jia, Sicheng Shen, Moquan Sha, Huangrui Li, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑认知智能实验室) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究所) Gaoling School of AI, Renmin University of China(中国人民大学高瓴人工智能学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出ForesightSafety-VLA基准,通过13类安全分类和三维变量控制,诊断VLA模型在物理交互、指令和感知侧的安全风险,并引入累积安全成本和风险暴露时间等过程级指标。

Comments 8 pages, 5 figures, 4 tables. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 92%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26801 2026-06-26 cs.RO cs.CV 新提交 91%

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision

通过结构化阶段和关键帧监督改进视觉-语言-动作模型微调

Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS)) FiveAges

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出StaKe框架,通过从演示中自动提取阶段分类器和关键帧预测器作为辅助监督,提升VLA模型在长时域操作任务中的微调效果,成功率相对提升14%-56%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 90%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交 89%

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27144 2026-06-26 cs.RO 新提交 89%

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 84%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27374 2026-06-26 cs.RO cs.CV 新提交 81%

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

世界行动模型通过循环生成重放实现持续模仿学习

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出循环生成重放(REGEN)框架,利用世界行动模型(WAM)生成伪重放轨迹,使机器人策略在不存储原始演示的情况下复习先前任务,在仿真和真实实验中减少50%灾难性遗忘,接近真实重放性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06480 2026-06-26 cs.RO 版本更新 77%

History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航

Qitong Wang, Yijun Liang, Ming Li, Tianyi Zhou, Christopher Rasmussen

机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27268 2026-06-26 cs.RO cs.AI 新提交 73%

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS:一种新的机器人操作具身测试时缩放框架

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) FiveAges(五时代)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。

Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 73%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26588 2026-06-26 cs.RO 新提交 70%

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure

推理时通过物理感知的任务结构重配置实现机器人行为引导

Yiyuan Pan, Hanjiang Hu, Shangtao Li, Xusheng Luo, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出ReStruct方法,利用神经自动机策略将视觉运动策略分解为高层状态机骨架和低层残差控制器,通过同步乘积将用户偏好融入骨架以重配置任务结构,实现无需重训练的推理时行为引导,在仿真和真实实验中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27058 2026-06-26 cs.IR 新提交 50%

UniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation

UniFormer: 面向工业推荐的高效统一模型中心缩放

Bo Chen, Jinlong Jiao, Tijian Hu, Ruihao Zhang, Yanzhi Liu, Chenghou Jin, Qinglin Jia, Baixuan He, Hechang Pan, Yiwu Liu, Jian Liang, Chaoyi Ma, Ruiming Tang, Han Li, Kun Gai

专题命中 VLA模型 :action model(abstract)

AI总结 提出UniFormer框架,通过分解特征与任务空间、引入语义令牌化及多序列交叉注意力,实现工业推荐系统的统一模型中心缩放,在快手和快手极速版上显著提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05646 2026-06-26 astro-ph.CO 版本更新 50%

A microphysically inspired approach to dark matter-dark energy interactions: first bounds on dark-sector scattering cross sections

一种微观物理启发的暗物质-暗能量相互作用方法:暗扇区散射截面的首次界限

A. A. Escobal, F. B. Abdalla, J. F. Jesus, E. Abdalla, C. Feng, J. A. S. Lima, O. P. F. Piedra

专题命中 VLA模型 :action model(abstract)

AI总结 针对哈勃常数张力,提出基于玻尔兹曼方程的“自下而上”暗物质-暗能量相互作用模型(Q∝ρ²),利用背景宇宙学数据约束相互作用率系数,首次给出暗扇区湮灭截面上限。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2606.27325 2026-06-26 cs.CV 新提交 57%

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

并非所有动作都同等重要:重新思考灵巧世界模型的条件化

Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing University of Technology(北京工业大学) JD Explore Academy(京东探索研究院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2606.27153 2026-06-26 cs.DC cs.LG 新提交 57%

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

DMuon: 高效分布式Muon训练,开销接近Adam

Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X SQUARE ROBOT TEAM(X SQUARE机器人团队)

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.LG

AI总结 提出DMuon,一种分布式矩阵正交化优化器,通过减少通信和计算开销,使每步延迟接近AdamW,在基础模型和LLM训练中实现1.48-3.01倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏