arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9800 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2604.16677 2026-04-21 cs.RO cs.AI 86%

ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control

ReconVLA:一种基于不确定性和故障意识的视觉-语言-动作框架用于机器人控制

Lingling Chen, Zongyao Lyu, William J. Beksi

机构 * Department of Computer Science and Engineering, The University of Texas at Arlington(计算机科学与工程系,德克萨斯理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 ReconVLA通过引入符合预测方法,为视觉-语言-动作模型提供校准的不确定性估计和故障检测,提升机器人控制的可靠性与安全性。

Comments 17 pages, 9 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16666 2026-03-24 cs.CV cs.AI 86%

Fast-WAM: Do World Action Models Need Test-time Future Imagination?

Fast-WAM: 世界动作模型是否需要测试时的未来想象?

Tianyuan Yuan, Zibin Dong, Yicheng Liu, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学院) Galaxea AI

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了世界动作模型是否需要在测试时进行显式未来想象,通过提出Fast-WAM架构,发现训练时的视频共训练对性能影响更大,且Fast-WAM在模拟和现实任务中表现出色,实现实时运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07404 2026-03-10 cs.RO cs.AI 86%

Adaptive Capacity Allocation for Vision Language Action Fine-tuning

面向视觉语言动作微调的自适应容量分配

Donghoon Kim, Minji Bae, Unghui Nam, Gyeonghun Kim, Suyun Lee, Kyuhong Shim, Byonghyo Shim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学) Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,全北国立大学)

专题命中 VLA模型 :vision language action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出LoRA-SP方法,通过自适应秩微调提升视觉语言动作模型在多任务场景中的性能和泛化能力。

Comments ICRA 2026 (Official Code: https://github.com/dhkim-furiosa/LoRA-SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01210 2026-03-03 cs.CV cs.RO 86%

OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation

OmniVLA:具有统一多传感器感知的物理基础多模态VLA

Heyu Guo, Shanmu Wang, Ruichun Ma, Shiqi Jiang, Yasaman Ghasempour, Omid Abari, Baining Guo, Lili Qiu

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 OmniVLA通过整合多种传感器模态,提升机器人操作的感知能力与任务成功率。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21557 2025-11-27 cs.RO cs.AI 86%

VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation

VacuumVLA: 通过统一的吸力和抓取工具提升VLA能力以实现复杂机器人操作

Hui Zhou, Siyuan Huang, Minxing Li, Hao Zhang, Lue Fan, Shaoshuai Shi

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) DiDi Global(滴滴出行)

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 VacuumVLA通过整合吸力与抓取功能的末端执行器,提升VLA在复杂机器人操作中的能力,实现更多任务的可行性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19528 2025-11-26 cs.RO cs.AI 86%

Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories

发现、学习与强化:通过多样化强化学习生成轨迹扩展视觉-语言-动作预训练

Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang, Kaixin Wang, Chuheng Zhang, Li Zhao, Xiu Su, Yi Chen, Jiang Bian

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Central South University(中南大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);embodied foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DLR框架,通过多样化强化学习生成轨迹,提升VLA预训练的多样性和扩展性,实现更广泛的状态-动作空间覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV 86%

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);vision language action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12211 2025-11-14 cs.RO cs.AI 86%

Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search

Cyrus Neary, Omar G. Younis, Artur Kuramshin, Ozgur Aslan, Glen Berseth

机构 * Mila — Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);language-conditioned robot(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13054 2025-10-16 cs.RO cs.AI 86%

VLA-0: Building State-of-the-Art VLAs with Zero Modification

Ankit Goyal, Hugo Hadfield, Xuning Yang, Valts Blukis, Fabio Ramos

机构 * NVIDIA

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22093 2025-09-29 cs.RO cs.AI 86%

Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation

Xiaohuan Pei, Yuxing Chen, Siyu Xu, Yunke Wang, Yuheng Shi, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05833 2025-08-05 cs.RO cs.LG 86%

Refined Policy Distillation: From VLA Generalists to RL Experts

Tobias Jülg, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(计算机科学与人工智能系,图恩大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

Comments accepted for publication at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21432 2025-07-09 cs.RO cs.AI 86%

Hume: Introducing System-2 Thinking in Visual-Language-Action Model

Haoming Song, Delin Qu, Yuanqi Yao, Qizhi Chen, Qi Lv, Yiwen Tang, Modi Shi, Guanghui Ren, Maoqing Yao, Bin Zhao, Dong Wang, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot INSAIT, Sofia University(INSAIT,索菲亚大学) Zhejiang University(浙江大学) Northwestern Polytechnical University(西北工业大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17640 2026-08-06 cs.RO cs.AI cs.LG 版本更新 86%

RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation

RESample:通过探索性采样构建鲁棒数据增强框架用于机器人操控

Yuquan Xue, Guanxing Lu, Zhenyu Wu, Chuanrui Zhang, Bofang Jia, Zhengyi Gu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出RESample框架,通过探索性采样机制提升VLA训练数据分布覆盖,有效解决分布外场景下的能力瓶颈问题,实验证明在LIBERO基准和真实机器人任务中性能提升12%。

Comments 8 pages, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 86%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 86%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02735 2026-06-09 cs.RO cs.AI cs.LG 版本更新 86%

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs

看得更少,指定更多:面向可泛化视觉-语言-动作模型的视觉证据预算

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出S2框架,通过显式视觉证据预算和细化轨迹语言,改善VLA模型在干扰、外观变化和语义相似任务下的泛化能力。

Comments Project page: https://s2.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19417 2025-07-16 cs.RO cs.AI cs.LG 86%

Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models

Lucy Xiaoyang Shi, Brian Ichter, Michael Equi, Liyiming Ke, Karl Pertsch, Quan Vuong, James Tanner, Anna Walling, Haohuan Wang, Niccolo Fusai, Adrian Li-Bell, Danny Driess, Lachy Groom, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03293 2025-06-05 cs.RO cs.CV 86%

Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning

Junjie Wen, Minjie Zhu, Yichen Zhu, Zhibin Tang, Jinming Li, Zhongyi Zhou, Chengmeng Li, Xiaoyu Liu, Yaxin Peng, Chaomin Shen, Feifei Feng

专题命中 VLA模型 :VLA(title,comments);robot foundation model(title);分类 cs.RO、cs.CV

Comments Accepted by ICML 2025. The project page is available at: http://diffusion-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13026 2026-08-14 cs.RO 新提交 85%

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间差分GRPO:超越视觉-语言-动作强化学习中的轨迹级信用分配

Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作强化学习中轨迹级信用混叠问题,提出时间差分GRPO方法,在RoboTwin 2.0和LIBERO-Long上提升了任务性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09381 2026-08-11 cs.RO 新提交 85%

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM:基于联合嵌入世界建模的视觉-语言-动作策略学习

Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

机构 * XYZ Embodied AI(XYZ具身智能)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 该研究提出JEPA-WAM,一种构建于预训练V-JEPA空间的隐式WAM,通过共享预测器耦合隐式转移预测与动作生成,在LIBERO-Plus等数据集上取得优异的机器人操作策略性能,且泛化能力强。

Comments 22 pages, 7 figures. Project page: https://spritewithoutice.github.io/JEPA_WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06375 2026-08-11 cs.RO 版本更新 85%

$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

ω-0:一种用于类人机器人协同移动操作的潜在预测世界动作模型

Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang

机构 * NTU(南洋理工大学) PKU(北京大学) BAAI(北京智源人工智能研究院) HKUST(GZ)(香港科技大学(广州))

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出 ω-0 模型,针对类人机器人协同移动操作问题,结合潜在视觉预见与扩散动作生成,在 11 项家庭任务上优于多个基线,还构建了 ω-HOME 数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06965 2026-08-10 cs.RO 新提交 85%

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

面向相机鲁棒性的视觉-语言-动作策略的跨视图动作一致性

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

机构 * Tsinghua University(清华大学) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学研究所) Faculty of Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学理学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本研究针对视觉-语言-动作策略的相机鲁棒性问题,提出跨视图动作一致性正则化方法,在LIBERO-Plus数据集及真实机器人任务上均显著提升了相机扰动下的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03727 2026-08-05 cs.RO 新提交 85%

Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies

Track4Action:将以世界为中心的3D跟踪器提炼为视觉-语言-动作策略

Chenyi Wang, Xinkai Wang, Bokai Lin, Jialin Tian, Fucheng Zhang, Cewu Lu, Lixin Yang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 Track4Action框架将以世界为中心的冻结3D跟踪器提炼为视觉-语言-动作策略,在多个机器人任务基准上显著提升性能,验证了动作对齐的3D跟踪器特征作为监督的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14852 2026-07-22 cs.RO 版本更新 85%

Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation

迈向类人物理智能:用于机器人操作的终身视觉-语言-动作学习

Yao He, Gan Sun, Wenqi Liang, Fazeng Li, Yang Cong

机构 * South China University of Technology(华南理工大学) University of Trento(特伦托大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对机器人操作中可塑性-稳定性权衡难题,提出缓存高效的终身视觉-语言-动作学习框架LifelongVLA。通过双时间尺度LoRA门控模块及缓存高效随机重放策略,有效缓解权衡问题,实现技能扩展、行为保留,减少再训练依赖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06256 2026-07-16 cs.RO 版本更新 85%

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

机构 * SimpleAI

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。

Journal ref RSS SemRob Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12571 2026-07-15 cs.RO 新提交 85%

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

TrustVLA:针对视觉-语言-动作后门的机制引导推理时防御

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) D-Robotics(D-机器人公司) HUST(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究视觉-语言-动作模型中毒后门问题,通过两种攻击识别出紧凑因果足迹机制,基于此提出TrustVLA防御,能检测异常证据演变、定位支持并恢复观测,在多评估中降低攻击成功率且保持干净任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23128 2026-07-08 cs.RO 版本更新 85%

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

$\pi_0$-EqM:闭环视觉-语言-动作控制的均衡匹配

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出$\pi_0$-EqM,用均衡匹配解码器替换$\pi_0$中的流匹配专家,在固定预算下提升机器人操作成功率,并发现残差与成功率之间的非单调关系。

Comments Preprint. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04609 2026-07-07 cs.RO 新提交 85%

SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies

SEAM:用于视觉-语言-动作策略的动作块运动平滑执行

Dijia Zhan, Xuemiao Xu, Jinyi Li, Jie Tang

机构 * South China University of Technology(南方科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究视觉-语言-动作策略中动作块执行的多模态分叉问题,提出无训练推理时的SEAM方法,利用同步执行见解,通过速度引导损失转向机制减少边界抖动和块过渡不连续性。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20092 2026-06-19 cs.CV 新提交 85%

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

EventVLA: 面向长程视觉-语言-动作策略的事件驱动视觉证据记忆

Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jifeng Dai, Wengang Zhou, Yao Mu, Tai Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Dalian University of Technology(大连理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 针对长程机器人操作中记忆瓶颈问题,提出EventVLA框架,通过动态关键帧证据记忆模块自主捕获任务关键视觉事件,在17个模拟和4个真实任务中平均成功率提升40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08706 2026-06-16 cs.RO 版本更新 85%

OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing

OmniVTLA:具有语义对齐触觉感知的视觉-触觉-语言-动作模型

Zhengxue Cheng, Yiqian Zhang, Anni Tang, Keyu Wang, Wenkang Zhang, Haoyu Li, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕辛尼科技)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出OmniVTLA架构,通过双路径触觉编码器框架和语义对齐触觉ViT,结合新数据集ObjTac,显著提升机器人操作中接触密集任务的成功率和轨迹平滑度。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). ObjTac dataset: https://readerek.github.io/Objtac.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏