arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-16 至 2026-07-16 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2607.13926 2026-07-16 cs.RO 新提交 94%

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving

S平方-VLA:自动驾驶视觉-语言-动作模型中语义与空间流的解耦

Jianguo Yu, Rukang Wang, Duanfeng Chu, Chen Wang, Renju Feng, Liping Lu

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机电工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 研究针对自动驾驶中视觉语言模型生成低级控制动作的局限,提出S平方-VLA解耦语义和空间流,语义流用于意图推理,空间流保留空间特征并赋予先验,双流规划适配器融合二者,在基准测试中取得新的最先进水平,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13605 2026-07-16 cs.RO 新提交 90%

An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning

关于VLA微调的阶段信息接口的实证研究

Yingwei Ji

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 研究长期操作中VLA微调的阶段信息接口,通过分段动作注释等方法,在直接微调与延续微调下和GR00T N1.6比较,发现不同接口表示和训练安排下阶段信息对策略成功率影响不同。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 89%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13056 2026-07-16 cs.RO cs.LG 新提交 85%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13621 2026-07-16 cs.AI 新提交 84%

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

UESF-Bench:统一的具身寻找与跟随的基准测试与探究

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Qilu University of Technology(齐鲁工业大学) Xiaomi Inc(小米公司) Beijing University Of Technology(北京工业大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13818 2026-07-16 cs.RO 新提交 77%

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

通过智能强化学习在机器人操作中学习鲁棒执行

Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

机构 * School of Inteligence Science and Engineering, the Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)智能科学与工程学院) Faculty of Robot Science and Engineering, Northeastern University(东北大学机器人科学与工程学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对机器人操作面临的挑战,提出用两个互补指标评估执行质量,构建智能强化学习框架,通过高级决策恢复有效执行,在LIBERO基准测试中提升了执行成功率,增强了执行鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏