arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-05 至 2026-03-05 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2603.01266 2026-03-05 cs.CL 78%

A Study on Building Efficient Zero-Shot Relation Extraction Models

构建高效零 shot 关系提取模型的研究

Hugo Thomas, Caio Corro, Guillaume Gravier, Pascale Sébillot

专题命中 VLA模型 :action model(title,abstract)

AI总结 本文研究了构建高效零 shot 关系提取模型的方法,提出多种策略以提高模型在现实场景中的鲁棒性,结果显示 AlignRE 在各项指标上表现最佳。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 73%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11291 2026-03-05 cs.RO 70%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17034 2026-03-05 cs.RO cs.NE 57%

Evolution 6.0: Robot Evolution through Generative Design

进化6.0:通过生成设计实现机器人进化

Muhammad Haris Khan, Artyom Myshlyaev, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺研究所)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO

AI总结 进化6.0通过生成式AI实现机器人自主设计工具和执行任务,展示高成功率和泛化能力。

Comments Accepted to HRI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19570 2026-03-05 cs.HC cs.AI 57%

The Epistemological Consequences of Large Language Models: Rethinking collective intelligence and institutional knowledge

大型语言模型的知识论后果:重新思考集体智慧与制度知识

Angjelin Hila

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文探讨LLM对集体智慧和制度知识的影响,提出集体知识论理论,强调反思性知识的重要性,并提出三级规范计划以应对LLM带来的知识论风险。

Comments AI & Soc (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 3 篇

2603.03768 2026-03-05 cs.RO cs.AI 73%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03380 2026-03-05 cs.RO cs.AI 73%

LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics

LiteVLA-Edge: 量化在设备上多模态控制用于嵌入式机器人

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Clark Atlanta University(克拉克阿特兰大学) Siemens Corporation(西门子公司)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 LiteVLA-Edge通过量化和GPU加速,在嵌入式机器人中实现低延迟的多模态控制,提供模块化本地执行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03836 2026-03-05 cs.RO 70%

SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse

SkillVLA: 通过技能复用解决双臂操作中的组合多样性问题

Xuanran Zhai, Zekai Huang, Longyan Wu, Qianyou Zhao, Qiaojun Yu, Jieji Ren, Ce Hao, Harold Soh

机构 * National University of Singapore(国立新加坡大学) Beijing Zhongguancun Academy(北京中关村学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Smart Systems Institute, NUS(NUS智能系统研究所)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 SkillVLA通过技能复用解决双臂操作中的组合多样性问题,提升技能组合成功率至51%并在复杂任务中表现优异。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2603.04356 2026-03-05 cs.RO cs.AI cs.LG 67%

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

RoboCasa365:一种大规模仿真框架,用于训练和评估通用机器人

Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

专题命中 机器人基础模型 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RoboCasa365通过大规模仿真框架提供多样化任务和环境,用于训练和评估通用机器人,分析任务多样性、数据集规模和环境变化对泛化的影响。

Comments ICLR 2026; First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏