arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-07 至 2026-08-07 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 8 篇

2608.05738 2026-08-07 cs.RO 新提交 93%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06374 2026-08-07 cs.RO 新提交 92%

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作

Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05730 2026-08-07 cs.HC 新提交 90%

SpaceVLA: Spatially Grounded VLA for Robotic Manipulation with User-Authored Grasp and Place Anchors

SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点

Daniia Zinniatullina, Iaroslav Kolomiets, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。

Comments A poster for the ISMAR conference, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05453 2026-08-07 astro-ph.GA astro-ph.SR 新提交 89%

The Zero-Age Massive Stellar Population of W49A from VLA Observations

基于VLA观测的W49A零龄大质量恒星群

M. Juárez-Gama, R. Galván-Madrid, G. Suárez, C. G. De Pree, J. J. Tobin, G. Bruzual, A. Ginsburg, J. E. Mendoza-Torres, H. B. Liu, D. Wilner, T. Nony, A. Parra-López, R. Rivera-Soto, A. F. McLeod, N. Cunningham, X. Lu, E. F. Jiménez-Andrade

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 该研究利用VLA观测数据推断W49A原星团的零龄大质量恒星群,通过方法推导恒星参数,发现其大质量端IMF斜率与标准IMF存在差异,提出相关可能原因。

Comments Resubmitted to the AAS Journals following the second referee report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05369 2026-08-07 cs.RO cs.CV 新提交 85%

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Xidian University(西安电子科技大学) Southeast University(东南大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05999 2026-08-07 cs.RO 新提交 84%

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

超越扁平策略:面向机器人操作具身智能体的分层后训练

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05374 2026-08-07 astro-ph.IM 新提交 67%

Information Geometry meets Functional ANOVA: An Exact Fisher-Information Decomposition, with an Application to Radio Luminosity Functions

信息几何与功能方差分析的结合:一种精确的费舍尔信息分解及其在射电光度函数中的应用

Marko Imbrišak, Krešimir Tisanić

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 该研究将信息几何与功能方差分析结合,提出费舍尔信息的精确分解方法,并将其应用于射电光度函数模型的参数信息分解,还以植物CO2吸收实验作为示例验证方法。

Comments 10 pages, 7 figures. Also archived at Zenodo: doi:10.5281/zenodo.21551360

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05614 2026-08-07 cs.HC 新提交 50%

Toward Resilient Human-AI Collaboration: A Lifecycle Taxonomy of Sociotechnical Risks and Cascading Failures

面向弹性人机协作:社会技术风险与级联故障的生命周期分类

Md Foysal Ahmed, Isaac Kobby Anni, Md Main Uddin Rony

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出人机协作风险的生命周期分类框架,识别六大跨领域风险集群,构建交互模型揭示风险级联机制,为设计更具弹性的人机协作系统提供基础。

Comments 11 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 3 篇

2608.05970 2026-08-07 cs.RO cs.AI 新提交 87%

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

专题命中 动作表示与策略 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06154 2026-08-07 cs.RO cs.AI cs.CV 新提交 67%

Visual Grounding in Zero-Shot Vision-Language Control

零样本视觉语言控制中的视觉 grounding

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文针对零样本视觉语言控制中VLMs决策是否基于视觉输入的问题,通过多组消融实验分析了多种VLMs的表现,提出对称共识守护者方法,验证了VLMs可作为有界的危险助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 57%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏