arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-14 至 2026-04-14 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2604.09824 2026-04-14 cs.RO cs.CL cs.CV 91%

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

ProGAL-VLA: 通过前瞻性推理实现视觉-语言-动作模型中的 grounded 对齐

Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);vision language action(abstract)

AI总结 ProGAL-VLA 通过构建 3D 实体中心图、使用慢速规划器生成符号子目标,并通过 Grounding Alignment Contrastive 损失对齐实体,提升机器人在扰动下的鲁棒性,减少语言忽略并提高实体检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09651 2026-04-14 cs.CV cs.LG cs.RO 89%

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18082 2026-04-14 cs.CV cs.RO 88%

ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models

ActDistill: 通用动作引导自衍生蒸馏用于高效视觉-语言-动作模型

Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) University of Technology Sydney(悉尼科技大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ActDistill框架,通过动作先验引导知识迁移与模型压缩,实现高效视觉-语言-动作模型。实验表明,该方法在减少50%计算量的同时,性能可与全规模模型相比或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 88%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 87%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 81%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11751 2026-04-14 cs.RO cs.AI 62%

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11938 2026-04-14 hep-ph cs.AI cs.LG hep-ex 62%

Improving Neutrino Oscillation Measurements through Event Classification

通过事件分类改进中微子振荡测量

Sebastian A. R. Ellis, Daniel C. Hackett, Shirley Weishi Li, Pedro A. N. Machado, Karla Tame-Narvaez

机构 * King’s College London(伦敦国王学院) Fermilab(费米实验室) University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用事件分类提升中微子能量重建精度,通过机器学习方法区分不同相互作用通道,提高DUNE实验中μ中微子消失分析的准确性和灵敏度。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV 62%

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02736 2026-04-14 cs.CV 57%

THOM: Generating Physically Plausible Hand-Object Meshes From Text

THOM:从文本生成物理合理的手-物体网格

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim

机构 * UNIST(蔚山科学技术院) University of Birmingham(伯明翰大学) POSTECH(浦项科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。

Comments accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28863 2026-04-14 astro-ph.GA astro-ph.HE 50%

Something Bright at the Edge of Everything: A Uniquely JWST-Dark Radio Source in COSMOS

万物边缘的亮光:COSMOS中一个独特的JWST暗无线电源

Mingyu Li

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过交叉匹配COSMOS区域的无线电和JWST源目录,发现一个唯一未被JWST检测到但被低频射电望远镜检测到的无线电源,揭示了深空射电调查与JWST成像结合的新发现领域。

Comments RNAAS; 3 pages, 1 figure

Journal ref Res. Notes AAS 10 83 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10782 2026-04-14 astro-ph.IM astro-ph.GA 50%

Inferring Unreported Measurement Uncertainties via Information Geometry in Astrophysics

通过信息几何推断未报告的测量不确定性

Marko Imbrišak, Krešimir Tisanić

专题命中 VLA模型 :VLA(abstract)

AI总结 本文提出FIMER框架,通过信息几何方法从异质天文数据中重建有效的测量不确定性,以提高统计推断的可靠性。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2604.11689 2026-04-14 cs.CV cs.RO 79%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10953 2026-04-14 cs.CL 50%

A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information Extraction

一种多语言数据集和信息提取中相互强化效应的实证验证

Chengguang Gan, Sunbowen Lee, Qingyu Yin, Yunhao Liang, Xinyang He, Hanjun Wei, Younghun Lim, Shijian Wang, Hexiang Huang, Qinghao Zhang, Shiwen Ni, Tatsunori Mori

机构 * Yokohama National University(横滨国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) Southeast University(东南大学) University of Tsukuba(筑波大学) Pusan National University(釜山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 数据集与评测 :action model(abstract)

AI总结 本文提出多语言MRE混合数据集,通过LLM辅助框架减少标注工作,验证了多语言环境下信息提取中相互强化效应的普遍性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏