arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-14 至 2026-04-14 共收录 12 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2604.09824 2026-04-14 cs.RO cs.CL cs.CV 91%

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

ProGAL-VLA: 通过前瞻性推理实现视觉-语言-动作模型中的 grounded 对齐

Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);vision language action(abstract)

AI总结 ProGAL-VLA 通过构建 3D 实体中心图、使用慢速规划器生成符号子目标,并通过 Grounding Alignment Contrastive 损失对齐实体,提升机器人在扰动下的鲁棒性,减少语言忽略并提高实体检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09651 2026-04-14 cs.CV cs.LG cs.RO 89%

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18082 2026-04-14 cs.CV cs.RO 88%

ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models

ActDistill: 通用动作引导自衍生蒸馏用于高效视觉-语言-动作模型

Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) University of Technology Sydney(悉尼科技大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ActDistill框架,通过动作先验引导知识迁移与模型压缩,实现高效视觉-语言-动作模型。实验表明,该方法在减少50%计算量的同时,性能可与全规模模型相比或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 88%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 87%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 81%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11751 2026-04-14 cs.RO cs.AI 62%

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11938 2026-04-14 hep-ph cs.AI cs.LG hep-ex 62%

Improving Neutrino Oscillation Measurements through Event Classification

通过事件分类改进中微子振荡测量

Sebastian A. R. Ellis, Daniel C. Hackett, Shirley Weishi Li, Pedro A. N. Machado, Karla Tame-Narvaez

机构 * King’s College London(伦敦国王学院) Fermilab(费米实验室) University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用事件分类提升中微子能量重建精度,通过机器学习方法区分不同相互作用通道,提高DUNE实验中μ中微子消失分析的准确性和灵敏度。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV 62%

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02736 2026-04-14 cs.CV 57%

THOM: Generating Physically Plausible Hand-Object Meshes From Text

THOM:从文本生成物理合理的手-物体网格

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim

机构 * UNIST(蔚山科学技术院) University of Birmingham(伯明翰大学) POSTECH(浦项科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。

Comments accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28863 2026-04-14 astro-ph.GA astro-ph.HE 50%

Something Bright at the Edge of Everything: A Uniquely JWST-Dark Radio Source in COSMOS

万物边缘的亮光:COSMOS中一个独特的JWST暗无线电源

Mingyu Li

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过交叉匹配COSMOS区域的无线电和JWST源目录,发现一个唯一未被JWST检测到但被低频射电望远镜检测到的无线电源,揭示了深空射电调查与JWST成像结合的新发现领域。

Comments RNAAS; 3 pages, 1 figure

Journal ref Res. Notes AAS 10 83 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10782 2026-04-14 astro-ph.IM astro-ph.GA 50%

Inferring Unreported Measurement Uncertainties via Information Geometry in Astrophysics

通过信息几何推断未报告的测量不确定性

Marko Imbrišak, Krešimir Tisanić

专题命中 VLA模型 :VLA(abstract)

AI总结 本文提出FIMER框架,通过信息几何方法从异质天文数据中重建有效的测量不确定性,以提高统计推断的可靠性。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏