arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-29 至 2026-06-29 共收录 18 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2606.27872 2026-06-29 cs.RO cs.AI 新提交 94%

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27755 2026-06-29 cs.RO cs.AI 新提交 91%

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

丢弃-再恢复:视觉-语言-动作模型有多冗余?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Cisco Research(思科研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 91%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21970 2026-06-29 cs.RO 版本更新 91%

StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

StereoVLA:利用立体视觉增强视觉-语言-动作模型

Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang

机构 * Galbot CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The University of Hong Kong(香港大学) Xiamen University Malaysia(厦门大学马来西亚分校) Southern University of Science and Technology(南方科技大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 90%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);embodied foundation model(abstract)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05233 2026-06-29 cs.RO 版本更新 86%

MobileManiBench: Simplifying Model Verification for Mobile Manipulation

MobileManiBench:简化移动操作模型验证

Wenbo Wang, Fangyun Wei, QiXiu Li, Xi Chen, Yaobo Liang, Chang Xu, Jiaolong Yang, Baining Guo

机构 * Microsoft Research Asia(微软亚洲研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 84%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27295 2026-06-29 cs.RO 新提交 84%

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

LA4VLA:通过语言-动作预训练实现无视觉行动学习

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) KAUST(阿卜杜拉国王科技大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。

Comments Github: https://github.com/MINT-SJTU/LA4VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27414 2026-06-29 astro-ph.IM astro-ph.CO 新提交 80%

The Karl G. Jansky Very Large Array Sky Survey (VLASS). Data Products

卡尔·G·扬斯基甚大阵列巡天(VLASS)数据产品

Amy Kimball, Mark Lacy, Juergen Ott, John Tobin, Tierra Candelaria, Sergio Garza, Drew Medlin, Steven T. Myers

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 VLASS是VLA对全天(dec>-40°)进行的2-4 GHz无线电连续谱巡天,分辨率约2.5角秒,全偏振。数据处理和质控面临计算和人力限制,采用创新方法:快速成像、GPU和HTC处理w项、机器学习自动识别伪影,并解决存档分发挑战。

Comments Submitted to the SPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 79%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27808 2026-06-29 cs.CL 新提交 78%

Learning Complementary Action Modeling from Automotive Maintenance Instructions

从汽车维修说明中学习互补动作建模

Jiaqi Wu, Bai Li, Jochen Hartmann, Martin Gaedke, Sander Stuijk

机构 * Eindhoven University of Technology(埃因霍温理工大学) BMW Group(宝马集团) Chemnitz University of Technology(开姆尼茨工业大学)

专题命中 VLA模型 :action model(title,abstract)

AI总结 针对汽车维修说明中动作短语决定程序关系的问题,提出互补动作建模任务,通过候选匹配和受控序列生成方法识别或生成程序性对应指令。

Comments Preprint. 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28133 2026-06-29 cs.RO cs.CV 新提交 73%

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

翻译作为桥接动作:将操作技能从人类迁移到机器人

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

机构 * HKU-MMLab(香港大学多媒体实验室) ByteDance Seed(字节跳动Seed)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。

Comments Project Page: https://translation-as-a-bridging-action.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 70%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28098 2026-06-29 nucl-ex hep-ex 新提交 50%

Multiplicity dependence of the size of the common hadron emission source in pp collisions at the LHC

LHC中pp碰撞中强子发射源尺寸的多重数依赖性

ALICE Collaboration

专题命中 VLA模型 :action model(abstract)

AI总结 利用ALICE探测器在13.6 TeV pp碰撞中测量质子-质子关联,首次同时研究源尺寸对多重数和横质量的依赖性,发现与Pb-Pb碰撞不同的多重数依赖性,揭示系统尺寸对粒子发射动力学的影响。

Comments 48 pages, 22 captioned figures, 3 tables, authors from page 43, submitted to EPJC, figures at http://alice-publications.web.cern.ch/node/13402

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28288 2026-06-29 gr-qc astro-ph.CO hep-th 新提交 50%

Generalizing the interacting dilatonic ghost condensate as a dark energy model

推广相互作用的膨胀鬼凝聚作为暗能量模型

Manuel Gonzalez-Espinoza, Ramon Herrera, Johan Casimiro

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究广义膨胀鬼凝聚场作为暗能量候选者的宇宙演化,通过相空间分析和联合似然分析,发现系统演化到暗能量主导吸引子,且能量流动方向依赖于相互作用形式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2606.27567 2026-06-29 cs.CR cs.AI cs.LG 新提交 62%

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

论共享嵌入序列模型中指令与数据的不可分离性

Dewank Pant, Shruti Lohani, Avijit Kumar

机构 * Independent Researcher(独立研究员)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。

Comments 18 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2606.18610 2026-06-29 cs.RO cs.CV 新提交 81%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 机器人基础模型 :robot foundation model(title);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 数据集与评测 1 篇

2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏