arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-03 至 2026-04-03 共收录 10 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2604.01618 2026-04-03 cs.CV cs.AI 88%

Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models

Tex3D: 通过对抗性3D纹理将物体作为攻击面用于视觉-语言-动作模型

Jiawei Chen, Simin Huang, Jiawei Du, Shuaihang Chen, Yu Tian, Mingjie Wei, Chao Yu, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) CFAR, A*STAR, Singapore(新加坡科技研究局CFAR) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Tex3D框架,通过对抗性3D纹理攻击视觉-语言-动作模型,揭示其在物理环境中面临的关键漏洞,展示了在仿真和真实机器人任务中显著降低模型性能的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 87%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01723 2026-04-03 cs.RO cs.AI 84%

Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving

基于运行时安全监督的因果场景叙述用于视觉-语言-动作驾驶

Yun Li, Yidu Zhang, Simon Thompson, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) TIER IV, Inc.(TIER IV 公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSN方法,通过意图约束对齐、定量 grounding 和结构分离重构VLA文本输入,提升驾驶评分并增强安全性。

Comments 18 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO 79%

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02190 2026-04-03 cs.CV cs.RO 79%

UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

UniDriveVLA: 联合理解、感知与行动规划以实现自动驾驶

Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) SKL-IOTSC, University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 UniDriveVLA通过专家解耦和三阶段训练策略,解决自动驾驶中感知与推理的冲突,实现空间感知与语义推理的统一,取得nuScenes和Bench2Drive的优异性能。

Comments code has been released at https://github.com/xiaomi-research/unidrivevla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 75%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01567 2026-04-03 cs.RO 70%

AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation

AnchorVLA:基于锚定扩散的高效端到端移动操作

Jia Syuen Lim, Zhizhen Zhang, Peter Bohm, Brendan Tidd, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Robotics and Autonomous Systems Group, CSIRO(CSIRO机器人与自主系统组)

专题命中 VLA模型 :VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出AnchorVLA,一种基于扩散的VLA策略,通过锚定扩散头在局部去噪以保留多模态动作生成,减少推理成本并提高移动操作的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22855 2026-04-03 cs.LG 57%

A Review of Neural Networks in Precipitation Prediction

神经网络在降水预测中的应用综述

Yugong Zeng, Jiayuan Wang, Jonathan Wu

机构 * University of Windsor(温莎大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文综述了传统降水预报方法及神经网络在降水预测中的发展,分析了各种模型的优缺点,并探讨了未来多源数据融合和混合物理-数据驱动模型的应用前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01773 2026-04-03 quant-ph 50%

Distribution of Bell State Entanglement in Qubit Networks via Collision Models

量子比特网络中贝尔态纠缠分布的碰撞模型研究

Mert Doğan, Öner Faruk Ödemiş, Elif Yunt, Özgür E. Müstecaplıoğlu

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出利用碰撞模型在量子比特网络中可控分布纠缠,通过环境辅助量子比特与网络节点的可调哈密顿交互,实现不同量子比特对的纠缠生成,包括非相邻节点。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03172 2026-04-03 physics.optics 50%

Physical Optics Model to Evaluate Mid-Spatial Frequency Errors on the Point Spread Function

物理光学模型用于评估点扩散函数中的中空间频率误差

Luuk Zonneveld, Paul Urbach, Aurèle Adam

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过物理光学模型评估中空间频率误差对点扩散函数的影响,对比了理论计算与实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏