arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-17 至 2026-08-17 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 14 篇

2608.13924 2026-08-17 cs.RO 新提交 92%

BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control

BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化

Ming Shang, Yuchen Huang, Jiaoyang Chen, Haoyuan Hu, Han Yu, Liping Song, Luyun Feng, Shuo Bao, Wei Dong, Xinzhou Wang, Fuchun Sun

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO

AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 91%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01035 2026-08-17 cs.RO cs.AI cs.CV 版本更新 91%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09430 2026-08-17 cs.RO cs.AI 版本更新 91%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 91%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14024 2026-08-17 cs.CV 新提交 91%

SSP: An Event-Matched Syn2Sim2Phy Cross-Domain Evaluation Framework for Autonomous Driving VLA Models

SSP:面向自动驾驶VLA模型的事件匹配Syn2Sim2Phy跨域评估框架

Haojie Feng, Peizhi Zhang, Xinrui Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Dongxiao Yin, Yuxiang Zhang, Junfan Zhu, Lu Xiong

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) Tongji Automotive Design & Research Institute Co., Ltd.(同济汽车设计研究院有限公司) Hubei Jingchu Humanoid Robot Co., Ltd.(湖北荆楚人形机器人有限公司) University of Chicago(芝加哥大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出SSP框架,通过锚定同一安全关键交互事件实现自动驾驶VLA模型的跨域评估,在合成、仿真、真实域中测得不同模型的性能差异,为VLA行为提供可复现的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-17 cs.CV cs.AI cs.LG 版本更新 88%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03682 2026-08-17 cs.AI cs.RO 版本更新 82%

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

PhyAI:边缘端实时物理人工智能,云端可扩展部署

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Junbo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Ruixin Liu, Shangguang Wang, Tam Sikyuen, Tianyue Zhang, Weikai Xie, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Yuxin Zheng, Ziqi Guo

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对物理AI多部署场景推理程序不统一的问题,提出PhyAI推理引擎,实现多模型跨端部署,在多个基准上取得1.40-4.65倍加速,还引入控制时间屋顶线分析模型特性。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 79%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22022 2026-08-17 math.NA 版本更新 71%

A High-Accuracy Symplectic Scheme for a nonlinear transport problem

非线性输运问题的高精度辛格式

Farjana Siddiqua, Catalin Trenchea

专题命中 VLA模型 :action model(title)

AI总结 针对可建模色谱法的非齐次边界条件平流-扩散-反应问题,采用辛单步隐式中点法和有限元法,完成稳定性、误差分析及全离散解存在性证明,数值测试验证了理论结果。

Comments 33 pages, 5 Figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13688 2026-08-17 cond-mat.mtrl-sci physics.app-ph 新提交 50%

Thickness-dependent secondary-electron emission from suspended MoS$_2$ membranes in the helium ion microscope

氦离子显微镜中悬浮MoS₂膜的厚度依赖二次电子发射

Cyan Kim, David Lister, Philip Jackle, Karen L. Kavanagh

专题命中 VLA模型 :action model(abstract)

AI总结 研究发现氦离子显微镜中悬浮MoS₂膜的二次电子发射强度随厚度变化,在40-55 nm达峰值,通过非对称SE逃逸模型复现结果,可用于快速筛选膜厚及测试离子-固体相互作用模型。

Comments 6 pages, 3 figures. Submitted to Applied Physics Letters. Supplementary material included as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05246 2026-08-17 astro-ph.HE astro-ph.GA hep-ph 版本更新 50%

The emergence of X-ray emission lines during relativistic radio-jet formation in the changing-look active galactic nucleus 1ES 1927+654

在可变视类活动星系核1ES 1927+654相对论性射电喷流形成期间X射线发射线的出现

Dev R. Sadaula, Sibasish Laha, Eileen T. Meyer, Onic I. Shuvo, Main Pal, Ritesh Ghosh, Matteo Guainazzi, Fabio Pacucci, Stefano Bianchi, Luigi Gallo, Rostom Mbarek, Amelia M. Hankla, Fabio La Franca, Tahir Yaqoob, Megan Masterson, Erin Kara, Missagh Mehdipour, Claudio Ricci, Javier A Garcia, Timothy R. Kallman, Ralf Ballhausen, Mitchell C. Begelman, Alexander Philippov, Suvendu Rakshit, Francesca Panessa, Ehud Behar, S. Bradley Cenko, Federica Ricci, Ilaria Villani, James N. Reeves

专题命中 VLA模型 :VLA(abstract)

AI总结 对1ES 1927+654进行多波段监测,用多台设备观测其光谱演化。发现喷流形成时出现软X射线发射线,还检测到Fe K发射特征,揭示电离吸收体变化及吸积和外流过程转变,表明喷流形成时相关区域稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00802 2026-08-17 cond-mat.mtrl-sci 版本更新 50%

Determination of Density Functional Tight Binding Models for Cerium-containing Materials

铈同素异形体的密度泛函紧束缚模型确定

Nir Goldman, Artem Samtsevych, Chiara Panosetti

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于密度泛函紧束缚方法的铈模型,通过优化电子限制势能准确预测电子能带结构和不同同素异形体的能量顺序,展示了DFTB在复现复杂f电子相互作用方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏