STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models
STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑
机构 * University of Maryland(马里兰大学)
专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract,abstract_cn)
AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。
Comments 14 pages, 6 figures