arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-26 至 2026-05-26 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 2 篇

2602.16229 2026-05-26 cs.LG 57%

Factored Latent Action World Models

因子化潜在动作世界模型

Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 动作表示与策略 :action model(abstract);分类 cs.LG

AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25058 2026-05-26 cs.HC cs.AI 57%

Intent Signal Theory: A Computational Framework for Intent-State Control in Human-AI Interaction

意图信号理论:人机交互中意图状态控制的计算框架

Gang Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州莱尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 提出意图信号理论(IST),通过区分潜在源意图、可观测意图代理、编码载体和模型输出四个对象,形式化意图丢失定理,并基于六种大语言模型、三种语言和三个任务领域的实验验证了结构-保真度分裂等预测,将提示工程重新定义为意图协议设计。

Comments 10 pages, 2 figures. Theoretical framework paper grounded in four companion empirical studies. Data and code repository: https://github.com/PGlarry/prompt-protocol-specification

详情

展开后加载摘要…

URL PDF HTML 收藏