arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-23 至 2026-07-23 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 2 篇

2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 62%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏