arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-23 至 2026-07-23 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2607.20345 2026-07-23 cs.RO cs.AI 新提交 91%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 90%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20175 2026-07-23 cs.CV 新提交 79%

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20061 2026-07-23 cs.RO 新提交 77%

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack:用于具身视觉跟踪的先指认后跟踪

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构 * SUSTech(南方科技大学) Tencent Robotics X(腾讯机器人X实验室) Peking University(北京大学) Futian Laboratory(福田实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 73%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19906 2026-07-23 cs.LO cs.MA 新提交 50%

The Dynamic Turn in Paraconsistency

弗协调逻辑中的动态转向

Rafael Ongaratto, Hans van Ditmarsch

专题命中 VLA模型 :action model(abstract)

AI总结 该研究提出弗协调逻辑的动态转向,引入AMLFI1及其特殊情况PALFI1,还有带事实变化的UMLFI1,证明了这些逻辑的可靠性和完全性,它们扩展了已知认知弗协调逻辑,可形式化临时矛盾的获取与解决。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 62%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏