arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-19 至 2026-08-19 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 3 篇

2608.17095 2026-08-19 cs.CV 新提交 70%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 机器人基础模型 :world model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 62%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17600 2026-08-19 cs.RO 新提交 57%

LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models

LIBERO-VIFO:评估视觉-语言-动作模型视觉线索跟随的能力与安全性的基准

Zhengyan Qian, Rui Yan, Alex Jinpeng Wang, Jinhui Tang

专题命中 机器人基础模型 :robot learning(abstract);分类 cs.RO

AI总结 研究人员提出LIBERO-VIFO基准,评估7种VLA模型的视觉线索跟随能力与安全性,发现当前VLA存在无语言指令时执行线索指示任务的未授权跟随风险,确立了以视觉为中心的安全新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏