arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-22 至 2026-07-22 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2605.13632 2026-07-22 cs.RO cs.CV 版本更新 91%

Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理

Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang, Xiaoke Jiang, Chuanxiu Liu, Jie Liu, Lei Zhang

机构 * Futian Laboratory(福田实验室) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) School of Robotics, Hunan University(湖南大学机器人学院) South China University of Technology(华南理工大学) Visincept(Visincept公司) National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出GTA-VLA框架,通过允许用户用显式视觉提示引导机器人策略,实现空间可调节的具身推理。该框架整合了外部指导与内部任务规划,提升了在视觉歧义和错误恢复中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17787 2026-07-22 cs.RO cs.AI 版本更新 91%

AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models

AnchorRefine:基于轨迹锚点和残差细化的轨迹-锚点与残差细化的视觉-语言-动作模型

Tingzheng Jia, Kan Guo, Lanping Qian, Yongli Hu, Daxin Tian, Guixian Qu, Chunmian Lin, Baocai Yin, Jiapu Wang

机构 * Beijing University of Technology(北京理工大学) Beihang University(北航) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出AnchorRefine框架,通过分解视觉-语言-动作动作建模为轨迹锚点和残差细化,提升几何和接触精度,实验表明在模拟和现实任务中均取得显著提升。

Comments The authors have decided to withdraw this manuscript because the work requires substantial revision and further experimental validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14852 2026-07-22 cs.RO 版本更新 85%

Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation

迈向类人物理智能:用于机器人操作的终身视觉-语言-动作学习

Yao He, Gan Sun, Wenqi Liang, Fazeng Li, Yang Cong

机构 * South China University of Technology(华南理工大学) University of Trento(特伦托大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对机器人操作中可塑性-稳定性权衡难题,提出缓存高效的终身视觉-语言-动作学习框架LifelongVLA。通过双时间尺度LoRA门控模块及缓存高效随机重放策略,有效缓解权衡问题,实现技能扩展、行为保留,减少再训练依赖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18580 2026-07-22 cs.RO 新提交 81%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17049 2026-07-22 cs.SE cs.RO 版本更新 77%

Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots

评估具有视觉语言动作能力的机器人的不确定性和质量

Pablo Valle, Chengjie Lu, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25746 2026-07-22 cs.RO 版本更新 70%

TacRefineNet: Goal-Conditioned Tactile Grasp Refinement for Edge-Prominent Objects

TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化

Shuaijun Wang, Haoran Zhou, Diyun Xiang, Yangwei You

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18440 2026-07-22 astro-ph.GA 新提交 67%

Vz-GAL Dusty Star-Forming Galaxies: Revisiting the CO-H2 Conversion Factor Tension

Vz-GAL尘埃星形成星系:重新审视CO-H2转换因子的张力

Prachi Prajapati, Axel Weiss, Dominik Riechers, Tom J. L. C. Bakx, Leindert A. Boogaard, Diana Ismail, Pierre Cox, Andrew J. Baker, Roberto Neri, Matthew Lehnert, Chentao Yang, Emilio Romano-Diaz, Hiddo S. B. Algera, Stefano Berta, Edoardo Borsato, Kirsty M. Butler, Asantha Cooray, Bethany Jones, Amelie Saintonge, Paul van der Werf

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究高红移尘埃星形成星系中CO-H2转换因子的“张力”,通过对21个星系样本用多种方法推导分子气体质量,发现当前数据不支持αCO = 0.8,中间到接近银河系的值可行,校准需解析分子气体观测、物理建模和对尘埃性质的约束。

Comments Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2607.18840 2026-07-22 cs.RO 新提交 79%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏