arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-08 至 2026-07-08 共收录 17 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2607.06564 2026-07-08 cs.RO cs.CV 新提交 92%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新 91%

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交 91%

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 90%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 89%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23128 2026-07-08 cs.RO 版本更新 85%

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

$\pi_0$-EqM:闭环视觉-语言-动作控制的均衡匹配

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出$\pi_0$-EqM,用均衡匹配解码器替换$\pi_0$中的流匹配专家,在固定预算下提升机器人操作成功率,并发现残差与成功率之间的非单调关系。

Comments Preprint. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 84%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(abstract);分类 cs.RO

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05468 2026-07-08 cs.RO cs.AI 新提交 81%

Learning 4D Geometric Priors for Inference-Efficient World Action Models

学习用于高效推理世界行动模型的4D几何先验

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

机构 * Midea AI Research Centers(美的人工智能研究中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在捕捉操作所需几何信息不足的问题,提出MECo-WAM模型,通过注入4D几何先验、采用多专家协同训练等方法,在不增加推理成本的情况下提升了机器人操作性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 81%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05950 2026-07-08 astro-ph.HE 新提交 80%

Unveiling the Local Environment of FRB 20220912A: Sub-arcsecond $4-26$ GHz Radio Continuum Mapping

揭示快速射电暴20220912A的本地环境:亚角秒级4 - 26 GHz射电连续谱测绘

Yash Bhusare, Yogesh Maan, Mohit Bhardwaj, Thomas C. Abbott, Yuxin Dong, Danté M. Hewitt, Afrokk Khan

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究利用VLA对FRB 20220912A进行高分辨率多频率连续谱研究,发现未知射电源,确定其位置、直径等特征,具有特定谱指数和恒星形成率表面密度,为重复FRB起源于年轻磁星的假设提供观测支持。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05500 2026-07-08 astro-ph.HE astro-ph.SR 新提交 80%

Radio and X-ray Observations of the Transitional Supernova 2019yvr: Insights into the Progenitor Mass-Loss History

过渡型超新星2019yvr的射电和X射线观测:对前身星质量损失历史的洞察

Raphael Baer-way, Poonam Chandra, Maryam Modjaz, A. J. Nayana, Keiichi Maeda, Katie Auchettl, Maria R. Drout, Charles D. Kilpatrick, Alak K. Ray, Stuart D. Ryder

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究超新星2019yvr前身星质量损失历史,通过射电(GMRT + VLA)和X射线(Swift + Chandra)观测,结合同步加速器自吸收模型等方法,得出质量损失率下降等结果,排除相关CSM密度跃升,为理解前身星提供新认识。

Comments 19 pages,9 Figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20342 2026-07-08 cs.HC cs.AI cs.CY 版本更新 57%

Narrative-Centered Emotional Reflection: An Early Prototype for AI-Supported Emotional Self-Reflection

以叙事为中心的情感反思:人工智能支持的情感自我反思的早期原型

Shou-Tzu Han

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 该研究以Reflexion为早期原型,通过整合情感检测、分层反思提示和隐喻故事生成等方法,探索结构化情感自我反思,支持用户超越基本情感分类进行自主情感探索,记录了理论驱动的情感计算方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06525 2026-07-08 cs.CR 新提交 50%

Crossroads: A Smart Contract Layer for Chain-Abstracted Assets

十字路口:用于链抽象资产的智能合约层

James Austgen, Dani Vilardell, Ari Juels

专题命中 VLA模型 :action model(abstract)

AI总结 研究提出用于链抽象资产的智能合约层Crossroads,依赖密钥抵押实现资产跨链等功能,有高效资产转移、强最终性保证等优势,经概念验证证明其稳健性,可支持多种应用。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05803 2026-07-08 cs.IR 新提交 50%

Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models

量化和扩展后期交互检索模型的理论容量

Julian Killingback, Varad Ingale, Hamed Zamani, Cameron Musco

专题命中 VLA模型 :action model(abstract)

AI总结 研究量化和扩展后期交互检索模型理论容量,证明MaxSim相似性可复制特定向量内积,引入Signed MaxSim,揭示其能表达标准内积无法表达的相似性,还可作逻辑表达式评估器,实验验证了其提升域外性能的作用。

Comments 21 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19042 2026-07-08 astro-ph.HE 50%

Arcsecond-Scale X-ray Imaging and Spectroscopy of SS 433 with Chandra HETG

秒级尺度的X射线成像与能谱分析:利用Chandra HETG观测SS 433

Yusuke Sakai, Shinya Yamada, Haruka Sakemi, Mami Machida, Taichi Igarashi, Ryota Hayakawa, Miho Tan, Taisei Furuyama

专题命中 VLA模型 :VLA(abstract)

AI总结 利用Chandra HETG观测,研究SS 433亚弧秒尺度X射线结构,揭示喷流特征与非热过程相关。

Comments Accepted for publication in PASJ. The paper is 13 pages long with 11 figures

Journal ref Publ. Astron. Soc. Jpn. 77, 1113 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 1 篇

2607.06501 2026-07-08 cs.RO 新提交 57%

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

不确定性下用于开放世界机器人规划的假设驱动模型扩展

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所)

专题命中 机器人基础模型 :robot foundation model(abstract);分类 cs.RO

AI总结 针对开放世界机器人规划中传统方法失效的问题,提出假设驱动模型扩展框架,利用基础模型生成假设,结合自动规划与验证反馈进行迭代优化,实现自主知识扩展,推动家用服务机器人实际部署。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2607.06036 2026-07-08 cs.IR 新提交 50%

Learn to Pool: Lightweight Fine-Tuning for Flexible Multi-Vector Compression

学习池化:用于灵活多向量压缩的轻量级微调

Stefan Josef

专题命中 部署与泛化 :action model(abstract)

AI总结 研究后期交互模型部署挑战,提出轻量级微调方法,通过k均值等进行池化感知训练,可跨方法和数据集迁移,多因素训练产生通用模型,最强模型在BEIR SciFact上以83%压缩率且不损精度超越基线。

Comments The 1st Late Interaction Workshop (LIR) @ ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏