arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-08 至 2026-07-08 共收录 12 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2607.06564 2026-07-08 cs.RO cs.CV 新提交 92%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交 91%

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 90%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 84%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(abstract);分类 cs.RO

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05468 2026-07-08 cs.RO cs.AI 新提交 81%

Learning 4D Geometric Priors for Inference-Efficient World Action Models

学习用于高效推理世界行动模型的4D几何先验

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

机构 * Midea AI Research Centers(美的人工智能研究中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在捕捉操作所需几何信息不足的问题,提出MECo-WAM模型,通过注入4D几何先验、采用多专家协同训练等方法,在不增加推理成本的情况下提升了机器人操作性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 81%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05950 2026-07-08 astro-ph.HE 新提交 80%

Unveiling the Local Environment of FRB 20220912A: Sub-arcsecond $4-26$ GHz Radio Continuum Mapping

揭示快速射电暴20220912A的本地环境:亚角秒级4 - 26 GHz射电连续谱测绘

Yash Bhusare, Yogesh Maan, Mohit Bhardwaj, Thomas C. Abbott, Yuxin Dong, Danté M. Hewitt, Afrokk Khan

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究利用VLA对FRB 20220912A进行高分辨率多频率连续谱研究,发现未知射电源,确定其位置、直径等特征,具有特定谱指数和恒星形成率表面密度,为重复FRB起源于年轻磁星的假设提供观测支持。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05500 2026-07-08 astro-ph.HE astro-ph.SR 新提交 80%

Radio and X-ray Observations of the Transitional Supernova 2019yvr: Insights into the Progenitor Mass-Loss History

过渡型超新星2019yvr的射电和X射线观测:对前身星质量损失历史的洞察

Raphael Baer-way, Poonam Chandra, Maryam Modjaz, A. J. Nayana, Keiichi Maeda, Katie Auchettl, Maria R. Drout, Charles D. Kilpatrick, Alak K. Ray, Stuart D. Ryder

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究超新星2019yvr前身星质量损失历史,通过射电(GMRT + VLA)和X射线(Swift + Chandra)观测,结合同步加速器自吸收模型等方法,得出质量损失率下降等结果,排除相关CSM密度跃升,为理解前身星提供新认识。

Comments 19 pages,9 Figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06525 2026-07-08 cs.CR 新提交 50%

Crossroads: A Smart Contract Layer for Chain-Abstracted Assets

十字路口:用于链抽象资产的智能合约层

James Austgen, Dani Vilardell, Ari Juels

专题命中 VLA模型 :action model(abstract)

AI总结 研究提出用于链抽象资产的智能合约层Crossroads,依赖密钥抵押实现资产跨链等功能,有高效资产转移、强最终性保证等优势,经概念验证证明其稳健性,可支持多种应用。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05803 2026-07-08 cs.IR 新提交 50%

Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models

量化和扩展后期交互检索模型的理论容量

Julian Killingback, Varad Ingale, Hamed Zamani, Cameron Musco

专题命中 VLA模型 :action model(abstract)

AI总结 研究量化和扩展后期交互检索模型理论容量,证明MaxSim相似性可复制特定向量内积,引入Signed MaxSim,揭示其能表达标准内积无法表达的相似性,还可作逻辑表达式评估器,实验验证了其提升域外性能的作用。

Comments 21 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 1 篇

2607.06501 2026-07-08 cs.RO 新提交 57%

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

不确定性下用于开放世界机器人规划的假设驱动模型扩展

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所)

专题命中 机器人基础模型 :robot foundation model(abstract);分类 cs.RO

AI总结 针对开放世界机器人规划中传统方法失效的问题,提出假设驱动模型扩展框架,利用基础模型生成假设,结合自动规划与验证反馈进行迭代优化,实现自主知识扩展,推动家用服务机器人实际部署。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2607.06036 2026-07-08 cs.IR 新提交 50%

Learn to Pool: Lightweight Fine-Tuning for Flexible Multi-Vector Compression

学习池化:用于灵活多向量压缩的轻量级微调

Stefan Josef

专题命中 部署与泛化 :action model(abstract)

AI总结 研究后期交互模型部署挑战,提出轻量级微调方法,通过k均值等进行池化感知训练,可跨方法和数据集迁移,多因素训练产生通用模型,最强模型在BEIR SciFact上以83%压缩率且不损精度超越基线。

Comments The 1st Late Interaction Workshop (LIR) @ ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏