arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-22 至 2026-04-22 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2604.19728 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.SE 94%

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

VLA Foundry:一种统一训练视觉-语言-动作模型的框架

Jean Mercat, Sedrick Keh, Kushal Arora, Isabella Huang, Paarth Shah, Haruki Nishimura, Shun Iwase, Katherine Liu

机构 * Toyota Research Institute(丰田研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。

Comments 32 pages, 16 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19710 2026-04-22 cs.CV 89%

SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习

Zewei Zhou, Ruining Yang, Xuewei, Qi, Yiluan Guo, Sherry X. Chen, Tao Feng, Kateryna Pistunova, Yishan Shen, Lili Su, Jiaqi Ma

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) Motional, USA(Motional公司) Northeastern University, USA(东北大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。

Comments Project page: https://spanvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18791 2026-04-22 cs.LG cs.AI 86%

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19886 2026-04-22 math.AP 78%

Global strong solutions to a compressible fluid-particle interaction model with density-dependent friction force

压缩流体-粒子相互作用模型的全局强解

Fucai Li, Jinkai Ni, Man Wu

专题命中 VLA模型 :action model(title,abstract)

AI总结 本文研究了压缩流体-粒子相互作用模型的初值问题,通过假设初始数据的H²范数足够小,建立了强解的全局存在性,并在初始数据L¹范数有界时获得了强解及其梯度在L²范数下的最优衰减率。

Comments 39pages, some minor typos corrected

Journal ref Bull. Sci. Math. 211 (2026) 103833

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03037 2026-04-22 cs.RO cs.AI cs.CV 75%

ARM: Advantage Reward Modeling for Long-Horizon Manipulation

ARM:用于长 horizon 操控的优势奖励建模

Yiming Mao, Zixi Yu, Weixin Mao, Yinhao Li, Qirui Hu, Zihan Lan, Minzhao Zhu, Hua Chen

机构 * LimX Dynamics(LimX动力学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出ARM框架,通过三态标签策略提升长 horizon 操控任务的奖励建模,实现高效稳定的数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19730 2026-04-22 cs.LG cs.AI 73%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19435 2026-04-22 astro-ph.HE astro-ph.GA 67%

SDSSJ110546.07+145202.4: The first long-duration radio changing-look NLS1 galaxy

SDSSJ110546.07+145202.4:首个持续时间长的无线电变光窄线型I型赛弗特星系

S. Komossa, D. Grupe, A. Kraus, P. G. Edwards, E. F. Kerrison, K. Rose, R. Soria, T. An, M. J. Hardcastle, K. E. Gabanyi, S. Panda, D. W. Xu, J. Wang, S. Frey, A. Mezosi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究首次发现一个持续时间长的无线电变光窄线型I型赛弗特星系,通过多波段观测揭示其无线电爆发特征及可能的成因。

Comments 20 pages, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03716 2026-04-22 astro-ph.HE 67%

The broad-lined type Ic supernova 2020lao experienced an energetic explosion with no central-engine signatures

Ia型超新星2020lao的宽线类型Ic经历了具有无核心引擎特征的高能爆炸

M. D. Stritzinger, T. J. Moriya, S. Bose, P. A. Mazzali, P. Lundqvist, E. Karamehmetoglu, L. S. Arndt, C. Ashall, L. Galbany, W. B. Hoogendam, E. Baron, J. M. DerKacy, N. Elias-Rosa, E. Y. Hsiao, P. Höflich, E. Pian, E. A. M. Jensen, S. Moran, A. Pastorello, M. Shahbandeh, G. Valerin

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究通过光学光谱观测SN Ic-BL 2020lao的婴儿期,发现其光变曲线无光学后发光或超额辐射,排除了扩展包层,推断其核心动能与非相对论性SN Ic-BL相似。

Comments 14 pages, 10 figures, several tables. Revised version. Referee comments addressed. Abridged abstract

Journal ref A&A 708, A305 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18950 2026-04-22 astro-ph.GA 67%

Very Long Baseline Interferometry Search for Nuclear Radio Continuum Emission in the Barred Spiral Galaxy NGC 7479

长基线干涉测量法搜索 barred 螺旋星系 NGC 7479 中的核辐射连续发射

Seppo Laine, Emmanuel Momjian, Emilia Järvelä, Thomas P. Krichbaum, S. Komossa, Travis C. Fischer, Thomas G. Pannuti

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用VLBA和EVN对NGC 7479核区进行高角分辨率射电连续成像,发现两个分离的射电发射区,揭示可能的相对论性射流或核风影响。

Comments 20 pages, 6 figures, 2 tables. Accepted for publication in AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08475 2026-04-22 cs.CV 57%

LAMP: Lift Image-Editing as General 3D Priors for Open-world Manipulation

LAMP:将图像编辑提升为通用3D先验以实现开放世界操控

Jingjing Wang, Zhengdong Hong, Chong Bao, Yuke Zhu, Junhan Sun, Guofeng Zhang

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV

AI总结 LAMP通过将图像编辑作为3D先验,提取物体间连续的几何表示,提升开放世界操控的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19566 2026-04-22 cs.IR cs.CL 50%

Diagnosable ColBERT: Debugging Late-Interaction Retrieval Models Using a Learned Latent Space as Reference

可诊断的ColBERT:利用学习的潜在空间作为参考来调试后期交互检索模型

François Remy

机构 * Parallia AI

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出Diagnosable ColBERT,通过将ColBERT的词嵌入对齐到基于临床知识的参考潜在空间,以更直接地诊断模型错误并指导数据整理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28867 2026-04-22 astro-ph.EP astro-ph.SR 50%

Large Dust Grains and a Possible Dust Trap in the Polar Circumbinary Disc of HD 98800B

大尘埃颗粒和HD 98800B极地双星盘中可能的尘埃陷阱

Álvaro Ribas, Thomas Lack, Francesco Zagaria, Enrique Macías, Sean M. Andrews, Amelia Bayo, Cathie J. Clarke, Nicolás Cuello, Catherine C. Espaillat

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过VLBA观测发现HD 98800B极地双星盘存在大尘埃颗粒,其尘埃谱指数低于3,可能由尘埃颗粒和磁辐射机制共同作用,同时发现尘埃不规则分布可能由涡旋或历史轨道效应引起。

Comments 11 pages, 5 figures, 3 tables. Accepted for publication in MNRAS

Journal ref Mon Not R Astron Soc (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2604.19734 2026-04-22 cs.RO cs.AI 62%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 57%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏