arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-28 至 2026-07-28 共收录 20 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 16 篇

2603.05147 2026-07-28 cs.CV cs.RO 版本更新 90%

Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models

行动、思考或退缩:面向视觉-语言-动作模型的复杂度感知自适应推理

Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出一种复杂度感知的自适应推理框架,通过动态路由视觉-语言-动作模型的执行,提升任务复杂性检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24148 2026-07-28 cs.AI 新提交 89%

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架

Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI

AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18016 2026-07-28 cs.RO 版本更新 89%

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

人形机器人视觉语言动作闭环:用于可验证移动操作的持久3D对象令牌

Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

机构 * BUAA(北京航空航天大学) DeepCybo(深灵机器人) ZGCI(未提及具体中文译名)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究人形机器人视觉语言动作中对象状态差异问题,提出持久对象令牌化方法(POT)并实例化为POT-VLA,通过RGB-D观察维护3D对象记录,转换为对象令牌用于动作生成与验证,实验表明该方法提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20771 2026-07-28 cs.RO cs.AI cs.LG 版本更新 88%

Emergent Compositional Skills in Mixture-of-Experts VLAs

混合专家VLA中的涌现组合技能

Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali, Dhruv Shah

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究从专家演示端到端学习组合机器人策略的问题,用简化MoE动作头训练VLA,发现其能将任务分解,学习到的专家可跨任务重用,MoE在展示专家专业化时与整体基线性能匹配,向模块化、可解释机器人策略迈进。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22997 2026-07-28 cs.RO cs.AI cs.GR cs.LG 新提交 87%

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

用于视觉-语言-动作操纵的Real2Sim2Real:基于AMD ROCm的管道

Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

机构 * AMD AIG Team(AMD人工智能团队) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文针对视觉-语言-动作操纵提出基于AMD ROCm的Real2Sim2Real技术栈,涵盖多硬件计算,由开放软件栈统一。通过四个演示表明无需CUDA锁定生态系统,展示了在多硬件平台上的相关成果,且管道可在特定硬件和平台上原生运行并重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 84%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01031 2026-07-28 cs.RO cs.AI cs.LG 版本更新 80%

VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH: 通过未来状态感知的异步推断实现实时VLAs

Jiaming Tang, Yufei Sun, Yilong Zhao, Shang Yang, Yujun Lin, Zhuoyang Zhang, James Hou, Yao Lu, Zhijian Liu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Caltech(加州理工学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23783 2026-07-28 cs.RO 新提交 79%

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24125 2026-07-28 cs.RO cs.AI 版本更新 79%

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training

通过自回归离散预训练实现机器人动作的统一具身VLM推理

Yi Liu, Sukai Wang, Dafeng Wei, Xiaowei Cai, Linqing Zhong, Jiange Yang, Guanghui Ren, Jinyu Zhang, Maoqing Yao, Chuankang Li, Xindong He, Liliang Chen, Jianlan Luo

机构 * AgiBot Research(AgiBot研究机构) AgiBot(AgiBot公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22966 2026-07-28 astro-ph.GA 新提交 67%

A quasar hatching from a buried red phase at z = 3.7

一个在 z = 3.7 从深埋红相孵化出的类星体

Zheng Ma, Yongda Zhu, Zhiyuan Ji, Eiichi Egami, Marcia J. Rieke, Xiaohui Fan, Jianwei Lyu, George H. Rieke, Fengwu Sun, Yang Sun, George D. Becker, Andrew J. Bunker, Francesco D'Eugenio, Xiangyu Jin, Ignas Juodžbalis, Weizhe Liu, Roberto Maiolino, Pierluigi Rinaldi, Feige Wang, Christopher N. A. Willmer, Yunjing Wu, Jinyi Yang, Junyu Zhang, Peixin Zhu

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究 z = 3.7 的红类星体“幼体”,通过多波长数据如 JWST 等观测,发现其活动核部分暴露,有宽发射线等特征,核附近有致密气体,多相气体被加速,连续谱呈红色且下降,为探索类星体过渡阶段提供独特机会。

Comments 26 pages, 5 main figures, and 10 Extended Data figures. Submitted, comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24431 2026-07-28 cs.CV 新提交 57%

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

InterOCF:用于仅相机4D占用预测的时空2D-3D交互

Qi Zhang, Xinquan Yu, Kaiyi Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 研究针对仅相机4D占用预测中输入多视图帧间时空建模不足问题,提出InterOCF框架,通过联合建模3D体素表示和多视图分割序列中的时间动态,并纳入2D与3D分支特征交互,实验证明其性能优于现有方法。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23077 2026-07-28 cs.AI 新提交 57%

Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning

深度之上的结构:用于多实体推理的单块时空变换器

Narthana Sivalingam, Santhirarajah Sivasthigan, Buddhi Wijenayake, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究多实体时间数据建模问题,提出结构化时空变换器块,通过并行自注意力和双向交叉注意力及门控融合,在单个阶段明确建模三种交互,减少深层堆叠需求,在多任务中表现良好,支持结构优先设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23477 2026-07-28 nucl-th 新提交 50%

Sensitivity of $^{107,109}$Ag($α$,xn) cross sections to statistical-model inputs

$^{107,109}$Ag($α$,xn)截面对于统计模型输入的敏感性

Arunabha Saha

专题命中 VLA模型 :action model(abstract)

AI总结 研究利用TALYS~2.0代码分析α粒子与银同位素反应,评估192种核反应模型参数组合,发现统计模型成分有通道依赖性敏感性,不同反应通道各模型成分重要性不同,可为选择评估TALYS模型成分提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23330 2026-07-28 hep-ex 新提交 50%

Charge-dependent atmospheric muon flux at 17 GV geomagnetic cutoff measured with the mini-ICAL prototype

利用小型ICAL原型测量17 GV地磁截止处与电荷相关的大气μ子通量

S. Pethuraj, Raj Shah, G. Majumder, J. M. John

专题命中 VLA模型 :action model(abstract)

AI总结 利用小型ICAL原型在17 GV地磁截止处测量与电荷相关的大气μ子通量,测量了μ⁻和μ⁺ 在1 - 5 GeV/c动量范围的微分通量,验证了探测器性能等,结果与模型预测比较。

Comments 23 pages, 17 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16191 2026-07-28 astro-ph.CO gr-qc hep-ph hep-th 版本更新 50%

Cosmological Evidence for Dark Axion-Dark Baryon Interactions from Apparent Phantom Crossing

从表观幽灵穿越看暗轴子 - 暗重子相互作用的宇宙学证据

Justin Khoury, Meng-Xiang Lin, Mark Trodden

专题命中 VLA模型 :action model(abstract)

AI总结 研究暗轴子与暗重子相互作用,通过在玻尔兹曼代码中实现相关模型并与CMB、DESI DR₂ BAO和SNe Ia数据对比,发现最佳拟合模型改善了拟合,其暗物质质量演化呈现非单调变化,产生类似早期暗能量的能量注入但对降低当前张力作用有限。

Comments Add more references. 13 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15492 2026-07-28 nucl-th 版本更新 50%

Description of nucleon elastic scattering off $^6$Li with the four-body continuum-discretized coupled-channels method

$^6$Li核弹性散射的四体连续离散耦合通道方法描述

Kazuyuki Ogata, Shoya Ogawa

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于四体连续离散耦合通道方法的半微观反应模型,用于描述$^6$Li核的中子弹性散射至50 MeV,并验证其在7-50 MeV范围内的可靠性。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2607.23784 2026-07-28 cs.RO cs.AI 新提交 79%

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

寥寥数语,成效显著:语言引导的机器人策略合成

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23782 2026-07-28 cs.RO 新提交 74%

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

$N_0$-VTLA:使用潜在触觉令牌扩展视觉-触觉-语言-动作模型

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 动作表示与策略 :action model(title);分类 cs.RO

AI总结 研究提出$N_0$-VTLA模型,基于视觉主干,通过视觉-触觉预训练、分阶段触觉路径集成和优势条件离线策略改进进行触觉集成训练。该模型在丰富接触基准测试中表现出色,为通用触觉驱动操作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2607.23870 2026-07-28 cs.MA cs.AI 新提交 77%

MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试

Belal S. Alsinglawi, Weizheng Wang, Junyi Wu, Yi Jiang, Lianhai Lin, Merouane Debbah, Izzat Alsmadi

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI

AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。

Comments 22 pages, 18 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2607.24008 2026-07-28 cs.RO 新提交 77%

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

FutureRTC:基于预期条件动作分块的实时机器人执行

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作策略实时部署中异步执行的问题,提出FutureRTC框架,通过状态校正和观测预测模块及策略一致性损失,无需修改底层策略,有效提升对推理延迟的鲁棒性,实现更优轨迹、执行速度和任务成功率。

Comments Project Website: https://jianghaiscu.github.io/FutureRTC_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏