arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-28 至 2026-07-28 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2607.24148 2026-07-28 cs.AI 新提交 89%

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架

Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI

AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22997 2026-07-28 cs.RO cs.AI cs.GR cs.LG 新提交 87%

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

用于视觉-语言-动作操纵的Real2Sim2Real:基于AMD ROCm的管道

Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

机构 * AMD AIG Team(AMD人工智能团队) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文针对视觉-语言-动作操纵提出基于AMD ROCm的Real2Sim2Real技术栈,涵盖多硬件计算,由开放软件栈统一。通过四个演示表明无需CUDA锁定生态系统,展示了在多硬件平台上的相关成果,且管道可在特定硬件和平台上原生运行并重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 84%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23783 2026-07-28 cs.RO 新提交 79%

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22966 2026-07-28 astro-ph.GA 新提交 67%

A quasar hatching from a buried red phase at z = 3.7

一个在 z = 3.7 从深埋红相孵化出的类星体

Zheng Ma, Yongda Zhu, Zhiyuan Ji, Eiichi Egami, Marcia J. Rieke, Xiaohui Fan, Jianwei Lyu, George H. Rieke, Fengwu Sun, Yang Sun, George D. Becker, Andrew J. Bunker, Francesco D'Eugenio, Xiangyu Jin, Ignas Juodžbalis, Weizhe Liu, Roberto Maiolino, Pierluigi Rinaldi, Feige Wang, Christopher N. A. Willmer, Yunjing Wu, Jinyi Yang, Junyu Zhang, Peixin Zhu

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究 z = 3.7 的红类星体“幼体”,通过多波长数据如 JWST 等观测,发现其活动核部分暴露,有宽发射线等特征,核附近有致密气体,多相气体被加速,连续谱呈红色且下降,为探索类星体过渡阶段提供独特机会。

Comments 26 pages, 5 main figures, and 10 Extended Data figures. Submitted, comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24431 2026-07-28 cs.CV 新提交 57%

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

InterOCF:用于仅相机4D占用预测的时空2D-3D交互

Qi Zhang, Xinquan Yu, Kaiyi Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 研究针对仅相机4D占用预测中输入多视图帧间时空建模不足问题,提出InterOCF框架,通过联合建模3D体素表示和多视图分割序列中的时间动态,并纳入2D与3D分支特征交互,实验证明其性能优于现有方法。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23077 2026-07-28 cs.AI 新提交 57%

Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning

深度之上的结构:用于多实体推理的单块时空变换器

Narthana Sivalingam, Santhirarajah Sivasthigan, Buddhi Wijenayake, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究多实体时间数据建模问题,提出结构化时空变换器块,通过并行自注意力和双向交叉注意力及门控融合,在单个阶段明确建模三种交互,减少深层堆叠需求,在多任务中表现良好,支持结构优先设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23477 2026-07-28 nucl-th 新提交 50%

Sensitivity of $^{107,109}$Ag($α$,xn) cross sections to statistical-model inputs

$^{107,109}$Ag($α$,xn)截面对于统计模型输入的敏感性

Arunabha Saha

专题命中 VLA模型 :action model(abstract)

AI总结 研究利用TALYS~2.0代码分析α粒子与银同位素反应,评估192种核反应模型参数组合,发现统计模型成分有通道依赖性敏感性,不同反应通道各模型成分重要性不同,可为选择评估TALYS模型成分提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23330 2026-07-28 hep-ex 新提交 50%

Charge-dependent atmospheric muon flux at 17 GV geomagnetic cutoff measured with the mini-ICAL prototype

利用小型ICAL原型测量17 GV地磁截止处与电荷相关的大气μ子通量

S. Pethuraj, Raj Shah, G. Majumder, J. M. John

专题命中 VLA模型 :action model(abstract)

AI总结 利用小型ICAL原型在17 GV地磁截止处测量与电荷相关的大气μ子通量,测量了μ⁻和μ⁺ 在1 - 5 GeV/c动量范围的微分通量,验证了探测器性能等,结果与模型预测比较。

Comments 23 pages, 17 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2607.23784 2026-07-28 cs.RO cs.AI 新提交 79%

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

寥寥数语,成效显著:语言引导的机器人策略合成

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23782 2026-07-28 cs.RO 新提交 74%

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

$N_0$-VTLA:使用潜在触觉令牌扩展视觉-触觉-语言-动作模型

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 动作表示与策略 :action model(title);分类 cs.RO

AI总结 研究提出$N_0$-VTLA模型,基于视觉主干,通过视觉-触觉预训练、分阶段触觉路径集成和优势条件离线策略改进进行触觉集成训练。该模型在丰富接触基准测试中表现出色,为通用触觉驱动操作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2607.23870 2026-07-28 cs.MA cs.AI 新提交 77%

MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试

Belal S. Alsinglawi, Weizheng Wang, Junyi Wu, Yi Jiang, Lianhai Lin, Merouane Debbah, Izzat Alsmadi

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI

AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。

Comments 22 pages, 18 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2607.24008 2026-07-28 cs.RO 新提交 77%

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

FutureRTC:基于预期条件动作分块的实时机器人执行

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作策略实时部署中异步执行的问题,提出FutureRTC框架,通过状态校正和观测预测模块及策略一致性损失,无需修改底层策略,有效提升对推理延迟的鲁棒性,实现更优轨迹、执行速度和任务成功率。

Comments Project Website: https://jianghaiscu.github.io/FutureRTC_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏