arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-02 至 2026-07-02 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 11 篇

2607.01212 2026-07-02 cs.RO cs.AI 新提交 92%

FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model

FurnitureVLA: 使用视觉-语言-动作模型学习长时域双臂家具组装

Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出FurnitureVLA,首个使用视觉-语言-动作模型进行真实尺寸双臂家具组装的系统,通过进度增强VLA和设计因素研究,将平均模拟成功率从48%提升至80%。

Comments Project Page: https://dannymcy.github.io/furniturevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00351 2026-07-02 cs.RO 新提交 92%

Unleashing More Actions via Action Compositional Training for VLA Models

通过动作组合训练释放VLA模型的更多动作

Kai Peng, Jie Lu, Xiaojiang Peng

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对VLA模型因过拟合特定行为模式而无法泛化到新动作组合的问题,提出ACT-VLA框架,利用模型潜在任务表示从现有任务中合成新演示数据,无需额外人工采集,有效缓解过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 90%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交 90%

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00666 2026-07-02 cs.RO cs.CV cs.LG 新提交 89%

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

域算术:环境变化下的单次VLA适应

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出域算术(DART)方法,通过权重向量算术和子空间对齐,仅需单次演示即可适应环境变化,在视觉和实体变化场景下优于现有方法。

Comments ECCV 2026. Project page: https://twkang43.github.io/projects/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01045 2026-07-02 astro-ph.IM 新提交 80%

Studying Ionosphere Using SKA-Low and SKA-Mid

利用SKA-Low和SKA-Mid研究电离层

Abhirup Datta, Samit Kumar Pal, Sarvesh Mangla, Bhuvnesh Brawar, Sumanjit Chakraborty, Sudipta Sasmal, Anshuman Tripathi

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本文通过对比uGMRT、VLA、MWA和LOFAR的观测,量化电离层相位波动、位置偏移和闪烁效应,评估对校准和成像的影响,并预测SKA-Low和SKA-Mid的电离层效应。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Datta01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01067 2026-07-02 cs.RO cs.CV 新提交 79%

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

面向灵巧机器人操作的人为中心的可迁移触觉预训练

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。

Comments The first two authors contribute equally. Orders are decided by flipping a coin

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27962 2026-07-02 cs.RO 新提交 70%

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao, Chenfeng Gu, Zhen Sun, Haoran Li, Wei Lu, Yucheng Guo, Shuai Di, Xiaodong Bai, Haoran Sun, Jing Long, Jiaxuan Gao, Hui Zhang, Peng Hao, Lu Lu

机构 * AI Infra Team at JDT(京东科技AI基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01088 2026-07-02 cs.RO cs.DC 新提交 57%

ROSA: A Robotics Foundation Model Serving System for Robot Factories

ROSA: 面向机器人工厂的基础模型服务系统

Wenqi Jiang, Jason Clemons, Rowland O'Flaherty, Hugo Hadfield, Alperen Degirmenci, Shuran Song, Yashraj Narang, Christos Kozyrakis

机构 * NVIDIA Research(英伟达研究院) Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出ROSA系统,通过共享GPU池服务、多模型流水线支持和工厂目标驱动调度,将机器人工厂的RFM推理性能提升12倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09606 2026-07-02 cs.GR 新提交 50%

PTIR-GS: Path-Traced Inverse Rendering with Global Illumination in 3D Gaussian Fields

基于路径追踪的3D高斯场全局光照逆渲染

Junke Zhu, Hao Zhang, Yutian Zhu, Ang Li, Chenxiao Hu, Meng Gai, Fei Zhu, Zhangjin Huang, Sheng Li

专题命中 VLA模型 :action model(abstract)

AI总结 提出一种无溅射的路径追踪逆渲染框架,在统一光线追踪管线中定义前向光传输和反向梯度传播,实现3D高斯场的全局光照逆渲染,提升材质反演和渲染质量。

Comments Project page: https://junkzhu.github.io/project_pages/PTIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16126 2026-07-02 quant-ph cond-mat.stat-mech 版本更新 50%

Quantum Dimension Reduction of Hidden Markov Models

隐马尔可夫模型的量子维度约简

Rishi Sundar, Thomas J. Elliott

专题命中 VLA模型 :action model(abstract)

AI总结 提出一种通用方法,将任意有限遍历隐马尔可夫模型压缩为量子隐马尔可夫模型,实现量子维度约简,在记忆-精度权衡上优于经典基线。

Comments 14 pages, 6 figures

Journal ref Phys. Rev. A 113, 062461, 25 June, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2607.00020 2026-07-02 cs.RO 新提交 77%

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

EmbodimentSemantic:面向具身操作轨迹的空间场景图数据集与视觉语言模型基准

Hassan Jaber, Refinath S N, Luca Cagliero, Christopher E. Mower, Haitham Bou-Ammar

机构 * Politecnico di Torino(都灵理工大学) University College London(伦敦大学学院)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出EmbodimentSemantic数据集与基准,通过场景图三元组评估VLM在具身操作中的空间关系理解,发现现有模型在深度感知和视角依赖关系上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00726 2026-07-02 cs.CV cs.SD 新提交 57%

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

AV-SyncBench:音视频时间与语义同步的解耦基准测试

Tianhong Zhou, Mingyang Han, Boyu Li, Yuxuan Jiang, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Kunpeng Wang, Jun Song, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 提出AV-SyncBench,首个完全分离音视频时间与语义一致性评估的基准,涵盖语音、音乐和声音三大类10个场景5项挑战任务,基于野外视频构建并人工验证,用于量化特征提取模型的对齐质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2604.04198 2026-07-02 cs.CV cs.RO 版本更新 76%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏