arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-18 至 2026-08-18 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 14 篇

2608.16503 2026-08-18 cs.RO cs.AI 新提交 87%

NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation

NebulaVLA:用于机器人操纵的带引导动作的双频视觉-语言-动作模型

Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang

机构 * ZTE Corporation(中兴通讯股份有限公司)

专题命中 机器人基础模型 :manipulation(title);robotic(title);robotics(abstract);分类 cs.RO、cs.AI

AI总结 NebulaVLA是一种异步双频VLA模型,通过解耦语义推理与动作控制、引入GESTURE-7表示及引导动作算法,在LIBERO-Plus上以85.5%成功率、约2.7倍速度优于同步基线,实现高效机器人操纵控制。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16885 2026-08-18 cs.RO 新提交 83%

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人基础模型 :robot foundation model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: this https URL (https://tau0-vla.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15816 2026-08-18 cs.RO 新提交 79%

ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation

ViTaR:面向基础VLA操作的视觉-触觉残差自适应方法

Yi Wang, Renjun Wu, Jinyan Liu, Xuesong Li

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 ViTaR将触觉反馈转为有界残差修正的执行调制器,在冻结VLA上实现自适应,在UniVTAC基准上成功率提升30.6个百分点,适配真实机器人场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15636 2026-08-18 cs.RO cs.AI 新提交 79%

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

结合推测推理与验证的高效VLA推理的算法-架构协同设计

Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对VLA模型推理延迟高、动作长度有限的问题,提出SpecVLA算法-架构协同框架,通过状态感知推理、sVLA验证模型与异构架构,在保持任务成功率的同时降低延迟,实现高效可靠的实时机器人操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16172 2026-08-18 cs.RO 新提交 74%

SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation

SparkVLA:用于长程操作的停止感知分层视觉-语言-动作(VLA)模型,结合自适应动作分块

Xunyao Lei, Renjun Wu, Tianlin Huo, Xuesong Li

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO

AI总结 针对分层VLA系统中停止与动作分块决策孤立评估的问题,提出SparkVLA,通过统一排序解决依赖,在RoboCerebra上取得显著性能提升,真实机器人实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15269 2026-08-18 cs.RO 新提交 74%

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间

Dai Zhou, Jiexi Yan, Tong Li, Yuxuan Wang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 机器人基础模型 :robotic(title);分类 cs.RO

AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。

Comments 19 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15502 2026-08-18 cs.AI cs.RO 新提交 73%

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

EcoVLA:面向实时约束的视觉-语言-动作模型的节能设备-边缘协同推理

Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang

机构 * Beihang University(北京航空航天大学) Beijing University of Technology(北京工业大学)

专题命中 机器人基础模型 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 EcoVLA是面向VLA模型的自适应设备-边缘协同推理框架,可在实时约束下最大化能效,提升能效达236%,同时保持服务水平目标满足。

Comments Accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14822 2026-08-18 cs.RO cs.CV 新提交 73%

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

想象恢复:视觉-语言-动作模型的推理时反事实重对齐

Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对VLA模型易受在线干扰的问题,提出无需训练的CoRe框架,通过反事实想象与最小重对齐实现无试错恢复,大幅提升任务成功率并减少物理恢复操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-08-18 cs.CV cs.RO 版本更新 73%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at this https URL (https://github.com/H-EmbodVis/TurboVLA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15139 2026-08-18 cs.RO 新提交 70%

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

StructRL:面向基于流的视觉-语言-动作模型的结构化动作空间探索

Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 StructRL通过将策略随机性重定位至动作空间的三个耦合设计,解决基于流的VLA模型的结构化噪声稀释问题,在模拟与真实任务上提升了探索效率及OOD性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16074 2026-08-18 cs.RO cs.CV 新提交 62%

US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina

US-VLA:用于腹部超声的超声-视觉-动作模型

Cheng Zhang, Xingzheng Wu, Guihao Yan, Xifeng Hu, Zhi Liu, Mei Wu, Qing Cai

机构 * Faculty of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) the Qilu Second Hospital of Shandong University(山东大学第二齐鲁医院) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对现有超声扫描方法泛化性与稳定性不足的问题,提出US-VLA模型,设计超声感知专家融合模块并构建US-VLA-Data数据集,在腹部超声探头操作任务中取得竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15285 2026-08-18 cs.RO cs.AI 新提交 62%

PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

PhaseLoRA:面向连续动作视觉-语言-动作策略的控制条件式低秩适配

Yufei Guo, Yinan Wu, Haoran Duan, Guiguang Ding, Jungong Han

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 PhaseLoRA是面向连续动作VLA策略的轻量级PEFT方法,通过控制条件式LoRA实现阶段依赖适配,在LIBERO数据集上较匹配参数的高秩LoRA基线提升平均成功率12.2个百分点,性能优于其他LoRA变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15875 2026-08-18 cs.RO 新提交 57%

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO

AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。

Comments this https URL (https://gigaai.cc/blog/gigabrain07)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29605 2026-08-18 cs.RO 版本更新 57%

VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models

VLAConf: 视觉-语言-动作模型的校准任务成功置信度

Dehao Huang, Aoxiang Gu, Chengjie Zhang, Bolin Zou, Wenlong Dong, Zilang Cen, Yue Wang, Hong Zhang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学电子与电气工程系,深圳,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) National Cybersecurity Academy, Wuhan University, Wuhan, China(武汉大学国家网络安全学院,武汉,中国)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出VLAConf,一种基于单类判别性置信度框架的方法,通过冻结预训练VLA内部表示和轻量级置信度头,在单次前向传播中直接估计逐步异常分数,实现高效且跨架构通用的任务成功置信度估计。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏