arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-12 至 2026-08-12 共收录 4 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 93%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.LG

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13738 2026-08-12 cs.CV cs.AI 版本更新 81%

Ablation-Corrected Evaluation of Attribution Maps in Echocardiographic Ejection-Fraction Models

解剖结构忠实但时间上盲目:超声心动图左心室射血分数估计的归因审核

Hyunkyung Han, Min Jung Kim

机构 * School of Integrated Medicine, Yonsei University(延世大学统合医学院) Department of Radiology, Research Institute of Radiologic Science, Yonsei University College of Medicine(延世大学医学院放射科学研究所放射科)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究超声心动图左心室射血分数估计模型的归因,微调VideoMAE Transformer和R(2+1)D CNN两个回归器,用多指标审核发现模型空间忠实但时间盲目,强调空间忠实不代表时间忠实,警示XAI验证并呼吁时间感知训练评估。

Comments 12 pages, 4 figures. v2: the chance level is now measured rather than computed, which corrects the ratios reported in v1. Adds a composition-matched ablation with an equal-area control, a reliability estimate for it, an ablation-derived score to report alongside overlap, seed repetition, and pediatric validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-12 cs.CV 版本更新 79%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01880 2026-08-12 cs.RO 版本更新 79%

World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment

实时世界动作模型:通过异步部署实现平滑执行的实证研究

Motubrain Team

机构 * Motubrain Team(Motubrain团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文针对世界动作模型推理延迟导致机器人执行不连续的问题,通过10Hz双机械臂机器人对比6种异步部署策略,发现前缀条件生成可在任务性能、速度与平滑度间实现最佳平衡,为高延迟世界动作模型的实时部署提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏