arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-09 至 2026-07-09 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2512.05693 2026-07-09 cs.RO cs.AI 版本更新 92%

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 89%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);vision language action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 84%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02076 2026-07-09 cs.LG cs.AI 版本更新 76%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16752 2026-07-09 quant-ph 版本更新 71%

Characterizing Phase Fragility via Algorithmically Prepared Ancillas in Repeated-Interaction Models

通过重复相互作用模型中算法制备的辅助量子比特表征相位脆弱性

S. Elham Mousavigharalari, Deniz Türkpençe

专题命中 VLA模型 :action model(title)

AI总结 研究通过单比特门序列编码的相位参数$\phi$在噪声动力学下的量子费希尔信息,采用碰撞模型和脉冲分辨开放系统模拟两种方法,结果表明二者QFI分布对相位依赖性相似,稳态框架可表征相位敏感性,还给出未来应用方向。

Comments 21 pages, 5 figures. This work presents an analytic and simulation-based study of phase sensitivity in noisy quantum devices, linking collision models and device-level simulations via quantum Fisher information, and will be of interest to readers in quantum computing and quantum metrology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28469 2026-07-09 cs.RO cs.HC 版本更新 57%

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration

我何时能帮你?主动性对群体人机协作的影响

Thomas Vitry, Vanessa Maeder, Kieran von Valeburg, Asihati Hazaiti, Doga Deniz Ates, Connor Gäde, Jan-Gerrit Habekost, Dennis Becker, Stefan Wermter

机构 * Knowledge Technology, University of Hamburg(汉堡大学知识技术研究所) Ecole Normale Superieure de Rennes(里昂大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究在多人协作逃生室中,机器人采用反应式(仅被叫时响应)与主动式(持续监听并自主贡献)交互模型对协作效果的影响,发现主动模型增加交互频率但反应模型成功率更高,且用户先前经验和性格显著调节效果。

Comments Published at the RO-MAN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2508.16943 2026-07-09 cs.RO cs.AI 版本更新 62%

LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes

LHM-Humanoid:学习一种统一的政策以在多样化的混乱环境中实现长视距人形全身体术操作

Haozhuo Zhang, Jingkai Sun, Michele Caprio, Angelo Cangelosi, Jian Tang, Shanghang Zhang, Qiang Zhang, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) X-Humanoid Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO、cs.AI

AI总结 LHM-Humanoid通过统一政策实现人形在复杂环境中长视距全身体术操作,结合强化学习与知识蒸馏,提升跨场景泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏