arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-03 至 2026-08-03 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2605.11567 2026-08-03 cs.CV 版本更新 89%

Dynamic Execution Commitment of Vision-Language-Action Models

视觉-语言-动作模型的动态执行承诺

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu

机构 * University of Adelaide(阿德莱德大学) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出A3机制,通过将动态执行承诺重新定义为自推测前缀验证问题,解决了视觉-语言-动作模型在动态或分布外情况下执行鲁棒性和推理吞吐量之间的平衡问题。

Comments code is available at https://inceptionwang.github.io/A3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 89%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27178 2026-08-03 cs.CL cs.IR 版本更新 78%

DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search

DenseOn与LateOn:面向多语言、长上下文及代码检索的全开放密集型与晚交互模型

Raphaël Sourty, Antoine Chaffin, Paulo Roberto Moura Junior, Amélie Chatelain

机构 * LightOn(莱特昂)

专题命中 VLA模型 :action model(title,abstract)

AI总结 该研究提出开放端到端方案训练检索模型,构建DenseOn、LateOn等模型,在BEIR上创同规模最优,发现晚交互模型泛化性更优,公开了模型、数据与代码。

Comments 21 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 76%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.LG

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27475 2026-08-03 cs.IR cs.LG 版本更新 57%

OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval

OneShot:面向大规模检索的结合神经打分的排序内索引方法

Ziwei Li, Shuyao Li, Xufeng Cai, Xue Zou, Yiming Ma, Huiting Lu, Wujie Yan, Zhichen Zhao, Yang Lu, Zhe Wang, Rui Luo, Zhengyu Su, Dan Zhang, Yimin Tan, Ji Liu

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对推荐系统检索阶段排序目标与索引结构不一致的问题,提出OneShot框架,将索引学习与排序目标联合,突破点积瓶颈,部署于Instagram短视频推荐系统,提升了召回率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30544 2026-08-03 cs.AI 版本更新 57%

Latent Actions from Factorized Transition Effects under Agent Ambiguity

基于因子化转移效应的潜在动作在智能体模糊性下的研究

Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。

Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16555 2026-08-03 cs.IR 版本更新 50%

MMGRec: Multimodal Generative Recommendation with Transformer Model

MMGRec: 基于Transformer模型的多模态生成推荐

Han Liu, Yinwei Wei, Xuemeng Song, Weili Guan, Yuan-Fang Li, Liqiang Nie

专题命中 VLA模型 :action model(abstract)

AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏