Explicit Interaction Model towards Text Classification
专题命中 VLA模型 :action model(title,abstract);分类 cs.LG
Comments 8 pages
Journal ref AAAI 2019
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :action model(title,abstract);分类 cs.LG
Comments 8 pages
Journal ref AAAI 2019
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
Comments Workshop on Affect, Artifcial Compagnon and Interaction, 2016
Journal ref Workshop on Affect, Artifcial Compagnon and Interaction, 2016
专题命中 VLA模型 :action model(title,abstract);分类 cs.LG
Comments 4 pages, NIPS ML4H 2017
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
Journal ref International Joint Conference on Artificial Intelligence (IJCAI) 2017
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
Comments Intelligent Virtual Agents 2015 Doctoral Consortium, Aug 2015, Delft, Netherlands. IVA Doctoral Consortium, 2015
专题命中 VLA模型 :action model(title,abstract);分类 cs.LG
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 33, pages 349-402, 2008
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 24, pages 799-849, 2005
专题命中 VLA模型 :VLA(title,abstract)
Comments Accepted for publication in Astronomy and Astrophysics. 15 pages, 9 figures and 5 tables. Full versions of Tables 3, 4 and 5 and Figs. 2, 4 and 7 will only be available via CDS or the RMS website at http:/www.ast.leeds.ac.uk/cgi-bin/RMS/RMS_VLA_IMAGES.cgi
专题命中 VLA模型 :VLA(title,abstract)
Comments submitted in response to NRAO's call for Community White Papers for a potential VLA Sky Survey
Robo-Dopamine 2.0:面向机器人操纵的历史条件感知与分布外感知过程奖励建模
机构 * Peterson Co(彼得森公司)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本文提出Robo-Dopamine 2.0,一种历史条件与分布外感知的过程奖励模型,结合带符号跳课程训练,提升了机器人操纵的视觉顺序一致性与分布外鲁棒性,在下游强化学习中取得优异的真实世界任务表现。
RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI
AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。
用于具身操纵的数据金字塔
机构 * PKU(北京大学) ; NTU(南洋理工大学) ; HKUST(香港科技大学) ; NUS(新加坡国立大学) ; CUHK(香港中文大学) ; HKU(香港大学) ; Duke(杜克大学) ; UCB(加州大学伯克利分校) ; GBU(未提及具体中文名的机构) ; NJU(南京大学) ; SJTU(上海交通大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV
AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。
Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid
权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。
Comments 40 pages, 11 figures, 11 tables
揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法
机构 * Stanford University(斯坦福大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.AI
AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。
Comments 16 pages
面向通用语言条件的潜在安全过滤器
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG
AI总结 该研究提出语言条件安全过滤器,结合哈密顿-雅可比安全演员与评论家,在多种视觉机器人任务中减少约束违规并实现部分未见过约束实例的迁移。
从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶
机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Lenovo Group Limited(联想集团有限公司) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。
CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind) ; NVIDIA Research(英伟达研究院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);robot foundation model(abstract);分类 cs.RO、cs.AI
AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。
通过自回归离散预训练实现机器人动作的统一具身VLM推理
机构 * AgiBot Research(AgiBot研究机构) ; AgiBot(AgiBot公司) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。
通过 VLAC-Cut 引导的管道最大化大规模机器人训练后人类效率
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision language action(abstract);分类 cs.RO、cs.AI
AI总结 研究旨在最大化机器人训练后人类效率,提出含专门分工的高效训练后管道,引入 VLAC-CUT 工具提高数据利用效率,经四个实际任务验证,最终策略成功率达 80% - 95%,吞吐量提升 1.7 倍至 4.2 倍,优于仅人工参与训练。
VIA:用于机器人控制的视觉接口代理
机构 * Stanford University(斯坦福大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。
CLEAR:用于端到端自动驾驶的大规模闭环强化学习
机构 * Qualcomm AI Research(高通人工智能研究中心)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。
CaP-X: 用于基准测试和改进机器人操作编码智能体的框架
机构 * nvidia ; stanford(斯坦福大学) ; cmu(卡内基梅隆大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。
面向灵巧机器人操作的人为中心的可迁移触觉预训练
机构 * Peking University(北京大学) ; BeingBeyond ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。
Comments The first two authors contribute equally. Orders are decided by flipping a coin
X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶
机构 * XPeng Inc.(小鹏汽车)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI
AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。
OpenFrontier: 基于视觉-语言基础的通用导航
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft Spatial AI Lab(微软空间人工智能实验室) ; University of Bonn(波恩大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。
意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架
机构 * Sun Yat-sen University(中山大学) ; HKUST(GZ)(香港科技大学(广州)) ; Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI
AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。
PearlVLA:潜在空间中的渐进式具身动作计划精炼
机构 * Imperial College London(帝国理工学院) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。
Comments 21 pages, 2 figures. Preprint
ROVE: 通过强化学习解锁人类干预用于人形机器人操作
机构 * XPENG Robotics(小鹏机器人) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG
AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。
基于视觉基元的动作生成
机构 * Anyverse Dynamics ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。
Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/