arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 634 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 544 篇

2607.05133 2026-07-07 cs.CV 新提交 79%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02640 2026-07-07 cs.SD cs.AI cs.NI 新提交 79%

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

Jiaying Meng, Bojie Li

机构 * Pine AI(松果人工智能公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交 79%

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 79%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 79%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 79%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交 79%

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 79%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 79%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08242 2026-06-09 cs.CV 新提交 79%

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

Light-WAM:基于状态融合动作解码的高效世界动作模型

Ziang Li, Dongzhou Cheng, Yibin Wang, Shiyue Wang, Xiaoyang Xu, Lingxuan Weng, Juan Wang, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出轻量级世界动作模型Light-WAM,通过紧凑视频骨干和降维潜空间未来视频监督降低训练成本,并引入状态融合动作专家实现高效动作预测,在LIBERO和RoboTwin 2.0上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 79%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 79%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01402 2026-08-04 cs.RO cs.AI 新提交 79%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00315 2026-08-04 cs.RO cs.LG cs.SY eess.SY 新提交 79%

Towards General Language-Conditioned Latent Safety Filters

面向通用语言条件的潜在安全过滤器

Ihab Tabbara, Yuxuan Yang, Hussein Sibai

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出语言条件安全过滤器,结合哈密顿-雅可比安全演员与评论家,在多种视觉机器人任务中减少约束违规并实现部分未见过约束实例的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29172 2026-08-03 cs.RO cs.AI 新提交 79%

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) NVIDIA Research(英伟达研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 79%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02841 2026-07-07 cs.RO cs.CV 新提交 79%

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01067 2026-07-02 cs.RO cs.CV 新提交 79%

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

面向灵巧机器人操作的人为中心的可迁移触觉预训练

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。

Comments The first two authors contribute equally. Orders are decided by flipping a coin

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22913 2026-06-23 cs.CV cs.AI 新提交 79%

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架

Zisheng Chen, Yuping Qiu, Jianhua Han, Tao Tang, Xiuwei Chen, Likui Zhang, Ying-Cong Chen, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) HKUST(GZ)(香港科技大学(广州)) Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交 79%

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交 79%

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 79%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07593 2026-06-09 cs.CV cs.AI 新提交 79%

A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers

视觉Transformer对抗微调的机制分析

Hannah Gao, Isha Agarwal, Dylan Hadfield-Menell, Rachel Ma

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 通过机制分析研究对抗微调对视觉Transformer在扰动和常规图像上性能的影响,发现微调仅改善特定类型扰动,未改变稀疏表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17115 2026-07-21 math.AP 新提交 78%

Enhanced stability and asymptotic limits to the non-isentropic compressible fluid-particle interaction model with thermal effects

具有热效应的非等熵可压缩流体-粒子相互作用模型的增强稳定性和渐近极限

Fucai Li, Jinkai Ni, Zhouping Xin

专题命中 VLA模型 :action model(title,abstract)

AI总结 研究具有热效应的非等熵可压缩流体-粒子相互作用模型。通过建立先验估计并取极限,证明该模型存在全局经典解且有最优衰减率,改进前人结果,证实爱因斯坦预测,揭示粒子对模型产生新耗散效应,开发新思想技术克服相关障碍。

Comments 76 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15468 2026-07-20 astro-ph.GA astro-ph.SR 新提交 78%

A JWST, ALMA and VLA survey of the Ophiuchus-A star-forming region: Unveiling hidden dust mass and connecting infrared outflows to their radio origins

对蛇夫座-A恒星形成区域的詹姆斯·韦布空间望远镜、阿塔卡马大型毫米/亚毫米波阵列和甚大阵巡天:揭示隐藏的尘埃质量并将红外外流与其射电起源联系起来

Isaac C. Radley, John D. Ilee, Gemma Busquet, Hauyu Baobab Liu, Klaus M. Pontoppidan, Alvaro Ribas, Marc Audard, Eleonora Bianchi, Tyler L. Bourke, Claudio Codella, Audrey Coutens, Josep M. Girart, Melvin G. Hoare, Izaskun Jiménez-Serra, Doug Johnstone, Laurent Loinard, Olja Panić, Jaime E. Pineda, Linda Podio, John J. Tobin, David J. Wilner

专题命中 VLA模型 :VLA(title,abstract)

AI总结 对蛇夫座A恒星形成区域进行多波段巡天,结合高分辨率观测数据,用基于物理的模型推导尘埃和电离气体性质等,揭示星周尘埃盘质量,联系外流与起源,解决“缺失盘质量”问题,为相关研究提供潜在方案,但受现有分辨率和灵敏度限制。

Comments Accepted for publication in AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27808 2026-06-29 cs.CL 新提交 78%

Learning Complementary Action Modeling from Automotive Maintenance Instructions

从汽车维修说明中学习互补动作建模

Jiaqi Wu, Bai Li, Jochen Hartmann, Martin Gaedke, Sander Stuijk

机构 * Eindhoven University of Technology(埃因霍温理工大学) BMW Group(宝马集团) Chemnitz University of Technology(开姆尼茨工业大学)

专题命中 VLA模型 :action model(title,abstract)

AI总结 针对汽车维修说明中动作短语决定程序关系的问题,提出互补动作建模任务,通过候选匹配和受控序列生成方法识别或生成程序性对应指令。

Comments Preprint. 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交 78%

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11986 2026-06-11 cs.HC 新提交 78%

Channels and Substrates: Distributed Cognition as an Interaction Model for Ubiquitous Analytics

通道与基质:作为普适分析交互模型的分布式认知

Niklas Elmqvist, Panagiotis D. Ritsos, Peter W. S. Butcher

专题命中 VLA模型 :action model(title,abstract)

AI总结 针对跨设备和普适分析中交互模型不匹配的问题,提出基于分布式认知的通道与基质框架,将交互建模为表征状态在基质间的传播,并通过重分析多个系统验证其有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10718 2026-08-12 cs.RO 新提交 77%

TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4

用于自主可变形操作的TCAM:WBCD 2026赛道4的RMC2冠军系统

Guangrui Shen, Zhili He, Shigang Wang, Yuanjun Sun, Qing Yu

机构 * TermiTech(特米科技)

专题命中 VLA模型 :VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 该研究围绕TCAM框架构建自主可变形操作系统,在WBCD 2026赛道4挑战赛中以平均23秒/件的速度完成25件T恤操作,22件达标,获赛道冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏