arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9119 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9119 篇

2607.23783 2026-07-28 cs.RO 新提交 79%

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 79%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20175 2026-07-23 cs.CV 新提交 79%

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-07-15 cs.RO 版本更新 79%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 17 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 79%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02640 2026-07-07 cs.SD cs.AI cs.NI 新提交 79%

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

Jiaying Meng, Bojie Li

机构 * Pine AI(松果人工智能公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交 79%

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 79%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 79%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 79%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 79%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交 79%

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 79%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新 79%

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 79%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08242 2026-06-09 cs.CV 新提交 79%

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

Light-WAM:基于状态融合动作解码的高效世界动作模型

Ziang Li, Dongzhou Cheng, Yibin Wang, Shiyue Wang, Xiaoyang Xu, Lingxuan Weng, Juan Wang, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出轻量级世界动作模型Light-WAM,通过紧凑视频骨干和降维潜空间未来视频监督降低训练成本,并引入状态融合动作专家实现高效动作预测,在LIBERO和RoboTwin 2.0上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 79%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-06-04 cs.SD cs.AI cs.CL cs.MM eess.AS 79%

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 79%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 79%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 79%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06247 2026-05-08 cs.RO 79%

CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models

CKT-WAM: 在世界动作模型之间高效传递上下文知识

Yuhua Jiang, Yijun Guo, Hongbing Yang, Guojun Lei, Nuo Chen, Yinuo Zhang, Shaoqiang Yan, Bo Lin, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) LivsynRobotics Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 79%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25859 2026-05-05 cs.RO 79%

Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models

特权预见蒸馏:世界动作模型的零成本未来修正

Pengcheng Fang, Hongli Chen, Xiaohao Cai

机构 * The University of Southampton(南安普顿大学) The University of Queensland(昆士兰大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文提出特权预见蒸馏,通过将未来信息作为可压缩的修正项进行蒸馏,提升世界动作模型在无未来信息下的表现,实验证明其在LIBERO和RoboTwin任务中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26489 2026-04-30 cs.LG cs.IR 79%

Understanding DNNs in Feature Interaction Models: A Dimensional Collapse Perspective

理解特征交互模型中的DNN:从维度崩溃视角出发

Jiancheng Wang, Mingjia Yin, Hao Wang, Enhong Chen

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

AI总结 本文从维度鲁棒性角度探讨DNN在特征交互模型中的有效性,通过实验验证并分析DNN缓解嵌入维度崩溃的机制。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26259 2026-04-16 cs.IR cs.AI cs.CL 79%

Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models

晚期交互动力学工作笔记:分析晚期交互模型的目标行为

Antoine Edy, Max Conti, Quentin Macé

机构 * Illuin Technology(Illuin技术)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文研究了晚期交互检索中长度偏差和最大相似性操作符外的相似性分布,揭示了因果模型和双向模型的实际性能瓶颈。

Comments Accepted at The 1st Late Interaction Workshop (LIR) @ ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08685 2026-04-13 cs.AI 79%

RAMP: Hybrid DRL for Online Learning of Numeric Action Models

RAMP:用于在线学习数字动作模型的混合深度强化学习

Yarin Benyamin, Argaman Mordoch, Shahaf S. Shperberg, Roni Stern

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 RAMP通过环境交互在线学习数字规划动作模型,结合深度强化学习策略、动作模型学习和规划,形成正反馈循环提升求解能力和计划质量。

Comments Accepted as a workshop paper at the Adaptive and Learning Agents (ALA) Workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO 79%

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26360 2026-03-30 cs.RO 79%

Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate

Realtime-VLA V2:学习以快速、平滑和准确地运行VLAs

Chen Yang, Yucheng Hu, Yunchao Ma, Yunhuan Yang, Jing Tan, Haoqiang Fan

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 本文提出Realtime-VLA V2,通过校准、规划与控制及学习方法,实现机器人在真实任务中高速、高精度和高灵活性的VLAs运行。

详情

展开后加载摘要…

URL PDF HTML 收藏