arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9800 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2608.04657 2026-08-07 cs.CV 版本更新 79%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-07 cs.RO 版本更新 79%

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Zhu Hengshuo, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00725 2026-08-04 cs.RO 新提交 79%

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交 79%

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00547 2026-08-04 cs.RO 新提交 79%

Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models

解耦视觉-触觉前瞻:面向世界动作模型的神谕引导式接口发现

Zihang Yao, Chaoyue Ding, Yingying Yu

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对接触丰富的操纵任务中视觉与触觉跨模态接口未被充分探索的问题,提出OVTF框架与AFM模型,在UniVTAC基准7项任务中,AFM平均成功率优于IFM与UniVTAC-ACT。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28391 2026-07-31 cs.RO 新提交 79%

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

TacWAM:锚点引导的力学感知触觉世界动作模型

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23969 2026-07-31 cs.RO 版本更新 79%

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25918 2026-07-29 cs.RO 新提交 79%

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

DC-WAM:用于世界-动作模型的以动态为中心的视觉监督与推理

Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究如何让基于RGB的世界-动作模型从外观主导的重建转向交互诱导的视觉动态,提出DC-WAM框架,通过重新分配监督和计算,结合时间差分流匹配等方法,提升策略性能,尤其在多种分布外扰动下表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23783 2026-07-28 cs.RO 新提交 79%

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 79%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20175 2026-07-23 cs.CV 新提交 79%

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-07-15 cs.RO 版本更新 79%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 17 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 79%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02640 2026-07-07 cs.SD cs.AI cs.NI 新提交 79%

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

Jiaying Meng, Bojie Li

机构 * Pine AI(松果人工智能公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交 79%

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 79%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 79%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 79%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 79%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交 79%

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 79%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新 79%

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 79%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08242 2026-06-09 cs.CV 新提交 79%

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

Light-WAM:基于状态融合动作解码的高效世界动作模型

Ziang Li, Dongzhou Cheng, Yibin Wang, Shiyue Wang, Xiaoyang Xu, Lingxuan Weng, Juan Wang, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出轻量级世界动作模型Light-WAM,通过紧凑视频骨干和降维潜空间未来视频监督降低训练成本,并引入状态融合动作专家实现高效动作预测,在LIBERO和RoboTwin 2.0上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 79%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-06-04 cs.SD cs.AI cs.CL cs.MM eess.AS 79%

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 79%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 79%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 79%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏