GroupNet: Multiscale Hypergraph Neural Networks for Trajectory Prediction with Relational Reasoning
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.LG
Comments Accepted by CVPR2022
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.LG
Comments Accepted by CVPR2022
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV
Comments 8 pages, 6 figures, Accepted by RA-L with ICRA 2022 presentation option
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.AI
Comments Submitted to Neural Computing and Applications
专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI
Journal ref PLOS ONE 15(1): e0226880 (2020)
机构 * Dexmal ; StepFun
专题命中 动作表示与策略 :VLA(abstract,comments);分类 cs.RO
Comments Code is available at https://github.com/Dexmal/realtime-vla
基于多AUV自组织网络的目标跟踪:一种值梯度引导多智能体扩散强化学习方法
机构 * Software College, Northeastern University(东北大学软件学院) ; Hohai University(河海大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.LG
AI总结 针对多AUV自组织网络目标跟踪的训练不稳定、跟踪性能差问题,提出VGG-MADiffRL算法与MDCA架构,实现了更快收敛、更高跟踪精度与平稳训练动态,具有工程应用价值。
LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV
AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。
样条策略:机器人策略的结构化表示
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) ; Idiap Research Institute(Idiap研究 institute)
专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO
AI总结 提出样条策略(SP),用样条参数替代动作块,保留策略主干,支持连续轨迹解码、时域重采样、参数空间编辑及下游控制,并具有局部修正机制。
Comments This work has been submitted to the IEEE for possible publication
RoboHarness:用于长期规划的异构机器人策略的内存驱动编排
机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; University of British Columbia(英属哥伦比亚大学) ; University of Toronto(多伦多大学) ; McGill University(麦吉尔大学) ; Labs(2012实验室)
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 针对长期机器人任务需多种能力、异构策略编排难的问题,提出RoboHarness框架,通过多模态执行内存等表征策略能力边界,经内存桥接稳定策略交接,实验验证其在长期规划和分布外鲁棒性上有显著提升。
Comments 21 pages, 8 figures
GigaWorld-Policy-0.5:由自动研究赋能的更快更强的世界行动模型
机构 * GigaAI(字节跳动人工智能实验室) ; Tsinghua University(清华大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 研究旨在改进机器人策略学习,提出GigaWorld-Policy-0.5这一增强型以动作中心的WAM。预训练采用混合策略加强视觉与动作耦合,推理引入新架构提升效率,还用自动研究管道搜索训练配置,有效提升了机器人控制推理效率并保留训练优势。
Comments project page: https://open-gigaai.github.io/giga-world-policy/
WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作
机构 * CASIA(中国科学院自动化所) ; Anyverse Dynamics(Anyverse动力学公司) ; UCAS(中国科学院大学) ; NUS(新加坡国立大学) ; XJYLU(西安交通大学利物浦大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。
Comments Project page: https://liujiahao2077.github.io/WALA.github.io
小波策略:基于世界先验记忆的尺度域模仿学习
机构 * Zhejiang University(浙江大学) ; Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) ; Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。
并非所有动作都同等重要:重新思考灵巧世界模型的条件化
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shenzhen University(深圳大学) ; Beijing University of Technology(北京工业大学) ; JD Explore Academy(京东探索研究院)
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV
AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。
AdaMem: 学习为个性化长时程LLM代理记住什么
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
专题命中 动作表示与策略 :action model(abstract);分类 cs.AI
AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。
统一视频-动作联合去噪用于灵巧动作与数据生成
机构 * Technical University of Munich(慕尼黑技术大学) ; ByteDance(字节跳动) ; Tsinghua University(清华大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV
AI总结 提出Donk模型,通过联合建模交互视频与手部轨迹的分布,实现灵巧手的动作生成与数据增强。
Comments 9 pages, 5 figures
多模态动作扩散用于鲁棒的端到端自动驾驶
机构 * Computer Vision Center (CVC)(计算机视觉中心) ; Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.CV
AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。
Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal
机器人群体涌现行为的物理信息建模与控制
机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) ; Shunde Innovation School, University of Science and Technology Beijing(北京科技大学顺德创新学院)
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 提出PhySwarm框架,利用多阶段对流-扩散-反应宏观模型和等效确定性运动微观模型,结合神经物理控制器,实现机器人群体多阶段涌现行为的建模与控制。
因子化潜在动作世界模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 动作表示与策略 :action model(abstract);分类 cs.LG
AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。
意图信号理论:人机交互中意图状态控制的计算框架
机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州莱尼人工智能技术有限公司) ; Huizhou University(惠州大学)
专题命中 动作表示与策略 :action model(abstract);分类 cs.AI
AI总结 提出意图信号理论(IST),通过区分潜在源意图、可观测意图代理、编码载体和模型输出四个对象,形式化意图丢失定理,并基于六种大语言模型、三种语言和三个任务领域的实验验证了结构-保真度分裂等预测,将提示工程重新定义为意图协议设计。
Comments 10 pages, 2 figures. Theoretical framework paper grounded in four companion empirical studies. Data and code repository: https://github.com/PGlarry/prompt-protocol-specification
从大规模人类示范中学习人类意图先验以用于机器人操作
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO
AI总结 本文提出MoT-HRA框架,通过大规模人类示范学习人类意图先验,用于机器人操作,通过构建HA-2.2M数据集和三个耦合专家提升动作合理性和鲁棒性。
Comments 13 pages, 5 figures
PRIME: 为四足机器人和人形机器人提供物理一致的机器人惯性与运动估计
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO
AI总结 该研究提出PRIME方法,通过结合可微接触动力学和光滑互补约束,实现从 onboard 传感器数据中获得物理一致的运动轨迹和惯性参数估计,从而提升机器人运动估计的准确性。
Comments Robotics: Science and Systems 2026
扩散策略用于非holonomic移动基底和双臂的协调控制以开门和通过
机构 * Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) ; alpha-z
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 本文提出基于扩散的视觉-运动控制策略,实现非holonomic移动基底与双臂的协调控制,以完成开门和通过任务,展示了在复杂约束下的高成功率和鲁棒性。
基于漂移的策略优化:面向在线机器人控制的原生一步生成策略
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK
专题命中 动作表示与策略 :action model(abstract);分类 cs.RO
AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。
后验优化与截断目标:在生成策略学习中平衡效率与稳定性
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO
AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。
点桥:跨领域策略学习的3D表示
机构 * NVIDIA ; New York University(纽约大学) ; University of Washington(华盛顿大学)
专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO
AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。
Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) ; AI 2 Robotics(AI与机器人) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO
AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。
LAOF:基于光流约束的鲁棒潜在动作学习
机构 * Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 动作表示与策略 :embodied foundation model(abstract);分类 cs.RO
AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。
Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF
通过动作量化理解行为克隆
机构 * Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系)
专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.LG
AI总结 本文研究行为克隆中动作量化的影响,分析量化误差传播与统计样本复杂度的相互作用,证明量化行为克隆在稳定动态和概率光滑性条件下可达到最优样本复杂度,提出基于模型的增强方法以改进误差界。