Fermionic Kaluza-Klein mode mixing in braneworlds
膜世界中费米子Kaluza-Klein模式混合
专题命中 具身推理 :world model(abstract)
AI总结 研究厚膜世界模型中背景扰动导致的费米子Kaluza-Klein模式混合,通过精确奇异值分解揭示宇称依赖的耦合与空间极化现象。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
膜世界中费米子Kaluza-Klein模式混合
专题命中 具身推理 :world model(abstract)
AI总结 研究厚膜世界模型中背景扰动导致的费米子Kaluza-Klein模式混合,通过精确奇异值分解揭示宇称依赖的耦合与空间极化现象。
PiL-World: 用于VLA策略环内评估的块式世界模型
机构 * Tongji University(同济大学) ; AIRC, Midea Group(美的集团人工智能研究院)
专题命中 机器人基础模型 :world model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 提出PiL-World,一种块式世界模型,通过交替VLA推理和世界模型预测实现闭环评估,无需真实机器人执行,显著降低成功率估计误差。
AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Knowin AI
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。
Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/
DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。
VISTA: 基于视觉和物理验证的UMI数据适配用于VLA训练
机构 * Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; Lumos Robotics(Lumos机器人) ; University of Science and Technology of China(中国科学技术大学) ; Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China University of Science and Technology(东华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Fudan University(复旦大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出VISTA框架,通过UMI-VQA数据集对齐视觉表示、物理验证流水线筛选可行轨迹以及两阶段联合训练,解决UMI数据训练VLA模型时的视觉分布偏移和物理不可行动作问题。
Comments Corrected the typing error
超越模仿:基于强化学习的仿真-现实协同训练用于VLA模型
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhongguancun Academy(中关村学院)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 本文提出基于强化学习的仿真-现实协同训练框架,通过结合仿真交互与真实世界数据,提升VLA模型的现实应用能力和泛化能力。
加速与扩展MPC引导的强化学习在类人机器人行走与操作中的应用
机构 * California Institute of Technology(加州理工学院) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO
AI总结 本文提出了一种基于质心动力学MPC奖励的MPC-RL框架,并开发了并行批处理GPU求解器π^nMPC,以高效实现类人机器人的行走与操作技能。
Comments 8 pages, 5 figures
将基于模型的控制与多智能体强化学习相结合以实现多智能体协作团队策略
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Sandia National Laboratories(桑地亚国家实验室)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG
AI总结 提出一种结合多智能体强化学习与模型预测控制的框架(MA-AC-MPC),通过扩展演员-评论家模型预测控制实现安全、动态可行的协作策略,并在追逃场景和异构环境中验证其优于多层感知机模型。
Comments 12 pages, 8 figures, 7 tables
VASO:物理AI智能体的形式可验证自进化技能
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Iowa State University(爱荷华州立大学)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.AI
AI总结 提出VASO框架,通过形式验证引导LLM生成的机器人技能合约自进化,将模型检查的反例转化为文本梯度更新技能合约,无需微调模型权重,在Jackal和四旋翼任务中达到97.2%的形式规范符合率。
Comments Project webpage: https://languagegroundedriskdetection.github.io/ProjectPage/vaso-webpage/
一种新型四元数关节缆驱动冗余机械臂配置及其通过FABRIK和残差强化学习的控制
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出一种4段8关节四元数关节缆驱动冗余机械臂配置,并利用残差强化学习实现比FABRIK算法高三个数量级的位置和方向精度控制。
从运动学到动力学:学习精炼混合计划以实现物理可行的执行
机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 该研究通过连续空间中的强化学习,解决混合计划在物理可行性执行中的问题,通过引入分析二阶约束的马尔可夫决策过程,改进混合规划器生成的一阶轨迹,从而可靠地恢复物理可行性。
通过排名均方误差进行奖励学习
机构 * Calarina Muslimani(卡拉里娜·穆斯林尼) ; Matthew E. Taylor(马修·E·泰勒)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于排名的强化学习方法R4,通过引入新的排名均方误差损失函数,从轨迹-评分对数据中学习奖励函数,并在机器人基准测试中表现出色。
FlowPRO:通过近端偏好优化对流匹配VLA进行无奖励强化微调
机构 * Tencent Robotics X(腾讯机器人X实验室) ; Futian Laboratory(福田实验室) ; Tsinghua University(清华大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 提出FlowPRO框架,通过近端偏好优化(RPRO)和干预-回滚数据收集方法,实现无奖励的离线强化微调,在四类长时程双臂任务中取得最高成功率。
通过强化学习训练一个模型以掌握跨层级的代理行为
机构 * Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。
Comments Accepted to CVPR 2026 as a Highlight
一种基于编码器-解码器的跨传感器自适应方法,用于稀疏应变传感器的表面形状感知
机构 * IEEE
专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO
AI总结 提出一种结合元学习和少样本适应的编码器-解码器架构,实现不同传感器阵列间的跨传感器自适应,显著降低新传感器部署所需的标注数据量和适应时间,将感知误差从23.0 mm降至约4.0 mm。
OSCAR: 面向机器人的全具身骨架条件世界动作模型
机构 * Peking University(北京大学) ; University of Michigan(密歇根大学) ; NVIDIA(英伟达)
专题命中 机器人数据与评测 :robotics(title,abstract);world model(title,abstract);robot policy(abstract);分类 cs.RO
AI总结 提出OSCAR,一种基于动作条件的视频世界模型,通过大规模数据管道和2D骨架渲染统一表示,实现跨机器人具身的泛化,并用于策略评估。
Comments Project page: https://wuzy2115.github.io/oscar-project-page/
Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型
机构 * Open-H-Embodiment Consortium ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学) ; University of Tokyo(东京大学) ; University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) ; University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)
专题命中 机器人数据与评测 :robotics(title,abstract);robot learning(abstract);manipulation(abstract);world model(abstract)
AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。
Comments Project website: https://open-h.github.io/open-h-embodiment/
面向真实3D声纳仿真
机构 * IEEE
专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO
AI总结 本文提出一种模块化架构,结合GPU加速图形引擎与物理声学传播原理,在NVIDIA Isaac Sim中实现基于Water Linked 3D-15传感器的体积3D声纳模型,并通过硬件在环配置验证其有效性。
LadderMan: 学习人形机器人感知爬梯
机构 * Amazon FAR(亚马逊FAR) ; USC(美国南加州大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出LadderMan系统,通过两阶段学习管道和视觉基础模型,使人形机器人能够鲁棒地攀爬多种梯子并在梯子上进行操控。
水下潜水器动力学模型的跟踪控制
专题命中 机器人数据与评测 :robotics(abstract,abstract_cn)
AI总结 针对水下潜水器在SE(3)上的刚体动力学模型,提出一种基于能量的跟踪控制方法,通过新型误差函数使误差系统具有哈密顿结构,并证明渐近收敛性,在BlueROV2上仿真验证。
Flash-WAM:面向世界动作模型的模态感知蒸馏
机构 * Northeastern University(东北大学) ; University of Georgia(佐治亚大学) ; EmbodyX Inc.(EmbodyX公司)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。
HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景
机构 * Ace Robotics(Ace机器人公司) ; CUHK MMLab(香港大学多模态实验室) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV
AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。
T-FunS3D:任务驱动的分层开放词汇3D功能分割
机构 * P4MARS Lab at the Faculty of Aerospace Engineering, Delft University of Technology(代尔夫特理工大学航空航天工程学院P4MARS实验室)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 提出T-FunS3D方法,通过构建开放词汇场景图并利用视觉语言模型,实现任务驱动的分层3D功能分割,在保持性能的同时提升速度和降低内存消耗。
个人AI代理用于相机胶卷VQA
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Korea University(韩国大学) ; Adobe Research(Adobe研究院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 本文提出camroll数据集和camroll-agent代理,通过层次化记忆和工具集解决个人相机胶卷中的长程、高度个性化的视觉问答问题。
Comments Project page, code, and demo: https://thaoshibe.github.io/camroll
学习预测性视觉-运动协调
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Georgia Tech(佐治亚理工学院) ; Meta AI
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 本文提出了一种基于预测的视觉-运动协调建模任务,通过结合第一人称视觉和运动学观测预测头部姿态、目光方向和上半身运动,展示了多模态整合在理解视觉-运动协调中的重要性。
Comments CVPR 2026 Findings
DragOn:基于拖拽的GUI交互基准与数据集
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 针对GUI代理在拖拽操作(如拖放、滑动、高亮)上的性能不足,提出DragOn基准和训练数据集,涵盖文本高亮、单元格选择、元素缩放和滑块操作四个领域,包含28.6万张训练截图和350万个训练任务,评估了多个模型并显示数据集能提升下游任务性能。
Journal ref Published as a workshop paper at SCALE - 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
CogManip: 在大语言模型多轮交互中操控行为的基准测试
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; BrainCog AI Lab, CASIA(CASIA脑认知人工智能实验室) ; Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) ; Beijing-AISI(北京人工智能研究所) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 提出CogManip基准,通过1000个多轮交互场景评估15种操控策略风险,发现前沿模型存在显著风险异质性,并揭示提示工程防御的重要性。
UltraVR:面向证据推理的诊断性超分辨率图像VQA基准
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; BC Cancer Agency(不列颠哥伦比亚癌症中心) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 提出UltraVR基准,通过结构化思维链标注诊断视觉语言模型在超分辨率图像上的证据推理能力,发现模型在证据定位和局部感知环节错误集中。
Comments 10 pages, 1 figure
CityRAG: 通过空间感知的视频生成进入城市
机构 * Google(谷歌) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 CityRAG通过利用地理注册数据的大型语料库,生成空间一致且可导航的真实环境视频,其核心方法是结合学习的先验知识和时空不一致训练数据,以实现复杂的运动和外观变化。
Comments Project page: cityrag.github.io
全球跨模态地理定位:一个百万级数据集和一个物理一致性学习框架
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) ; First Surveying and Mapping Institute of Hunan Province(湖南省第一测绘院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 本文提出CORE数据集和PLANET框架,用于解决全球跨模态地理定位问题,通过大规模数据和物理一致性学习提升定位的鲁棒性和全球适用性。