FedWorld: Scope-Aware Federation of Agent World Models
FedWorld:感知范围的智能体世界模型联邦
专题命中 具身推理 :world model(title)
AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
FedWorld:感知范围的智能体世界模型联邦
专题命中 具身推理 :world model(title)
AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 具身推理 :world model(title)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
LLM智能体能否推断世界模型?来自智能体自动机学习的证据
机构 * The Hebrew University of Jerusalem(海法大学) ; New York University(纽约大学) ; Google Research(谷歌研究)
专题命中 具身推理 :world model(title)
AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
ViewMind3D:用于无需训练的3D问答的模块化视图感知推理
专题命中 具身推理 :embodied AI(abstract);robotic(abstract);分类 cs.CV
AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。
面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理
机构 * Heritage Institute of Technology(遗产技术学院) ; Kalyani Government Engineering College(卡利亚尼政府工程学院) ; IAIRO ; Intel Corporation(英特尔公司)
专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。
Comments 14 pages
LAVIFT:用于手术交互识别的潜在动作引导视觉微调
机构 * Arizona State University(亚利桑那州立大学) ; University of California, Merced(加州大学默塞德分校) ; Intel Corporation(英特尔公司)
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV
AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。
EAGOR:全方位的具身推理
机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)
专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.RO
AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。
Comments 12 Pages, 7 Figures, 4 Tables
SpaceEra++: 面向视频中3D空间推理的统一框架
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Shenzhen Loop Area Institute(深圳河套学院) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; City University of Hong Kong(香港城市大学)
专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.CV
AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。
Comments Accepted by IEEE TPAMI 2026
PhysiFormer: 在世界空间中学习模拟力学
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV
AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。
Comments Project page: https://yimingc9.github.io/physiformer
GRAFT: 基于部件对应的图结构功能迁移
机构 * Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达)
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出GRAFT框架,利用部件级图表示和几何感知对应,通过单次演示实现零样本操作迁移,解决泛化到未见物体的挑战。
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 8746-8755
面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应
机构 * The University of Manchester(曼彻斯特大学) ; International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) ; Delft University of Technology(代尔夫特理工大学) ; Newcastle University(纽卡斯尔大学)
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO
AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。
Faster-WAM:世界动作模型需要深度动作模块吗?
机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; Huawei Celia Team(华为Celia团队) ; Labs(2012实验室)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。
ABot-World-0:在单台桌面GPU上进行无限交互式世界展开
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。
基于自主虚拟现实的危险环境态势感知风险检测
机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。
Comments 7 Pages, Accepted to RO-MAN 2026
DPNeXt:用于基于高效视觉Transformer的多任务密集预测的轻量级多尺度特征融合框架
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)
专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对机器人感知系统多任务学习中现有解码策略瓶颈,提出DPNeXt框架,用双深度可分离倒置瓶颈及MTBG策略,在多任务密集预测上表现出色,相比DPT大幅减少参数并提升推理速度。
Comments 8 pages, 5 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
Qantara:用于多范式联合嵌入预测架构控制的桥流训练
机构 * T-Tech
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 研究针对联合嵌入预测架构(JEPAs)单一推理范式问题,提出Qantara,通过端到端联合训练目标,同一检查点服务三种推理范式,提升控制性能,推动JEPAs从单范式规划器向多范式控制器转变。
Comments 16 pages, 3 figures, 6 tables. Project page: https://corl-team.github.io/qantara
快速LeWorldModel
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。
智能体模型批判
机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。
网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock
机构 * Diastole Medical R&D(Diastole医疗研发机构)
专题命中 具身推理 :world model(abstract,comments);分类 cs.CV、cs.LG
AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。
Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)
ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:探索基于查询的分割和增加空间上下文用于户外场景理解
机构 * Rey Juan Carlos University(胡安卡洛斯国王大学)
专题命中 具身推理 :robotics(abstract,comments);分类 cs.RO、cs.CV
AI总结 本报告提出基于SegFormer和Mask2Former的细粒度语义分割方法,通过增大训练裁剪尺寸和测试时增强,在GOOSE挑战赛上达到69.6% mIoU,验证了查询式分割和空间上下文的重要性。
Comments Ranked 5th in the GOOSE 2D Fine-Grained Semantic Segmentation Challenge at the IEEE ICRA 2026 Workshop on Field Robotics
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
语义辐射场作为真实场景空间推理的模拟器
机构 * Leipzig University(莱比锡大学) ; Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) ; Wrocław University of Economics(弗罗茨瓦夫经济大学)
专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。
Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation
FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地
专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。
Comments Under review. 15 Pages. 9 tables, 3 Figures
R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆
机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV
AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。
Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering
CosmosAlign:适配世界基础模型用于生成式交通视频预测
机构 * Simon Fraser University(西蒙菲莎大学) ; Institut Polytechnique de Paris(巴黎综合理工学院)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV
AI总结 该研究提出基于Cosmos3-Nano的CosmosAlign框架,通过两阶段LoRA适配与推理优化,在AI City Challenge 2026 Track 5基准中获76.49分排名第一,实现了高质量交通视频预测。
Comments Accepted at ECCVW 2026
SG-Layout:基于结构化场景图引导的大语言模型布局生成方法
机构 * Chongqing University(重庆大学)
专题命中 具身推理 :robotic(abstract);分类 cs.AI、cs.CV
AI总结 SG-Layout通过两阶段训练将结构化空间知识融入LLMs,在三类任务中提升了空间推理与几何一致性,尤其适配关系密集的复杂场景。
Comments 16 pages, 5 figures. Accepted at WAICA 2026
多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。
多时间尺度一致性即几何:潜在动力学何时收缩,何时不收缩
机构 * Vishwakarma Institute of Technology(维斯瓦卡玛理工学院)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 研究视频预测器和世界模型中多时间尺度潜在一致性权重λ对过渡几何的作用,通过实验测量L20,q95和E20等指标,发现λ能改善移动MNIST数据集相关指标,且软一致性作用有域限制,还得出随机强迫定律统一控制域。
Comments 22 pages, 9 figures. Diagnostic study of multi-horizon latent consistency, expansion proxies (L20), and a stochastic-forcing law for world-model geometry. Code and experiment logs to be released publicly