A Nested U-Structure for Instrument Segmentation in Robotic Surgery
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
专题命中 具身推理 :robotics(title,abstract);robotic(abstract);分类 cs.RO
专题命中 具身推理 :robotic(title,abstract);manipulation(abstract);分类 cs.RO
Comments Presented at IROS 2021. Video is at https://youtu.be/FuqMxuODGlw
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.AI
Comments Accepted for IJCAI
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO
Comments Manuscript currently under review
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI
Comments NeurIPS Workshop on Emergent Communication
更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。
Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026
基于JEPA世界模型的价值引导动作规划
机构 * École Polytechnique(巴黎高等理工学院) ; ENS Paris(巴黎高等师范学院) ; New York University(纽约大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出了一种基于JEPA世界模型的价值引导动作规划方法,通过塑造表示空间提升规划性能。
Comments Presented as a poster at the World Modeling Workshop 2026, Mila
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract,comments)
Comments Accepted at NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI
你所需要的只是能量引导吗?用于驱动世界模型的无训练规范注入
机构 * Institute of Automotive Technology, Technical University of Munich(慕尼黑工业大学汽车技术研究所)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV;robotics(comments)
AI总结 研究基于大型视频扩散主干的驾驶世界模型难以控制的问题,提出通过可微能量函数在采样时操控规划轨迹,无需重新训练主干,以Open-Sora 2.0 MM-DiT主干模型为例验证,指出跨流耦合是端到端可控关键。
Comments Accepted to Robotics: Science and Systems 2026 Robot World Models Workshop
SNOW:基于世界知识的时空场景理解用于开放世界具身推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 具身推理 :robotics(abstract);navigation(abstract);world model(abstract);robotic(abstract)
AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。
基于互联网规模知识的自监督行动预测具身推理
机构 * Stanford(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 具身推理 :manipulation(abstract,abstract_cn);navigation(abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)
AI总结 本文提出R&B-EnCoRe方法,通过自监督细化使模型从互联网知识中自推导具身推理策略,提升动作执行和导航性能,减少碰撞率。
Comments Robotics: Science and Systems (RSS) 2026
被动对象状态世界模型中运动学、接触和物体恒存场的事件条件诊断
机构 * College of Intelligent Robitcs and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出一种诊断协议,测试被动对象状态世界模型中的隐式物理场是否按事件类型组织,并验证场对齐表示对预测的功能影响。
支持种群规模扩展的多智能体世界建模
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。
Comments Technical report. Project page: https://rhos.ai/research/khora. Online demo: https://ophilus.ai/khora
TaskSense:聚焦世界模型中的关键内容
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 TaskSense是一种以任务为中心的世界建模框架,通过可微随机空间注意力机制结合辅助逆动力学目标,提升了视觉控制模型对干扰环境的鲁棒性,在Distracting Control Suite上性能优于DreamerV3。
世界建模,何去何从?
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本研究提出以智能体为中心的交互式世界代理,将世界建模范式从物理状态转换转向智能体可用信息转换,划分六种代理类型与三个赋能层面,为构建赋能智能体的世界代理建立路线图。
Comments Technical Blog at https://worldbench.github.io/awesome-agentic-world-model GitHub Repo at https://github.com/worldbench/awesome-agentic-world-model
ShadowDancer:通过从视频及其阴影中学习统一动力学表示,赋予视频世界模型任意动作控制能力
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 ShadowDancer通过阴影对与跨阴影预测学习统一动力学表示,实现视频世界模型的任意动作帧级控制,在多动力学族上的动作迁移与长回放性能优于基线,平均盲胜率达86%。
Comments https://ShadowDancer-1.github.io
心理世界建模
专题命中 具身推理 :world model(title,abstract)
AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。
Comments project website: https://mental-world.github.io/
物理空间中相邻集的动作优于世界模型中的最佳预测
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。
Comments 26 pages, 7 figures. Includes supplementary material
深度正则化JEPA世界模型从真实户外机器人数据中学习更多可转移表示
机构 * Aigen(爱igen)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 研究针对从真实户外机器人数据学习世界模型的挑战,引入深度作为训练几何先验,结合SIGReg等方法,训练18M参数模型,实验表明该方法在降低视觉里程计误差、增加意外分数分离及提高多步展开保真度等方面有显著提升,增强了模型泛化能力。
Comments 13 pages, 3 figures
基于表示自编码器的多智能体交互世界模型
机构 * Epic Games ; École nationale des ponts et chaussées(法国国家桥梁与道路学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。
Comments Technical report
通过电磁世界模型实现超表面的具身智能
专题命中 具身推理 :world model(title,abstract);manipulation(abstract)
AI总结 提出超表面具身智能通过世界模型(metaEI-WM)范式,集成语义环境建模与电动力学先验,理解电磁动力学,优化编码配置塑造电磁环境,实现复杂场景中多种无线任务自动化。
Comments 85 pages, 15 figures
DynaVieW:用于理解分层视觉动态的模式引导世界建模
机构 * EPFL, Switzerland(瑞士联邦理工学院) ; Harvard University(哈佛大学) ; Sony Group Corporation(索尼集团) ; ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。
Comments ICML 2026
使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移
机构 * NVIDIA
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。
Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU
Driver-WM:以驾驶员为中心的交通条件潜在世界模型用于车内动态展开
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Hubei University, Wuhan, China(湖北大学,武汉,中国) ; Osaka University, Osaka, Japan(大阪大学,大阪,日本)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出Driver-WM,一种以驾驶员为中心的潜在世界模型,通过门控因果注入机制在紧凑潜在空间中联合预测驾驶员物理运动、行为和情感,实现外部交通到内部动态的因果展开。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). This version includes the supplementary material
世界模型中的幻觉是可预测且可预防的
机构 * UC San Diego(加州大学圣迭戈分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。
Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
循环世界模型
机构 * FaceMind Research Asia
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出循环世界模型(LoopWM),通过参数共享的Transformer块迭代细化潜在环境状态,实现高达100倍参数效率,并建立迭代潜在深度作为世界模拟的新缩放轴。
Comments Technical Report
机器中的人类认知:世界模型的统一视角
机构 * Northeastern University(东北大学) ; EmbodyX Inc.(EmbodyX公司) ; Tulane University(路易斯安那州立大学) ; Cornell University(康奈尔大学) ; University of Georgia(佐治亚大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出统一框架整合记忆、感知等认知功能,指出动机和元认知研究不足,并引入认知世界模型新类别。