arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 28 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 28 篇

2607.04652 2026-07-07 cs.RO 新提交 88%

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

KAM-WM:基于潜在世界模型的机器人操作运动学可供性地图

Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 具身推理 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 研究如何从少量演示中学习操作,提出KAM-WM框架,从冻结的潜在视频世界模型提取粗粒度方向交互线索,转化为运动学可供性地图,结合其他信息控制机器人,在实验中取得较好成果。

Comments 16 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 86%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 86%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04409 2026-07-07 cs.LG 新提交 85%

Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling

通过协同能动探索和结构化建模学习任务充分的世界模型

Fan Feng, Yujia Zheng, Minghao Fu, Yongqiang Chen, Guangyi Chen, Kevin Murphy, Biwei Huang, Kun Zhang

机构 * UCSD(加州大学圣地亚哥分校) MBZUAI(Mubarakzai Institute of Artificial Intelligence) CMU(卡内基梅隆大学) UBC(不列颠哥伦比亚大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 研究如何让智能体学习特定于任务、最小且足以决策的世界模型表示,通过智能体与世界模型闭环协同,智能体主动探索收集信息轨迹,世界模型学习结构化表示,提升样本效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28865 2026-07-07 cs.LG cs.AI 版本更新 84%

Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision

无需语言监督的物理交互中世界模型中的涌现语义表征

Jiayi Fang

机构 * Independent Researcher(独立研究者)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 通过无语言监督的物理探索训练VAE世界模型,发现其潜在空间自发形成与物理几何结构对齐的语义结构,且预测性能与语义对齐共同提升,验证了物理几何作为世界模型表征的组织原则。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 83%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02634 2026-07-07 eess.SP 新提交 82%

Metasurface embodied intelligence through electromagnetic world model

通过电磁世界模型实现超表面的具身智能

Che Liu, Zhenhao Fu, Qian Ma, Jiajing Wu, Wen Ming Yu, Lianlin Li, Tie Jun Cui

专题命中 具身推理 :world model(title,abstract);manipulation(abstract)

AI总结 提出超表面具身智能通过世界模型(metaEI-WM)范式,集成语义环境建模与电动力学先验,理解电磁动力学,优化编码配置塑造电磁环境,实现复杂场景中多种无线任务自动化。

Comments 85 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04112 2026-07-07 cs.LG cs.AI cs.CL cs.CV 新提交 82%

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

DynaVieW:用于理解分层视觉动态的模式引导世界建模

Silin Gao, Hao Zhao, Zeming Chen, Sepideh Mamooler, Antara Raaghavi Bhattacharya, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji, Li Mi, Syrielle Montariol, Antoine Bosselut

机构 * EPFL, Switzerland(瑞士联邦理工学院) Harvard University(哈佛大学) Sony Group Corporation(索尼集团) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 82%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01736 2026-07-07 cs.LG cs.AI cs.SY eess.SY 新提交 81%

Predicting Closed-Loop Performance of Latent World Models: Offline Checkpoint Selection for MPC and Model-Based RL Under Non-Markovian Rewards in LunarLander

预测潜在世界模型的闭环性能:用于MPC和基于模型的强化学习的离线检查点选择,在非马尔可夫奖励的LunarLander中

Nikolai Smolyanskiy

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一套基于最优控制理论的结构化验证时诊断指标,用于从离线检查点中预测潜在世界模型的闭环性能,其中复合奖励可观测性分数(CROF)在LunarLander任务上有效选择检查点,显著提升MPC和基于模型的强化学习性能。

Comments Preprint, 19 pages (16 main text + 3 pages appendix), 7 figures, 4 tables. Video: https://youtu.be/4PxHFW_TYUw , Code: https://github.com/nsmoly/LunarLander_RSSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08029 2026-07-07 cs.LG cs.CV 版本更新 81%

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04500 2026-07-07 cs.CV 新提交 79%

Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models

在零标签JEPA驾驶世界模型中,地理多样性优于数据量用于跨域泛化

Santosh Jaiswal

机构 * Pittsburgh, Boston, Singapore(匹兹堡、波士顿、新加坡) Miami and Austin(迈阿密和奥斯汀)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 研究基于JEPA的世界模型在不同地理区域数据训练后对未见城市和传感器配置的泛化能力,通过控制转移实验发现地理多样数据训练的模型泛化性显著更好,地理多样性比原始数据量更能预测跨域泛化。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31422 2026-07-07 cs.AI 新提交 79%

Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

行动前先询问世界:预算受限的环境探测用于世界模型校准

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出预算受限的环境探测算子,通过结构化信念表在行动前校准世界模型,减少长期任务中的终端误差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27806 2026-07-07 cs.AI 新提交 79%

Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27780 2026-07-07 cs.AI 新提交 79%

Understanding Rollout Error in Graph World Models

理解图世界模型中的展开误差

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文研究图世界模型中的长时域展开误差,提出统一框架分析拓扑与模型引起的误差放大,并设计误差感知图世界模型,通过谱正则化、展开一致性和关键节点加权防止长时域发散。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12471 2026-07-07 stat.ML cs.CL cs.ET cs.LG 新提交 79%

Identifiability Without Gaussianity: Symbolic World Models and Near-Infinite Temporal Consistency

无高斯假设的可识别性:符号世界模型与近无限时间一致性

Seth Dobrin, Łukasz Chmiel

机构 * Department of Computer Science, Stanford University(1 计算机科学系,斯坦福大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出物理基础符号架构(PGSA),证明其在非高斯动态系统中实现精确线性可识别性和近无限时间一致性,克服了统计世界模型的高斯边界限制。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03942 2026-07-07 eess.SY cs.SY 新提交 78%

ThermoForce: A Physics-Structured Interventional World Model for Building HVAC Control

ThermoForce:用于构建暖通空调控制的物理结构干预世界模型

Yifan Wang

专题命中 具身推理 :world model(title,abstract)

AI总结 研究建筑暖通空调系统模型预测控制所需的热模型问题。提出ThermoForce,将时间序列基础模型冻结为被动自由响应,学习物理结构的强制响应算子,在相关干预中表现出色,嵌入MPC可降低热不适与能耗。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02542 2026-07-07 cs.AI cs.CV 新提交 73%

iFLYTEK-Embodied-Omni Technical Report

科大讯飞-具身全能技术报告

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

机构 * iFLYTEK LindenBot University of Science and Technology of China(中国科学技术大学)

专题命中 具身推理 :embodied agent(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04978 2026-07-07 cs.LG cs.CV cs.RO 新提交 67%

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control

Qantara:用于多范式联合嵌入预测架构控制的桥流训练

Ruslan Rakhimov, George Bredis, Yuriy Maksyuta, Daniil Gavrilov

机构 * T-Tech

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对联合嵌入预测架构(JEPAs)单一推理范式问题,提出Qantara,通过端到端联合训练目标,同一检查点服务三种推理范式,提升控制性能,推动JEPAs从单范式规划器向多范式控制器转变。

Comments 16 pages, 3 figures, 6 tables. Project page: https://corl-team.github.io/qantara

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16533 2026-07-07 cs.AI cs.CV 新提交 62%

Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI

Kairos: 面向物理AI的原生世界模型栈

Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu, Zeyu Liu, Cong Wan, Pu Li, Ruiqing Yang, Xiaoou Li, Wei Wang, Kangkang Zhu, Yuwei Zhang, Shi Fu, Zheng Zhang, Xiaoning Wu, Xuzeng Fan, Dacheng Tao, Xiaogang Wang

机构 * Kairos Team(Kairos团队)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。

Comments Kairos Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02846 2026-07-07 cs.AI 新提交 57%

Object-Centric Environment Modeling for Agentic Tasks

用于智能任务的以对象为中心的环境建模

Yiyang Li, Tianyi Ma, Zehong Wang, Yijun Ma, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01767 2026-07-07 cs.AI 新提交 57%

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

修复放大器,而非症状:面向智能体轨迹的稳定世界模型修正

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 针对长流程规划中的图级错误,提出WM-SAR方法,通过子图放大反向定位因果子图进行修复,在有限token预算下优于传统扫描修复方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31399 2026-07-07 cs.AI 新提交 57%

World-Model Collapse as a Phase Transition

世界模型崩溃作为相变

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究长时域语言代理隐式世界模型中的相变现象,通过确定性任务族的大规模网格搜索揭示从解决平台到崩溃的相图,并证明世界状态保真度先于动作有效性失效。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01134 2026-07-07 cs.AI 版本更新 57%

To Use AI as Dice of Possibilities with Timing Computation

将AI用作带有时序计算的可能性骰子

Jia Li, Vipin Kumar, Rui Zhang

机构 * Department of Surgery, University of Minnesota(明尼苏达大学外科系) Department of Computer Science & Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出基于动词的范式,定义时序计算和可能性,使AI能作为实现思维语法的工具,并在乳腺癌患者数据上自动发现临床轨迹和反事实时序推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23148 2026-07-07 cs.AI 57%

On Sample-Efficient Generalized Planning via Learned Transition Models

基于学习转移模型的高效通用规划

Nitin Gupta, Vishal Pallagani, John A. Aydin, Biplav Srivastava

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出通过学习转移模型实现高效通用规划,通过显式建模领域动态,相比直接预测动作序列,在多个领域中以更少样本和更小模型获得更高的离分布满足计划成功率。

Comments 14 pages; Extended version of short paper accepted at ICAPS 2026; updated with results and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 57%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :robot learning(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13742 2026-07-07 cs.HC 版本更新 50%

Spatial Balancing: Designing an LLM-Powered Spatial Externalization Interface for Iterative Science Communication Writing

空间平衡:利用空间推理在LLM辅助科学传播写作中平衡科学阐述与叙述吸引力

Kexue Fu, Jiaye Leng, Yawen Zhang, Jingfei Huang, Yihang Zuo, Runze Cai, Zijian Ding, Ray LC, Shengdong Zhao, Qinyuan Lei

专题命中 具身推理 :navigation(abstract)

AI总结 本文提出SpatialBalancing系统,通过结合人类空间推理与大语言模型的语义能力,提升科学传播写作中科学严谨性与叙述吸引力的平衡。

Comments DIS '26

Journal ref In Designing Interactive Systems Conference (DIS '26), June 13-17, 2026, Singapore, Singapore. ACM, New York, NY, USA, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏