arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3082 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3082 篇

2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 81%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15142 2026-08-11 cs.AI cs.LG 版本更新 81%

Concept-Guided Spatial Regularization for World Models in Atari Pong

《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。

Comments Revised manuscript with updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07408 2026-08-10 cs.CV cs.LG 新提交 81%

Addressable Memory for Video World Models

视频世界模型的可寻址内存

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Vector Institute(矢量研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。

Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 81%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06799 2026-08-10 cs.RO cs.CV 新提交 81%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06706 2026-08-10 cs.LG cs.AI 新提交 81%

Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection

对决世界模型:用于共模干扰项抑制的优势式动作通道

Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。

Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08991 2026-08-07 cs.CV cs.LG 版本更新 81%

Deterministic World Models for Closed-loop Reachability Analysis of End-to-End Vision-based Control

确定性世界模型用于闭环视觉系统验证

Yuang Geng, Zhongzheng Zhang, Chengzhen Jiang, Yanru Li, Xinyang Wang, Zhuoyang Zhou, Hoang-Dung Tran, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出确定性世界模型,通过直接映射系统状态到生成图像,消除不可解释的潜在变量,提升闭环视觉系统验证的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新 81%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 具身推理 :manipulation(title);robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 81%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03211 2026-08-05 cs.CV cs.RO 新提交 81%

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

CrossScope:用于联合双视野手术视频预测的角色非对称世界模型

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对母子ERCP中双柔性镜无校准立体关系的手术视频预测问题,提出角色非对称的CrossScope双流模型,经配对双视野基准评估,其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 81%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新 81%

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 81%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10135 2026-07-27 cs.CV cs.AI 版本更新 81%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 81%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 81%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 81%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 81%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07996 2026-07-21 cs.CV cs.RO 版本更新 81%

3D and 4D World Modeling: A Survey

3D和4D世界建模:一项综述

Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该综述针对世界建模中对3D和4D表示利用不足及定义分类缺失的问题,通过建立精确概念、引入结构化分类法,系统总结相关数据集和评估指标,讨论应用、挑战与方向,为3D和4D世界建模领域提供基础参考。

Comments Survey; Project Page at https://worldbench.github.io/survey GitHub Repo at https://github.com/worldbench/awesome-3d-4d-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 81%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14180 2026-07-17 cs.LG cs.AI 新提交 81%

RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences

RENEW:迈向从偏好中学习世界模型并修复模型利用问题

Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian Ramamoorthy

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对世界模型在数据覆盖薄弱时易受模型利用问题,提出从人类反馈中学习动力学(DLHF),但朴素DLHF样本效率低,于是引入RENEW利用认知不确定性聚焦微调,经实验评估,RENEW提高样本效率等,为解决离线模型强化学习利用问题提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29059 2026-07-17 cs.CV cs.AI 版本更新 81%

Flow Matching in Feature Space for Stochastic World Modeling

特征空间中的流匹配用于随机世界建模

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

机构 * FAIR at Meta(Meta的FAIR)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出FlowWM,在预训练特征空间中直接进行流匹配,通过可微一步投影机制实现高效训练,在合成和真实基准上提升感知性能、模式覆盖和时域鲁棒性。

Comments 24 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13612 2026-07-16 cs.LG cs.AI 新提交 81%

The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models

作为变分自由能的SIGReg目标:JEPA世界模型的理论主动推理解释

Fabio Arnez, Alexandra Gomez-Villa

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学,法国国家科学研究中心,List研究所) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究JEPA世界模型,通过将四个正则化器组织成层次结构,证明选择抗坍缩正则化器决定训练目标是否为有效AIF变分自由能,在特定条件下SIGReg有优势,还扩展对应关系并确定未计算的AIF项。

Comments Theoretical paper; empirical validation of the stated predictions is left to separate work. 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 81%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04464 2026-07-16 cs.LG cs.AI 版本更新 81%

Operator-on-F complements value-equivalence: a planning-time diagnostic for latent world models

算子对F补充值等价性:潜在世界模型的规划时诊断

Donna Vakalis

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于模型的强化学习中世界模型评估问题,引入算子对F诊断,通过模型自身预测器比较模型与环境的k步潜在前推,揭示其与规划回报的强关联及在跨架构比较中的作用,补充而非替代值等价性诊断。

Comments Accepted at RLC 2026 WM Workshop. V2 places the diagnostic in Koopman representation theory; references expanded. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18315 2026-07-15 cs.LG cs.AI 版本更新 81%

Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task

更高的嵌入维度为简单排序任务创建更强的世界模型

Brady Bhalla, Honglu Fan, Nancy Chen, Tony Yue YU

机构 * California Institute of Technology(加利福尼亚理工学院) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习训练的变压器中嵌入维度对内部“世界模型”的影响,发现更高维度能产生更好的内部表示,经数百实验观察到两种机制,结果证明变压器构建结构化内部世界模型且模型大小可提升表示质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10630 2026-07-14 cs.RO cs.AI 新提交 81%

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

作为对手的世界模型:用于鲁棒运动规划的多智能体自我博弈微调

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究在密集交通中自动驾驶车辆鲁棒运动规划问题,提出对抗世界建模(AWM)框架,通过多智能体自我博弈微调,引入解耦求解器,经实验验证该方法能生成可转移对抗交互,使规划器在多种场景有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09185 2026-07-13 cs.CV cs.RO 新提交 81%

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

用于具身动作条件世界模型的因果去偏潜行动模型

Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

机构 * Aether AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对动作条件世界模型学习需大量标记数据的问题,提出基于潜行动模型的因果去偏框架CD-LAM,通过三个微调目标改进模型,提升了潜行动可控性等多方面性能,减少了机器人动作适应更新次数。

详情

展开后加载摘要…

URL PDF HTML 收藏