arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 335 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 335 篇

2607.23602 2026-07-28 cs.RO cs.AI cs.LG 新提交 82%

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models

物理空间中相邻集的动作优于世界模型中的最佳预测

Liangyu Li, Qingwen Liu, Mingqing Liu

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。

Comments 26 pages, 7 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16314 2026-07-21 cs.CV cs.LG cs.RO 新提交 82%

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

深度正则化JEPA世界模型从真实户外机器人数据中学习更多可转移表示

Usman M. Khan

机构 * Aigen(爱igen)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对从真实户外机器人数据学习世界模型的挑战,引入深度作为训练几何先验,结合SIGReg等方法,训练18M参数模型,实验表明该方法在降低视觉里程计误差、增加意外分数分离及提高多步展开保真度等方面有显著提升,增强了模型泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 82%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02634 2026-07-07 eess.SP 新提交 82%

Metasurface embodied intelligence through electromagnetic world model

通过电磁世界模型实现超表面的具身智能

Che Liu, Zhenhao Fu, Qian Ma, Jiajing Wu, Wen Ming Yu, Lianlin Li, Tie Jun Cui

专题命中 具身推理 :world model(title,abstract);manipulation(abstract)

AI总结 提出超表面具身智能通过世界模型(metaEI-WM)范式,集成语义环境建模与电动力学先验,理解电磁动力学,优化编码配置塑造电磁环境,实现复杂场景中多种无线任务自动化。

Comments 85 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04112 2026-07-07 cs.LG cs.AI cs.CL cs.CV 新提交 82%

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

DynaVieW:用于理解分层视觉动态的模式引导世界建模

Silin Gao, Hao Zhao, Zeming Chen, Sepideh Mamooler, Antara Raaghavi Bhattacharya, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji, Li Mi, Syrielle Montariol, Antoine Bosselut

机构 * EPFL, Switzerland(瑞士联邦理工学院) Harvard University(哈佛大学) Sony Group Corporation(索尼集团) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27326 2026-06-26 cs.LG cs.CV cs.RO 新提交 82%

Hallucination in World Models is Predictable and Preventable

世界模型中的幻觉是可预测且可预防的

Nicklas Hansen, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。

Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 82%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18208 2026-06-17 cs.LG cs.AI cs.CL cs.CV 新提交 82%

Looped World Models

循环世界模型

Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu, Hao Yang, Ronglai Zuo, Tongda Xu, Yonghao Li, Jian Chen, Hebin Wang, Zeyu Gao, Yang Li, Wei Zhao, Qimin Zhong, Siqi Liu, Yumeng Zhang, Leyan Cui, Zhangyu Wang, Wai Lam

机构 * FaceMind Research Asia

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出循环世界模型(LoopWM),通过参数共享的Transformer块迭代细化潜在环境状态,实现高达100倍参数效率,并建立迭代潜在深度作为世界模拟的新缩放轴。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 82%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract)

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09028 2026-06-09 cs.CV cs.AI cs.RO 新提交 82%

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models

ATM:用于诊断和改进潜在世界模型的动作一致性转移矩阵

Jiaheng Chen

机构 * School of Software, Northeastern University(东北大学软件学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出ATM矩阵,通过轻量级探针比较真实与预测潜在转移中的动作信息,无需模拟器即可诊断世界模型质量,并引入AITS利用动作可识别性作为训练信号提升下游规划。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13518 2026-08-14 cs.LG cs.CV 新提交 82%

Intervention-Aware Clinical World Model for Post-Op Outcome Forecasting in Cardiology

面向心脏病术后结局预测的干预感知临床世界模型

Yunsung Chung, Yingshuo Liu, Abboud F. Hassan, Han Feng, Mary M. Maleckar, Nassir Marrouche, Jihun Hamm

机构 * Tulane University(杜兰大学) Simula Research Laboratory(Simula研究实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究针对心脏病术后结局预测的不规则轨迹问题,提出干预感知临床世界模型,在DECAAF-II数据集上实现心房颤动消融后复发预测及疤痕范围估计的良好性能。

Comments Medical World Models (MWM) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14022 2026-08-17 cs.CV cs.AI 新提交 81%

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

机构 * CUHK(香港中文大学) Tencent PCG(腾讯平台与内容事业群) FDU(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 81%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 81%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07408 2026-08-10 cs.CV cs.LG 新提交 81%

Addressable Memory for Video World Models

视频世界模型的可寻址内存

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Vector Institute(矢量研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。

Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 81%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06799 2026-08-10 cs.RO cs.CV 新提交 81%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06706 2026-08-10 cs.LG cs.AI 新提交 81%

Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection

对决世界模型:用于共模干扰项抑制的优势式动作通道

Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。

Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 81%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03211 2026-08-05 cs.CV cs.RO 新提交 81%

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

CrossScope:用于联合双视野手术视频预测的角色非对称世界模型

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对母子ERCP中双柔性镜无校准立体关系的手术视频预测问题,提出角色非对称的CrossScope双流模型,经配对双视野基准评估,其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 81%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 81%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 81%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 81%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14180 2026-07-17 cs.LG cs.AI 新提交 81%

RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences

RENEW:迈向从偏好中学习世界模型并修复模型利用问题

Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian Ramamoorthy

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对世界模型在数据覆盖薄弱时易受模型利用问题,提出从人类反馈中学习动力学(DLHF),但朴素DLHF样本效率低,于是引入RENEW利用认知不确定性聚焦微调,经实验评估,RENEW提高样本效率等,为解决离线模型强化学习利用问题提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13612 2026-07-16 cs.LG cs.AI 新提交 81%

The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models

作为变分自由能的SIGReg目标:JEPA世界模型的理论主动推理解释

Fabio Arnez, Alexandra Gomez-Villa

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学,法国国家科学研究中心,List研究所) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究JEPA世界模型,通过将四个正则化器组织成层次结构,证明选择抗坍缩正则化器决定训练目标是否为有效AIF变分自由能,在特定条件下SIGReg有优势,还扩展对应关系并确定未计算的AIF项。

Comments Theoretical paper; empirical validation of the stated predictions is left to separate work. 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 81%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10630 2026-07-14 cs.RO cs.AI 新提交 81%

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

作为对手的世界模型:用于鲁棒运动规划的多智能体自我博弈微调

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究在密集交通中自动驾驶车辆鲁棒运动规划问题,提出对抗世界建模(AWM)框架,通过多智能体自我博弈微调,引入解耦求解器,经实验验证该方法能生成可转移对抗交互,使规划器在多种场景有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏