arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-15 至 2026-07-15 共收录 8 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2510.18315 2026-07-15 cs.LG cs.AI 版本更新 90%

Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task

更高的嵌入维度为简单排序任务创建更强的世界模型

Brady Bhalla, Honglu Fan, Nancy Chen, Tony Yue YU

机构 * California Institute of Technology(加利福尼亚理工学院) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究在强化学习训练的变压器中嵌入维度对内部“世界模型”的影响,发现更高维度能产生更好的内部表示,经数百实验观察到两种机制,结果证明变压器构建结构化内部世界模型且模型大小可提升表示质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11673 2026-07-15 cs.CV 版本更新 88%

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

ABot-3DWorld 0:一个用于探索任意 3D 空间的通用世界模型

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 介绍 ABot-3DWorld 0 通用多模态 3D 世界模型,核心是 SGP,通过特定流程将多模态输入转换为 3D 世界,用于通用 3D 内容创建,在开源方法中领先,多模态输入下场景保真度更高。

Comments Official Page: https://abot-world.amap.com/plaza

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13017 2026-07-15 cs.RO cs.CV 新提交 82%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 通用世界模型 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 69%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 69%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12963 2026-07-15 cs.AI 版本更新 69%

Calculating Mutual Information between a Reward Maximizer and its Environment

信息论视角下最优奖励最大化世界模型的分析

Alfred Harwood, Jose Faustino, Alex Altair

机构 * Dovetail Research(Dovetail研究公司) University of Sao Paulo(圣保罗大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文从信息论角度分析了最优奖励最大化中世界模型的信息量,证明最优策略对环境的信息量为n log m比特,并适用于多种奖励最大化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01898 2026-07-15 cs.LG cs.AI stat.ML 版本更新 69%

Propheticus: Machine Learning Framework for the Development of Predictive Models for Reliable and Secure Software

Propheticus:用于开发可靠安全软件预测模型的机器学习框架

João R. Campos, Marco Vieira, Ernesto Costa

机构 * DEI/CISUC, University of Coimbra,\ Portugal

专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);分类 cs.AI、cs.LG

AI总结 针对软件可靠性与安全性需求,介绍Propheticus机器学习框架,抽象其复杂性以便用户使用,通过漏洞预测和在线故障预测两个案例研究,展示该框架能简化并加速机器学习工作流程。

Comments Accepted for publication in the 30th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶 1 篇

2607.11964 2026-07-15 cs.LG 新提交 88%

LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving

LIDAR-AD:一种用于自动驾驶的无解码器潜在交互梦想家与动作残差链

Yongzhi Liu, Yang Xiao, Zhong Cao, Zeng Kang, Sunan Zhang, Zhaozhi Dong, Guojun Yu, Weichao Zhuang

机构 * School of Mechanical Engineering, Southeast University(东南大学机械工程学院) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Xheart Technology Co., Ltd.(芯驰科技有限公司)

专题命中 自动驾驶 :world model(abstract);world models(abstract);world-model(abstract);world model(abstract)

AI总结 研究针对自动驾驶中多源观测冗余问题,提出LIDAR-AD,用减少冗余的潜在对齐取代观测重建,将车辆控制建模为残差动作更新,经实验验证其在模拟场景和现实布局下性能优异,能提升风险感知等能力。

详情

展开后加载摘要…

URL PDF HTML 收藏