arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-04 至 2026-08-04 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2607.05238 2026-08-04 cs.AI 版本更新 93%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17102 2026-08-04 physics.pop-ph cs.AI cs.ET cs.HC quant-ph 版本更新 93%

Quantum Cinema: An Interactive Cinematic Exploration of Quantum Computing Hardware via Generative World Models

量子影院:通过生成世界模型对量子计算硬件进行交互式电影探索

Aoyu Zhang, Dongping Liu, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出量子影院,一个基于生成世界模型的开源交互式应用,通过四幕叙事将不可见的量子硬件转化为可探索的电影体验,旨在弥合量子计算与公众之间的想象鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19719 2026-08-04 cs.LG cs.RO 版本更新 92%

Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination

库普曼梦想家:用于稳定世界模型想象的频谱约束潜在动力学

Jiaqi Li, Xinglong Zhang, Haibin Xie, Yixing Lan, Wei Pan, Xin Xu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学与技术学院) School of Engineering, Newcastle University(纽卡斯尔大学工程学院)

专题命中 通用世界模型 :world-model(title);latent dynamics(title,abstract);world-model(title);world model(abstract)

AI总结 研究针对潜在世界模型长期展开中模态持久性和误差积累控制有限的问题,提出库普曼梦想家模型,通过频谱约束潜在动力学核心及多种目标结合优化,推导误差界,实验证明其提高了长期潜在展开稳定性及闭环控制性能。

Comments 20 pages, 13 figures, 11 tables. Revised manuscript with a more concise and precise abstract and improved clarity and presentation throughout the main text. The main technical content, experimental results, and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 90%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21918 2026-08-04 cs.RO 版本更新 88%

Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound

用于机器人超声中目标平面探头引导的动作条件世界模型

Siqi Fan, Mingcong Chen, Ran Liu, Zixuan Yang, Xiaoyu Fu, Xiaoqing Gao, Yunhui Liu, Hongbin Liu

机构 * Department of Mechanical and Automation Engineering, Chinese University of Hong Kong(香港中文大学机械与自动化工程学系) Department of Biomedical Engineering, City University of Hong Kong(香港城市大学生物医学工程学系) Centre for Artificial Intelligence and Robotics Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Surgical and Interventional Engineering, King’s College London(伦敦国王大学外科与介入工程学系) Department of Vascular Ultrasound, Xuanwu Hospital, the Capital Medical University(首都医科大学宣武医院血管超声科)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 研究针对机器人超声目标平面探头引导问题,提出基于模型的两阶段学习管道,包括潜在条件扩散世界模型和目标条件时间变换器,在自收集数据集及实际闭环实验中取得较好成果,证明学习到的超声动力学对训练目标导向机器人探头导航有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 67%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22045 2026-08-04 cs.LG cs.AI 版本更新 50%

CEL: Comprehensive Counterfactual Explanations Library and Benchmark

CEL:综合反事实解释库与基准测试

Oleksii Furman, Łukasz Lenkiewicz, Marcel Musiałek, Maciej Zięba

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 该研究针对可解释人工智能中反事实解释方法评估难的问题,引入CEL统一库与基准测试,包含多数据集及方法实现,通过标准化设置全面比较多种方法,为反事实解释方法评估提供统一框架,促进未来方法发展。

Comments 16 pages, 5 figures. Accepted for presentation at the XKDD and Beyond Workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶 1 篇

2603.05842 2026-08-04 cs.RO 版本更新 50%

Expert Knowledge-driven Reinforcement Learning for Autonomous Racing via Trajectory Guidance and Dynamics Constraints

专家知识驱动的强化学习用于自动驾驶赛车:通过轨迹引导和动力学约束

Bo Leng, Weiqi Zhang, Zhuoren Li, Lu Xiong, Guizhe Jin, Ran Yu, Chen Lv

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

专题命中 自动驾驶 :environment model(abstract);分类 cs.RO

AI总结 本文提出TraD-RL方法,通过轨迹引导和动力学约束强化学习,提升自动驾驶赛车的性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 2 篇

2607.20939 2026-08-04 eess.SY cs.AI cs.RO cs.SY 版本更新 58%

Interaction Dynamics Modeling and Predictive Control for Safe Steerable Catheter--Tissue Interaction

用于安全可控导管-组织相互作用的相互作用动力学建模与预测控制

Yongyan Cao

机构 * Voryx Robotic LLC

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.RO

AI总结 研究安全可控导管-组织相互作用动力学问题,通过建立模型、采用部分物理前馈、预测优化器及增强卡尔曼滤波器等方法,实现无偏移运动调节与接触力安全,模拟结果验证了方法有效性,硬件验证待开展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19849 2026-08-04 cs.AI cs.LG 版本更新 56%

Near-Optimal Reinforcement Learning for Constrained Recurrence Objectives

具有$ω$-正则目标和约束的强化学习

Dominik Wagner, Leon Witzman, Luke Ong

机构 * NTU Singapore(南洋理工大学)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合$ω$-正则目标与约束的强化学习算法,以解决安全性和性能之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏