arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 1518 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 153 篇

2608.09696 2026-08-14 cs.AI 版本更新 79%

Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models

模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计

Kevin Murphy

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。

Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11174 2026-08-13 cs.RO 版本更新 79%

VIScore: Diagnosing Planning-Relevant Quality in Latent World Models

VIScore:诊断潜在世界模型中与规划相关的质量

Haiyu Wu, Randall Balestriero, Morgan Levine

机构 * Altos Labs(阿尔托斯实验室) Brown University(布朗大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 该研究针对潜在世界模型规划成功率与潜在空间属性脱节的问题,提出VIScore指标,覆盖编码器、预测器、规划器,在跨任务场景下斯皮尔曼相关性超0.75,可更好解释规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 79%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06257 2026-08-11 cs.CV cs.HC 版本更新 79%

MASS: Multiplayer World Models with Authoritative Shared State

MASS:具有权威共享状态的多人世界模型

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

机构 * Alaya Lab(Alaya实验室) Peking University(北京大学) Institute of Science Tokyo(东京科学大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出MASS模型,通过将世界动态与视图渲染解耦,解决现有视频世界模型在多人环境中的缺陷,在多人Snake基准测试中实现更优状态精度,为多智能体世界模拟提供实用基础。

Comments Project Page: https://alaya-lab.github.io/MASS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00591 2026-08-11 cs.AI 版本更新 79%

Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models

未来为何分支?随机物理世界模型的可识别闭合测试

Yibin Dong

机构 * Shandong University(山东大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 针对随机物理世界模型无法从普通转移数据识别未来分支原因的问题,提出ClosurePairs干预评估协议,可精准分解状态混淆与过程噪声,大幅提升归因准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 79%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07195 2026-08-11 cs.CL cs.AI cs.CY cs.MA cs.SI 版本更新 79%

Multilingual Agent-Based World Modeling for Social Science

MASim:面向社会科学的多语言代理模拟

Xuan Zhang, Wenxuan Zhang, Anxu Wang, See-Kiong Ng, Yang Deng

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00559 2026-08-10 cs.AI 版本更新 79%

Social World Models

社交世界模型

Xuhui Zhou, Jiarui Liu, Akhila Yerukola, Hyunwoo Kim, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21910 2026-08-07 cs.AI cs.DB 版本更新 79%

TRW: TRACE-RealWorld---An Auditable Consistency Contract for World Models as Materialized Views

TRW: TRACE-RealWorld——作为物化视图的世界模型的可审计一致性契约

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 TRACE-RealWorld解决在变化物理世界中维护物化视图的问题,提出承诺级有效性抽象等数据管理方法,通过端到端评估测量多方面指标,贡献是为部署世界表示提供一致性、恢复和问责契约。

Comments v2 propagates declared point and extended hazards through the composition theorem and separates point-event from interval-risk budgets. It aligns Flood-SAR adjudication with each hazard class, sharpens calibration-slack and drift claims, adds bootstrap Monte Carlo error and joint-coverage requirements, revises terminology, and expands related-work context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13460 2026-08-07 cs.CV 版本更新 79%

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

VISA: VLM引导的实例语义审计用于3D占据世界模型

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Nanjing University of Posts and Telecommunications(南京邮电大学) Stanford University(斯坦福大学) Motional AD Inc.(Motional AD公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21686 2026-08-06 cs.CV 版本更新 79%

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

WorldMark:交互式视频世界模型的统一基准套件

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, Kaipeng Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25242 2026-08-05 cs.CV 版本更新 79%

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation

医疗保健中的医学世界模型:可信临床翻译的基础、应用与挑战

Zhaoyan Chen, Zhongxiu Cong, Zhuanfeng Jin, Wanshu Fan, Dongsheng Zhou, Qi Ai, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) Department of Radiology, Xinhua Hospital Affiliated to Dalian University(大连大学附属新华医院放射科) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 探讨医学世界模型在医疗保健中的应用,通过结构化综合定义其领域相关内容,围绕四种能力组织,涵盖多方面证据,虽有早期可行性证据,但受多种因素限制,临床翻译需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 79%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05238 2026-08-04 cs.AI 版本更新 79%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17102 2026-08-04 physics.pop-ph cs.AI cs.ET cs.HC quant-ph 版本更新 79%

Quantum Cinema: An Interactive Cinematic Exploration of Quantum Computing Hardware via Generative World Models

量子影院:通过生成世界模型对量子计算硬件进行交互式电影探索

Aoyu Zhang, Dongping Liu, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出量子影院,一个基于生成世界模型的开源交互式应用,通过四幕叙事将不可见的量子硬件转化为可探索的电影体验,旨在弥合量子计算与公众之间的想象鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14546 2026-08-04 cs.RO 版本更新 79%

QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps

QuASH:使用自然语言启发式方法查询视觉语言机器人地图

Matti Pekkanen, Francesco Verdoja, Ville Kyrki

专题命中 具身推理 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出QuASH方法,利用自然语言启发式处理查询相关的语言空间,训练分类器划分环境,提升地图和图像的可查询性,该方法与表示及编码器无关且训练量有限。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25337 2026-07-30 cs.CL cs.RO 版本更新 79%

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

时间距离联合嵌入预测架构:用于潜在世界模型预测控制的计划感知表示学习

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究提出时间距离联合嵌入预测架构(TD-JEPA),保留LeWM编码器-预测器主干,从无奖励轨迹挖掘有向时间成本。该方法缩小JEPA世界模型规划器训练-规划差距,在多个环境中表现优于LeWM及其他基线,通过挖掘成本提升成功率和分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30880 2026-07-29 cs.CL cs.AI 版本更新 79%

PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments

PatchWorld:可执行世界模型的免梯度优化

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Z. Pan, Yangqiu Song

机构 * Hong Kong Baptist University(香港 Baptist 大学) Independent Researcher(独立研究员) HKUST(香港科技大学) Beijing Institute of Technology(北京理工大学) Southern University of Science and Technology(南方科技大学) Wayne State University(韦恩州立大学) University of Edinburgh(爱丁堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出 PatchWorld 框架,通过反例引导的代码修复将离线轨迹转化为可执行的 Python 世界模型,实现无需梯度优化的符号信念状态程序,在 AgentGym 环境中达到 76.4% 的宏观成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22430 2026-07-28 cs.LG 版本更新 79%

On the Identifiability of Controlled World Models

关于受控世界模型的可识别性

Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 79%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19571 2026-07-21 cs.CV 版本更新 79%

Video-HOCA: A Diagnostic Benchmark for Physical Anomaly Reasoning in Video-LLMs

HOCA-Bench: 通过黑格尔本体论-因果异常超越语义感知以实现预测世界建模

Chang Liu, Yunfan Ye, Qingyang Zhou, Xichen Tan, Mengxuan Luo, Zhenyu Qiu, Wei Peng, Zhiping Cai

机构 * Hunan University, Changsha, China(湖南大学) National University of Defense Technology, Changsha, China(国防科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 HOCA-Bench通过黑格尔本体论-因果异常框架,揭示视频大语言模型在预测世界建模任务中的认知局限,发现模型在因果机制理解上存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12474 2026-07-16 cs.AI 版本更新 79%

From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

从观察到洞察:机制世界模型与自主发现探索

Ingmar Posner, Anson Lei, Bernhard Schölkopf

机构 * MPI for Intelligent Systems & ELLIS Institute(马克斯·普朗克智能系统研究所及埃利斯研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文探讨科学发现问题,提出机制世界模型这一新设计范式,将可重复使用机制置于核心,推导其计算能力、设计原则等,指出虽有不同研究方向捕捉该范式要素但缺统一框架,为推动AI走向自主科学发现提供基础和蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11673 2026-07-15 cs.CV 版本更新 79%

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

ABot-3DWorld 0:一个用于探索任意 3D 空间的通用世界模型

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 介绍 ABot-3DWorld 0 通用多模态 3D 世界模型,核心是 SGP,通过特定流程将多模态输入转换为 3D 世界,用于通用 3D 内容创建,在开源方法中领先,多模态输入下场景保真度更高。

Comments Official Page: https://abot-world.amap.com/plaza

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18601 2026-07-14 cs.CV 版本更新 79%

Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, Ruili Feng

机构 * SJTU(上海交通大学) NVIDIA Research(英伟达研究) USTC(中国科学技术大学) UCAS(乌兹别克斯坦科学院) NUS(新加坡国立大学) UWaterloo(滑铁卢大学) HKUST(香港理工大学) HKU(香港大学) ZGCA(浙江大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本研究提出了一种基于自然语言的动作接口,用于多实体视频世界模型,解决了传统接口在细粒度多实体控制和跨实体、跨世界泛化能力上的不足,通过引入自然语言条件化实现了更强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04391 2026-07-03 cs.AI cs.CL cs.SI q-bio.NC 版本更新 79%

Psychological Imagination Networks Show Cross-Population Centrality and Clustering Alignment in Humans That Large Language Models Fail to Replicate

心理想象网络显示人类跨群体中心性和聚类对齐,而大型语言模型无法复制

Saurabh Ranjan, Brian Odegaard

机构 * University of Florida(佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本研究通过心理网络分析发现,人类对心理意象的生动性评分在不同文化群体中形成稳定的网络结构,而大型语言模型(LLM)无法复制这种结构,表明人类想象网络根植于具身经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 79%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 79%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23164 2026-07-02 cs.LG 版本更新 79%

MetaOthello: A Controlled Study of Multiple World Models in Transformers

MetaOthello: Transformer中多个世界模型的控制研究

Aviral Chawla, Galen Hall, Juniper Lovato

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 通过引入共享语法但规则或分词不同的Othello变体套件,训练小型GPT处理混合数据,发现Transformer不划分容量为孤立子模型,而是收敛于跨变体因果转移的共享棋盘状态表示。

Comments Camera-ready version. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24354 2026-06-23 cs.CV 版本更新 79%

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation

SparseWorld: 通过具有稀疏场景表示的世界模型增强端到端自动驾驶

Ruoyu Wang, Jingke Wang, Yukai Ma, Yuehao Huang, Shuangming Lei, Guanglin Xu, Aixue Ye, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Labs, Huawei(华为2012实验室) State Key Laboratory of Industrial Control Technology(国家工业控制技术重点实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出SparseWorld,一种基于稀疏场景表示的轻量级世界模型,通过自回归预测未来地图元素和周围智能体,并利用预测结果优化下游运动预测和轨迹规划,在nuScenes数据集上实现0.05%的碰撞率,达到开放循环规划指标的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 79%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏