arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3082 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3082 篇

2607.29031 2026-08-03 cs.RO cs.AI 新提交 84%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 84%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-07-23 cs.CV cs.LG 版本更新 84%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 84%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.CV、cs.LG

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08894 2026-07-13 cs.AI cs.LG 新提交 84%

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索

Maureese Williams, Dymitr Nowicki

机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28865 2026-07-07 cs.LG cs.AI 版本更新 84%

Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision

无需语言监督的物理交互中世界模型中的涌现语义表征

Jiayi Fang

机构 * Independent Researcher(独立研究者)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 通过无语言监督的物理探索训练VAE世界模型,发现其潜在空间自发形成与物理几何结构对齐的语义结构,且预测性能与语义对齐共同提升,验证了物理几何作为世界模型表征的组织原则。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 84%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28758 2026-06-30 cs.CV cs.AI 84%

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

机构 * XPeng Inc.(小鹏汽车)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13817 2026-06-15 cs.RO cs.LG 新提交 84%

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

FlowMo-WM:具有物体动量和隐藏环境漂移的世界模型

Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

机构 * Dartmouth College(达特茅斯学院) Clemson University(克莱姆森大学) University of Houston(休斯顿大学)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);分类 cs.RO、cs.LG

AI总结 提出FlowMo-WM,一种端到端可训练的视觉世界模型,通过分解图像-动作历史为短历史潜在状态和长历史上下文,分别建模物体运动和环境漂移,提升水下机器人等场景的长程预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07687 2026-06-09 cs.CV cs.AI 新提交 84%

What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction

什么使视频世界模型潜在空间与动作相关:预测优于重建

Jewon Yeom, Hanseul Kim, Jeongjae Park, Sungmok Jung, Jaejin Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 通过统一探针评估,发现动作相关结构主要由时间视频预训练驱动,而非像素重建保真度,其中视频预训练自监督编码器在视觉保真度和动作预测间取得最佳帕累托权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02753 2026-06-03 cs.CV cs.AI 84%

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

MetaWorld: 从单视角视频数据扩展多智能体视频世界模型

Teng Hu, Mingchun Lu, Yating Wang, Jiangning Zhang, Jinkun Hao, Ye Pan, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 提出MetaWorld框架,通过单目世界状态展开、主体感知世界生成器和世界状态对齐机制,从单视角视频构建多智能体视频世界模型,解决数据稀缺和世界状态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08236 2026-06-02 cs.CV cs.AI cs.CL 84%

When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning

何时想象以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理

Shoubin Yu, Yue Zhang, Zun Wang, Jaehong Yoon, Huaxiu Yao, Mingyu Ding, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出自适应测试时框架AVIC/AVIC-R,通过世界模型选择性调用和缩放视觉想象,在空间推理中平衡准确性与效率,超越GPT-4o等基线。

Comments the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22164 2026-05-22 cs.LG cs.RO 84%

Beyond Euclidean Proximity: Repairing Latent World Models with Horizon-Matched Trajectory Reachability Metrics

超越欧几里得距离:通过地平线匹配轨迹可达性度量修复潜在世界模型

Liangyu Li, Shengzhi Wang, Qingwen Liu

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出轨迹可达性度量(TRM)作为固定潜在世界模型的后处理终端排名方法,通过训练小的成对头部来改进终端排名,从而提高连续操控任务的性能。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15975 2026-05-20 cs.AI cs.RO 84%

Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning

在符号世界模型上学习双层策略以实现长周期规划

Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen, Sheila A. McIlraith

机构 * Vector Institute(向量研究所) University of Toronto(多伦多大学) LAAS-CNRS(Laas--cnrs) University of Toulouse(图卢兹大学) RWTH Aachen University(亚琛工业大学)

专题命中 具身推理 :world model(title);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种结合低层模仿学习和高层符号抽象的双层策略,用于解决长周期规划问题,通过BISON系统在扩展的MetaWorld基准上验证了其在处理大量物体和长周期任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18813 2026-05-20 cs.LG cs.AI 84%

Composition of Memory Experts for Diffusion World Models

记忆专家的组合用于扩散世界模型

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Computer Vision Group(计算机视觉组) Department of Computer Science(计算机科学系) University of Bern(伯恩大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于扩散的世界模型框架,通过组合专门化的记忆专家来解决记忆与效率之间的权衡问题,提升了时间一致性、过去观察的回忆和导航性能。

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16395 2026-05-19 cs.RO cs.LG 84%

OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence

OrbiSim:作为具身智能的可微物理引擎的世界模型

Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science(人工智能摩尔电子实验室、人工智能学院、计算机科学学院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 OrbiSim提出了一种新的机器人仿真范式,将世界模型重新定义为完全可微的物理引擎,通过统一的物理基础路径连接结构化场景资产、神经动力学和下游强化学习,提升预测精度和控制性能。

Comments Project page: https://jjleejj85.github.io/projects/orbisim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15391 2026-05-18 cs.CV cs.AI 84%

PanoWorld: Geometry-Consistent Panoramic Video World Modeling

PanoWorld:几何一致的全景视频世界建模

Le Jiang, Xiangyu Bai, Bishoy Galoaa, Shayda Moezzi, Caleb James Lee, Tooba Imtiaz, Edmund Yeh, Jennifer Dy, Yanzhi Wang, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 PanoWorld通过几何和动态一致性建模生成一致的360度视频,提升了空间理解能力,适用于具身AI应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22976 2026-05-11 cs.CV cs.AI 84%

LoopNav: Benchmarking Spatial Consistency in World Models

LoopNav:世界模型中空间一致性评估的基准测试

Kewei Lian, Shaofei Cai, Yitao Liang, Anji Liu

机构 * NUS(国立新加坡大学) Peking Univeristy(北京大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 LoopNav提出一个基于循环导航的基准测试,用于评估世界模型的空间一致性,通过Minecraft开放世界环境收集250小时视频数据,并引入场景图一致性评分以量化空间一致性。

Comments V3: SGCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 84%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08780 2026-04-13 cs.RO cs.LG 84%

Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning

迈向基于形态条件的四足世界模型

Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 84%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26814 2026-03-31 cs.CV cs.RO 84%

arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery

arg-VU:结合物理感知的3D几何进行视觉理解的意图推理

Nan Xiao, Yunxin Fan, Farong Wang, Fei Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Stanford University(斯坦福大学)

专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 arg-VU通过整合时间一致的几何跟踪与约束诱导的机械建模,提升手术场景中变形组织的意图推理能力,实现更稳定和物理一致的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 84%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO 84%

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 84%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22353 2026-03-02 cs.LG cs.AI 84%

Context and Diversity Matter: The Emergence of In-Context Learning in World Models

上下文与多样性至关重要:世界模型中情境学习的出现

Fan Wang, Zhiyuan Chen, Yuxuan Zhong, Sunjian Zheng, Pengtao Shao, Bo Yu, Shaoshan Liu, Jianan Wang, Ning Ding, Yang Cao, Yu Kang

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Intelligent Low-Carbon Information Technology and Equipment(安徽省智能低碳信息技术与设备重点实验室)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了世界模型中情境学习的机制,揭示了环境识别和学习的核心作用,并探讨了长上下文和多样化环境对学习效果的影响。

Journal ref 2026 International Conference on Learning Representations (ICLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22010 2026-02-26 cs.RO cs.CV 84%

World Guidance: World Modeling in Condition Space for Action Generation

世界引导:在条件空间中进行世界建模以生成动作

Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang, Weiheng Zhong, Zhengbang Zhu, Yuxiao Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 WoG通过在条件空间中建模未来观测,提升视觉-语言-动作模型的动作生成能力与泛化性能。

Comments Project Page: https://selen-suyue.github.io/WoGNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 84%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10390 2026-02-12 cs.LG cs.AI 84%

Affordances Enable Partial World Modeling with LLMs

affordances 使 LLMs 能实现部分世界建模

Khimya Khetarpal, Gheorghe Comanici, Jonathan Richens, Jeremy Shar, Fei Xia, Laurent Orseau, Aleksandra Faust, Doina Precup

机构 * Google Deepmind(谷歌DeepMind)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用 affordances 构建部分世界模型,通过在多任务中引入分布稳健的 affordances,提高搜索效率并提升奖励表现。

Comments 18 pages, 5 figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09856 2026-02-11 cs.CV cs.AI cs.CL cs.HC 84%

Code2World: A GUI World Model via Renderable Code Generation

Code2World: 通过可渲染代码生成实现一个GUI世界模型

Yuhao Zheng, Li'an Zhong, Yi Wang, Rui Dai, Kaikui Liu, Xiangxiang Chu, Linyuan Lv, Philip Torr, Kevin Qinghong Lin

机构 * University of Science(科学大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) University of Oxford(牛津大学) Sun Yat-sen University(中山大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 Code2World通过可渲染代码生成实现高保真UI预测,提升Android导航性能

Comments github: https://github.com/AMAP-ML/Code2World project page: https://amap-ml.github.io/Code2World/

详情

展开后加载摘要…

URL PDF HTML 收藏