arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 277 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 197 篇

2601.05628 2026-07-29 hep-th 版本更新 67%

Entanglement Entropy and Complexity of Multicomponent Universe from Holography

从全息学角度研究多组分宇宙的纠缠度量

Ritam Mahanta, Gopinath Guin, Souvik Paul, Sunandan Gangopadhyay

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文提出了一种研究多组分宇宙全息信息理论量的方法,展示了双组分物质源的宇宙模型及其在不同时间尺度下的行为特征。

Comments 38 Pages, 1 Figure, Accepted for publication in Progress of Theoretical and Experimental Physics

Journal ref Prog. Theor. Exp. Phys. 2026 073B11

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18468 2026-07-17 astro-ph.HE 版本更新 67%

Short-Duration Gamma-ray Burst and Afterglow Rates in the Rubin and Roman Era

鲁宾和罗马时代短时伽马射线暴及其余辉发生率

Tzvetelina Dimitrova, Nathaniel Butler

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 利用概率模型模拟短暴余辉,预测LSST每年可探测约0.9个同轴余辉和1.3个孤儿余辉,而罗马望远镜适用于深度跟踪,但LIGO O5期间每年可探测事件少于1个。

Comments ApJ accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23234 2026-06-16 cs.LG cs.CY 版本更新 67%

Assessing Predictive Models for Fairness Based on Movement Patterns

基于移动模式评估预测模型的公平性

Francesco Lettich, Mario A. Nascimento, Chiara Pugliese, Chiara Renso

机构 * University of Padua(帕多瓦大学)

专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);分类 cs.LG

AI总结 针对预测模型的空间公平性,提出将公平性概念从单一地理位置扩展到移动模式,并采用空间扫描统计方法检测基于移动模式的不公平性。

Comments 33 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10886 2026-06-15 cs.CL 版本更新 67%

MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models

MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪

Vanya Cohen, Raymond Mooney

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23212 2026-07-08 cond-mat.dis-nn cond-mat.stat-mech nlin.AO 版本更新 65%

Replication and Information Extraction in a Minimal Agent-Environment Model

最小化智能体 - 环境模型中的复制与信息提取

Sebastiano Ariosto, Jerome Garnier-Brun, Luca Saglietti, Davide Straziota

专题命中 通用世界模型 :environment model(title)

AI总结 研究在无明确指导或奖励下从数据提取信息的问题,通过对分类规则施加简单性偏差,利用统计力学工具刻画自发学习相变,扩展到智能体群体后发现交互可重塑学习相边界,开辟仅通过标签交换的分散学习途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09572 2026-07-27 cs.DB cs.AI cs.LG 版本更新 62%

Predictive Query Language: A Domain-Specific Language for Predictive Modeling on Relational Databases

预测查询语言:一种用于关系数据库预测建模的领域特定语言

Vid Kocijan, Jinu Sunil, Jan Eric Lenssen, Viman Deb, Xinwei Xe, Federico Reyes Gomez, Matthias Fey, Jure Leskovec

机构 * Kumo.ai, Stanford University(Kumo.ai,斯坦福大学)

专题命中 通用世界模型 :predictive model(title,abstract);分类 cs.AI、cs.LG;predictive models(abstract)

AI总结 PQL是一种用于关系数据库预测建模的声明式语言,通过单个查询自动计算训练标签,支持多种机器学习任务,已在金融欺诈、推荐系统等领域应用。

Comments Presented at TaDA@VLDB2026

Journal ref TaDA@VLDB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 60%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 通用世界模型 :world model(comments);world models(comments);分类 cs.AI、cs.MA;world model(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00406 2026-08-14 eess.SP cs.LG cs.RO 版本更新 56%

LOCUS-DT: Localization via Observation-Conditioned Uncertainty Scoring with Digital Twins

LOCUS-DT:基于数字孪生的观测条件不确定性评分定位方法

Haozhe Lei, Roberto Bomfin, Marwa Chafii, Sundeep Rangan

专题命中 通用世界模型 :environment model(abstract);分类 cs.LG、cs.RO

AI总结 本文提出LOCUS-DT框架,利用数字孪生和学习评分函数处理室内多径定位,泛化性好,在Sionna测试中比高斯类基准更精准捕捉多模态后验结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13113 2026-08-19 eess.SY cs.RO cs.SY 版本更新 50%

MPC for underactuated spacecraft control with a Lyapunov supervised physics-informed neural network correction layer

基于李雅普诺夫监督的物理信息神经网络校正层的欠驱动航天器MPC控制

Amirhossein Ayanmanesh Motlaghmofrad, Carlo Cena, Mauro Martini, Marcello Chiaberge

机构 * Politecnico di Torino(托斯纳理工学院) Argotec S.R.L.(Argotec公司)

专题命中 通用世界模型 :environment model(abstract);分类 cs.RO

AI总结 针对欠驱动航天器姿态控制,提出一种分层架构,结合非线性模型预测控制、物理信息神经网络和李雅普诺夫监督机制,在不确定性下降低稳态误差并保持鲁棒性。

Comments Accepted at SPAICE (AI in and for Space) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04113 2026-08-18 cs.CV cs.AI 版本更新 50%

Understanding Sources of Demographic Predictability in Brain MRI via Disentangling Anatomy and Contrast

通过解构解耦解剖与对比来理解脑部MRI中人口预测性的来源

Mehmet Yigit Avci, Akshit Achara, Andrew King, Jorge Cardoso

机构 * School of Biomedical Engineering \& Imaging Sciences, King’s College London, London, UK

专题命中 通用世界模型 :分类 cs.AI、cs.CV;predictive model(abstract);predictive models(abstract)

AI总结 本文通过解耦脑MRI中的解剖和对比特征,发现人口预测性主要源于解剖变异,而非成像依赖特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21030 2026-08-06 eess.SY cs.AI cs.RO cs.SY math.OC 版本更新 50%

A Systematic Review and Taxonomy of Reinforcement Learning-Model Predictive Control Integration for Linear Systems

一种线性系统中强化学习-模型预测控制整合的系统综述与分类

Mohsen Jalaeian Farimani, Roya Khalili Amirabadi, Davoud Nikkhouy, Malihe Abdolbaghi, Mahshad Rastegarmoghaddam, Shima Samadzadeh, Mahdi Ghane

机构 * Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(电子信息生物工程系(DEIB),米兰理工大学) Department of Applied Mathematics, Ferdowsi University of Mashhad(应用数学系,法尔德大学) Department of Mechanical Engineering, Politecnico di Milano(机械工程系,米兰理工大学) Department of Applied Mathematics, Faculty of Mathematical Sciences, University of Guilan(应用数学系,加林大学) Department of Robotics and Control Engineering, Shahrood University of Technology(机器人与控制工程系,沙霍德技术大学)

专题命中 通用世界模型 :分类 cs.AI、cs.RO;predictive model(abstract);predictive models(abstract)

AI总结 本文系统综述了线性系统中强化学习与模型预测控制整合的研究,通过多维分类揭示了整合策略、挑战及方法学趋势,为相关研究提供结构化参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22045 2026-08-04 cs.LG cs.AI 版本更新 50%

CEL: Comprehensive Counterfactual Explanations Library and Benchmark

CEL:综合反事实解释库与基准测试

Oleksii Furman, Łukasz Lenkiewicz, Marcel Musiałek, Maciej Zięba

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 该研究针对可解释人工智能中反事实解释方法评估难的问题,引入CEL统一库与基准测试,包含多数据集及方法实现,通过标准化设置全面比较多种方法,为反事实解释方法评估提供统一框架,促进未来方法发展。

Comments 16 pages, 5 figures. Accepted for presentation at the XKDD and Beyond Workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20993 2026-07-29 cs.LG cs.AI stat.ML 版本更新 50%

Annotation-Assisted Learning of Treatment Policies From Multimodal Electronic Health Records

借助注释的学习:从多模态电子健康记录中学习治疗策略

Henri Arno, Thomas Demeester

机构 * Department of Information Technology Ghent University - imec(信息科技系根特大学 - imec)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文提出AACE方法,通过专家注释辅助学习多模态EHR中的因果策略,提升治疗决策效果。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08870 2026-07-23 cs.LG cs.AI 版本更新 50%

A Unified Survival Benchmark for Temporal Dropout Risk Prediction in Learning Analytics

学习分析中的时间辍学风险:跨动态与早期窗口表示的协调生存基准

Rafael da Silva, Jeff Eicher, Gregory Longo

机构 * Applied Data Science Program(应用数据科学项目) Eastern University(东部大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本研究使用OULAD数据集,通过协调的生存分析基准(包括动态周表示和连续时间表示)评估辍学风险模型,发现时间行为特征比静态背景属性更具预测力。

Comments 64 pages, 11 figures, 20 tables, 63 references. Survival analysis benchmark for student dropout prediction using OULAD dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23242 2026-07-14 cs.AI 版本更新 50%

A Model-Free Universal AI

无模型通用人工智能

Yegon Kim, Juho Lee

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

专题命中 通用世界模型 :environment model(abstract);分类 cs.AI

AI总结 提出首个在通用强化学习中证明渐近ε最优的无模型智能体AIQI,通过分布动作值函数的通用归纳实现,并扩展了Self-AIXI的渐近最优性证明。

Comments 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新 50%

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08690 2026-06-23 cs.LG cs.CR 版本更新 50%

SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

SoK: 深度强化学习在网络安全中的陷阱

Shae McFadden, Myles Foley, Elizabeth Bates, Ilias Tsingenopoulos, Sanyam Vyas, Vasilios Mavroudis, Chris Hicks, Fabio Pierazzi

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cardiff University(卡迪夫大学) KU Leuven(鲁汶大学) Devotion AI Labs(Devotion AI 实验室)

专题命中 通用世界模型 :environment model(abstract);分类 cs.LG

AI总结 本文系统梳理了深度强化学习应用于网络安全时的11个方法学陷阱,通过分析66篇论文量化其普遍性,并在三个典型场景中实验验证其影响,最后提出改进建议。

Comments Accepted at USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 9 篇

2605.31158 2026-06-19 cs.CV cs.LG 版本更新 96%

Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models

光交互:交互式视频世界模型的免训练推理加速

Jiacheng Lu, Haoyi Zhu, Sipei Yi, Enze Xie, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) NVIDIA

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 针对交互式视频世界模型推理成本高的问题,提出免训练加速框架Light Interaction,通过自适应上下文管理、去噪缓存加速和3D块稀疏注意力实现最高2.59倍加速。

Comments 13 pages, 6 figures, 3 tables. Project page: https://2843721358l-del.github.io/Light-Interaction-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新 96%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 96%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18601 2026-07-14 cs.CV 版本更新 96%

Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, Ruili Feng

机构 * SJTU(上海交通大学) NVIDIA Research(英伟达研究) USTC(中国科学技术大学) UCAS(乌兹别克斯坦科学院) NUS(新加坡国立大学) UWaterloo(滑铁卢大学) HKUST(香港理工大学) HKU(香港大学) ZGCA(浙江大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 本研究提出了一种基于自然语言的动作接口,用于多实体视频世界模型,解决了传统接口在细粒度多实体控制和跨实体、跨世界泛化能力上的不足,通过引入自然语言条件化实现了更强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00793 2026-06-09 cs.CV 版本更新 96%

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

MBench: 视频世界模型记忆能力的综合基准

Shengjun Zhang, Zhang Zhang, Simin Huang, Zhenyu Tang, Hanyang Wang, Chensheng Dai, Min Chen, Yifan Li, Yuxin Li, Yingjie Chen, Hao Liu, Chen Li, Jing Lyu, Yueqi Duan

机构 * Tsinghua University(清华大学) WeChat Vision, Tecent Inc.(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出MBench基准,通过实体一致性、环境一致性和因果一致性三个核心维度及其12个子维度,系统评估视频世界模型的长期记忆能力,并揭示现有方法在长期状态保持上的关键局限。

Comments Project Page: https://peanutup.github.io/MBench-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21686 2026-08-06 cs.CV 版本更新 95%

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

WorldMark:交互式视频世界模型的统一基准套件

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, Kaipeng Zhang

专题命中 视频世界模型 :world model(title,abstract);world models(title);video world model(title);world model(title,abstract)

AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-08-20 cs.CV cs.LG 版本更新 94%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 视频世界模型 :world model(title,abstract);video world model(title,abstract);world model(title,abstract);video world model(title,abstract)

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

Comments Published in TMLR (09/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01060 2026-07-16 cs.RO 版本更新 89%

RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation

RoboWorld: 用于通用机器人策略评估的快速可靠神经模拟器

Byeongguk Jeon, Seonghyeon Ye, JaeHyeok Doo, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院) Config

专题命中 视频世界模型 :world model(abstract);world models(abstract);world-model(abstract);video world model(abstract)

AI总结 提出RoboWorld自动化评估流程,结合快速自回归视频世界模型和任务进度感知视觉语言模型评分,通过Step Forcing减少训练-测试不匹配,实现与真实世界评估高度一致。

Comments Project page: https://byeongguks.github.io/RoboWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 87%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频世界模型 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 25 篇

2607.18709 2026-07-23 cs.RO 版本更新 93%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09036 2026-06-25 cs.RO 版本更新 91%

RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation

RoDyn: 驯服交互式机器人动态2.5D世界模型用于机器人操作

Chuanrui Zhang, Zhengxian Wu, Guanxing Lu, Yansong Tang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出RoDyn,一种几何感知的2.5D世界模型,通过机器人动态分词器和掩码引导自回归架构,在高效潜在空间中建模环境动态,提升生成保真度并显著改善下游强化学习和模仿学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01799 2026-06-09 cs.CV 版本更新 90%

Embody4D: A Generalist Data Engine for Embodied 4D World Modeling

Embody4D: 面向具身4D世界建模的通用数据引擎

Peiyan Tu, Hanxin Zhu, Jingwen Sun, Shaojie Ren, Cong Wang, Yuyan Xu, Jiayi Luo, Xiaoqian Cheng, Zhibo Chen

机构 * Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);video world model(abstract);video world model(abstract)

AI总结 提出Embody4D视频到视频世界模型,通过3D感知合成管道、潜在置信度专家调制和交互注意力机制,将单目机器人视频转换为多视角视频,解决具身智能中视角稀疏问题,提升下游规划与学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 88%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏