arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-18 至 2026-08-18 共收录 51 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2510.03885 2026-08-18 cs.RO 版本更新 79%

Seeing the Bigger Picture: 3D Latent Mapping for Mobile Manipulation Policy Learning

看见更大的图景:用于移动操作策略学习的3D潜在映射

Sunghwan Kim, Woojeh Chung, Zhirui Dai, Dwait Bhatt, Arth Shukla, Hao Su, Yulun Tian, Nikolay Atanasov

专题命中 机器人学习 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出SBP方法,通过3D潜在映射提升移动操作策略的学习性能,实现更强的空间和时间推理能力。

Comments ICRA 2026, project page: this https URL (https://existentialrobotics.org/sbp_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 75%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 机器人学习 :world model(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 13 篇

2606.21920 2026-08-18 cs.RO 版本更新 83%

The functional and temporal roles of gaze evolve across the phases and constraints of multi-stage robot-mediated manipulation

预测性注视在机器人介导的操作中得以保留但重组为监控

Manuela Uliano, Silvia Fattorini, Marco Controzzi

机构 * The BioRobotics Institute, Scuola Superiore Sant’Anna(生物机器人研究所,高等圣安娜学院) Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna(机器人与人工智能卓越部门,高等圣安娜学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究通过目标导向遥操作实验,发现注视仍与任务目标对齐,但视觉注意力重新分布到机械臂和物体上,增加在线监控,表明预测性注视在改变具身性时得以保留但重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 83%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22983 2026-08-18 cs.RO 版本更新 83%

Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives

基础模型时代中的具身机器人操作:规划与学习视角

Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang, Badong Chen

机构 * Xi’an Jiaotong Univeristy(西安交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Chinese Academy of Sciences(中国科学院) Westlake University(西湖大学) Zhejiang University(浙江大学) University of Sydney(悉尼大学) BAAI(百度人工智能研究院) Peking University(北京大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文探讨了基础模型时代机器人操作的规划与学习方法,分析了高层推理与低层控制的统一框架,并提出了未来研究方向。

Comments This work is a re-architected core derived from the full survey ( arXiv:2510.10903 (https://arxiv.org/abs/2510.10903) ), refined to highlight the most central themes and representative studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10903 2026-08-18 cs.RO 版本更新 83%

Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey

面向机器人操作的统一理解:一项综合调查

Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Wei Zhao, Zhe Li, Pengxiang Ding, Cheng Chi, Haoang Li, Chang Xu, Xiaolong Zheng, Donglin Wang, Shanghang Zhang, Badong Chen

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本调查针对机器人操作这一具身智能核心挑战,提出方法的统一分类与瓶颈分类,为机器人操作研究提供了全面的路线图与结构化参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新 81%

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: this https URL (https://baai-humanoid.github.io/DECO-webpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22251 2026-08-18 cs.RO 版本更新 79%

Geometric Reconstruction of Extrinsic Contact Trajectories using Tactile Sensing and Proprioception for Tool Manipulation

利用触觉感知和本体感觉进行工具操作中外在接触轨迹的几何重建

Seojung Min, Yoonjin Kim, Jeong-Jung Kim, Jung Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea Institute of Machinery and Materials(韩国机械与材料研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出一种基于触觉感知和机器人本体感觉重建工具尖端外在接触轨迹的方法,通过单点接触假设和校准段估计全局接触位置,结合连续接触下的相对运动估计,实现实时轨迹重建。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Updated to the final conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13015 2026-08-18 cs.RO 版本更新 79%

Learning Versatile Humanoid Manipulation with Touch Dreaming

通过触觉梦想学习多功能人形操作

Yaru Niu, Zhenlong Fang, Binghong Chen, Shuai Zhou, Revanth Krishna Senthilkumaran, Hao Zhang, Bingqing Chen, Chen Qiu, H. Eric Tseng, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) UT Arlington(UT阿灵顿) Bosch Center for AI(博世人工智能中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06961 2026-08-18 cs.RO cs.CV 版本更新 76%

Two by Two: Learning Multi-Task Pairwise Objects Assembly for Generalizable Robot Manipulation

两两配对:学习用于通用机器人操作的多任务成对物体装配

Yu Qi, Yuanchen Ju, Tianming Wei, Chi Chu, Lawson L.S. Wong, Huazhe Xu

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.CV

AI总结 针对现有装配数据集无法适配日常物体装配的问题,提出2BY2数据集,并开发带等变特征的两步SE(3)位姿估计方法,在18项任务上取得最优性能且经机器人实验验证可靠泛化

Comments Accepted to CVPR 2025 (Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 74%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24496 2026-08-18 cs.CR cs.AI 版本更新 57%

Red-Teaming the Agentic Red-Team

红队测试代理型红队

Dario Pasquini, Michal Bazyli, Taras Fedynyshyn, Artem Sorokin

机构 * Cracken Information Protection Department, Lviv Polytechnic National University(利沃夫理工学院信息保护系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文首次深入分析主流进攻性安全代理系统的安全漏洞,揭示其设计缺陷可导致API密钥泄露、持久化控制及宿主机失陷,并提出架构级缓解设计原则。

Comments v0.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03222 2026-08-18 cs.CY cs.AI cs.HC 版本更新 57%

The Fake Friend Dilemma: Relational Trust and the Political Economy of Conversational AI

虚假朋友困境:信任与对话AI的政治经济学

Jacob Erickson

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出虚假朋友困境框架,探讨拟人化AI如何通过隐蔽手段影响用户自主权,分析其在信任与政治经济学中的作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09434 2026-08-18 quant-ph 版本更新 50%

Biocompatible Vaterite Carriers Enable Multimodal Quantum Sensing with Nanodiamonds

双折射生物矿物微载体稳定液体中的多模态纳米金刚石量子传感

T.Amro, M.Attrash, A.Droby, A.Ushkov, R.Malkinson, P.Penshin, A.Hen, V.Bobrovs, P. Ginzburg, H.Barhum, N.Bar-Gill

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究利用双折射球文石微球作为载体,组装氮空位纳米金刚石,开发杂化平台实现液体中多模态量子传感,可用于磁场与质子浓度、pH值检测,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00446 2026-08-18 quant-ph 版本更新 50%

Identifying vulnerable nodes and detecting malicious entanglement patterns to handle st-connectivity attacks in quantum networks

识别脆弱节点并检测恶意纠缠模式以应对量子网络中的st连通性攻击

Iain Burge, Michel Barbeau, Joaquin Garcia-Alfaro

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出量子方法用于识别量子网络中维持目标连接的重要节点,并利用量子支持向量机检测恶意纠缠攻击,提升量子网络安全性。

Comments 13 pages, 6 figures, 8 sections, 50 references. Revised and extended version of a paper that appeared in the proceedings of the 40th IFIP International Conference on ICT Systems Security and Privacy Protection (IFIP SEC 2025), Maribor, Slovenia, May 21-23, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 8 篇

2604.08780 2026-08-18 cs.RO cs.LG 版本更新 84%

Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion

迈向基于形态条件的四足世界模型

Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

专题命中 具身导航 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20254 2026-08-18 cs.IR cs.AI cs.CV cs.LG 版本更新 82%

Efficient Table QA via TableGrid Navigation and Progressive Inference Prompting

通过表格网格导航和逐步推理提示实现高效的表格问答

Amritansh Maurya, Navjot Singh, Mohammed Javed, Omar Moured

机构 * Vision Intelligence Lab, IIIT Allahabad, Prayagraj, India(视觉智能实验室,印度拉贾斯坦邦阿拉哈巴德)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出了一种无需训练的表格问答方法,通过TableGrid导航和Progressive Inference Prompting框架,提升了表格问答的精度和效率,并在多个数据集上验证了其有效性。

Comments Accepted for Presentation in ICDAR 2026, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22424 2026-08-18 cs.CV 版本更新 79%

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

FlowDec:用于鲁棒连续视觉-语言导航的时间条件流去污染器

Yufei Zhang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 提出FlowDec,一种针对LM-based VLN-CE的图像恢复框架,通过混合时间条件策略和动作质心引导滤波,在导航精度和生成延迟上超越现有去污染方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19289 2026-08-18 cs.CV 版本更新 74%

STAG-VIO: Stabilized Prompt-to-Geometry Interface for Robust Dynamic Visual--Inertial Odometry

STAG-VIO:用于鲁棒动态视觉-惯性里程计的稳定提示-几何接口

Rui Zhou, Jingbin Liu, Junbin Xie, Jianyu Zhang, Yingze Hu, Jiele Zhao

专题命中 具身导航 :navigation(title);分类 cs.CV

AI总结 STAG-VIO通过提出不确定性自适应多目标跟踪等策略,解决动态VIO中提示不稳定导致的几何估计问题,在公开数据集上显著降低轨迹误差,性能优于现有最优方法。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00945 2026-08-18 cs.RO 版本更新 57%

VertiAKD: Adaptive Off-Road Kinodynamics on Vertically Challenging Terrain

VertiAKD:适用于垂直挑战性地形的自适应越野运动动力学

Tong Xu, Chenhui Pan, Francesco Cancelliere, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) University of Catania(卡塔尼亚大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出VertiAKD框架,可在几何与语义复杂地形上跨不同车辆迁移适配越野运动动力学知识,仅需一分钟新数据即可显著降低长 horizon 预测误差,实现鲁棒闭环轨迹跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25056 2026-08-18 cs.RO 版本更新 57%

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning

用于实时 AUV 路径规划的混合人工势场与时空变压器

Khadija Rais, Abdelmadjid Benmachiche, Imene Soualmia

机构 * Echahid Cheikh Larbi Tebessi University(艾哈西德·谢赫·拉尔比·泰贝西大学) Chadli Bendjedid University(查德利·本杰迪德大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究 AUV 在复杂水下环境的路径规划,比较 13 种算法,提出混合人工势场与时空变压器的方法。该方法性能平衡,平均路径短、碰撞率低、计算高效,优于其他算法,为实时 AUV 导航提供强大解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02917 2026-08-18 cs.RO 版本更新 57%

Language-Guided Generation for Personalized Inspection Planning

语言引导的个性化巡检规划生成

Xingpeng Sun, Zherong Pan, Xifeng Gao, Kui Wu, Aniket Bera

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(电气工程系,怀特州立大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出一种无训练的VLM引导方法,针对已知场景高效生成符合文本指令的巡检轨迹,可应用于多领域,经多环境验证效果良好。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03998 2026-08-18 physics.ins-det physics.atom-ph physics.geo-ph quant-ph 版本更新 50%

The QTF-Backbone: Proposal for a Nationwide Optical Fibre Backbone in Germany for Quantum Technology and Time and Frequency Metrology

QTF骨干网:德国面向量子技术及时间频率计量的全国性光纤骨干网方案

Tara Cubel Liebisch, Peter Kaufmann, Harald Schnatz, Susanne Naegele-Jackson, Jochen Kronjäger, Klaus Blaum, Stefan Kück, Dieter Meschede, Stephan Schiller, Laura Agazzi, Soroosh Alighanbari, Joachim Ankerhold, Georgy V. Astakhov, Stefanie Barz, Ingo Baumann, Rainer Baumgart, Christoph Becher, Hendrik Bekker, Oliver Benson, Paolo Bianco, Ronald Bieber, Immanuel Bloch, Ulrike Blumröder, Rainer Bockholt, Johannes Bouman, Claus Braxmaier, Enrico Brehm, Dagmar Bruss, Dmitry Budker, Hans-Joachim Bungartz, Erik Busley, José R. Crespo López-Urrutia, Cornelia Denz, Christian Deppe, Guido Dietl, Fei Ding, Thomas Eickermann, Florian Elsen, Wolfgang Ertmer, Stefan Filipp, Marc Fischer, Jakob Flury, Thomas Fröhlich, Johann Furthner, Ilia Gerhardt, Kay Uwe Giering, Christoph Glingener, Helmut Grießer, Rüdiger Grimm, Christian Grimm, Andreas Gritsch, Fritz Hack, Theodor Hänsch, Thomas Halfmann, Andreas Hanemann, Daniel Harlacher, Niklas Hegemann, Tobias Heindel, Robert Heinkelmann, Luis Hellmich, Thomas Hildmann, David Hock, Sven Höfling, Bruno Höft, Harald Hofmann, Peter Holleczek, Ronald Holzwarth, Wolfgang Hommel, Thomas Hühn, Urs Hugentobler, David Hunger, Nils Huntemann, Cigdem Issever, Fedor Jelezko, Klaus Jöns, Tim Johann, Philippe Jousset, Bernd Jungbluth, Franz Kärtner, Jonas Kankel, Heike Kaufmann, Dmitry Khabi, Thomas Kissinger, Carsten Klempt, Thomas Klügel, Ann-Kathrin Kniggendorf, Jan Kodet, Uwe Konrad, Joachim Kopp, Michael Kramer, Stefan Kremling, Michael Krist, Markus Krutzik, Sascha Kwasniok, Yvonne Leifels, Gerd Leuchs, Christian Lisdat, Yuri Litvinov, Manfred Lochter, Peter van Loock

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出德国QTF骨干网方案,分十年四阶段部署专用光纤基础设施,用于全国量子与时间频率信号分发,以推动相关研发、构建生态并巩固德欧在该领域的前沿地位。

Comments 60 pages, 7 figures This version of the article has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections. The Version of Record is available online at: this https URL (https://doi.org/10.1140/epjs/s11734-026-02451-3)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 7 篇

2510.18135 2026-08-18 cs.CV 版本更新 85%

World-in-World: World Models in a Closed-Loop World

世界中的世界:闭环世界中的世界模型

Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

机构 * JHU(约翰·霍普金斯大学) PKU(北京大学) Princeton(普林斯顿大学) MIT(麻省理工学院) Harvard(哈佛大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.CV

AI总结 研究人员推出首个具身场景闭环世界模型基准平台World-in-World,发现视觉质量不保障任务成功,后训练缩放比升级预训练视频生成器更有效,增加推理计算可提升闭环性能。

Comments ICLR 2026 Oral. Add acknowledgement in arxiv v2. Code is at this https URL (https://github.com/World-In-World/world-in-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08600 2026-08-18 cs.CV cs.AI cs.LG 版本更新 82%

Population-Scalable Multi-Agent World Modeling

支持种群规模扩展的多智能体世界建模

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。

Comments Technical report. Project page: this https URL (https://rhos.ai/research/khora). Online demo: this https URL (https://ophilus.ai/khora)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-18 cs.RO cs.CV 版本更新 81%

Multi-Agent Embodied Autonomous Driving (MAEAD): From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26712 2026-08-18 cs.RO 版本更新 79%

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

ActSWM:面向开放世界游戏长视界规划的动作敏感型世界模型

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 针对开放世界游戏长视界规划的上下文崩塌问题,提出动作敏感型世界模型ActSWM,通过约束隐式回滚保留动作依赖差异,提升了任务成功率与动作恢复能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19505 2026-08-18 cs.CV 版本更新 79%

DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT

DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型

Xiaotao Hu, Mingkai Jia, Xiaoyang Guo, Qian Zhang, Xiao-xiao Long, Wei Yin

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25532 2026-08-18 gr-qc 版本更新 71%

A New Self-Dual Gravitational Instanton Solution on a Local Conformal Kählerian Manifold in a Brane World Model

一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解

Reinoud Jan Slagter

专题命中 具身推理 :world model(title)

AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。

Comments Version V4: final. pictures improved --- spelling improved --- comments welcome---73 pages---70 pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新 57%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏