arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-03 至 2026-08-03 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 8 篇

2607.29031 2026-08-03 cs.RO cs.AI 新提交 84%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新 81%

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29491 2026-08-03 cs.LG cs.AI 新提交 76%

DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search

DreamQAS:面向VQE高效量子架构搜索的决策有用世界模型学习

Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

机构 * School of Computing Technologies, RMIT University(RMIT大学计算技术学院) Quantum Systems, Data61, CSIRO(澳大利亚联邦科学与工业研究组织数据61分部量子系统部)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG

AI总结 该研究提出DreamQAS模型,以基于模型的强化学习框架实现VQE高效量子架构搜索,在多个分子任务上降低了真实VQE调用次数并提升了反事实动作排名效用。

Comments 26 pages, 4 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 67%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 62%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.LG

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00115 2026-08-03 cs.CV cs.LG stat.ML 版本更新 62%

Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory Conditions

来自视频的物理:最小轨迹条件下时不变二阶ODE的可辨识性

Yuanyuan Wang, Wenjie Wang, Kun Zhang, Mingming Gong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 研究从原始像素中辨识连续时间物理定律的结构可辨识性,证明在最小轨迹条件下,编码器-仅管道可唯一恢复二阶线性ODE参数,并引入方差底正则化器稳定无解码器目标。

Comments Accepted at ICML 2026. Updated to the camera-ready version; main results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25333 2026-08-03 cs.CV 版本更新 57%

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

教会视频生成器记忆:为不可见状态演化引出动态记忆

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏