arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-14 至 2026-07-14 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2607.06558 2026-07-14 cs.RO 版本更新 88%

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

RynnWorld-Teleop:用于数字遥操作的动作条件世界模型

Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05933 2026-07-14 eess.AS 版本更新 88%

Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech

语音世界模型:基于显式推理的语音因果状态-动作规划

Xuanru Zhou, Jiachen Lian, Henry Hong, Xinyi Yang, Gopala Anumanchipalli

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract)

AI总结 研究旨在改进语音语言模型推理弱的问题,采用模块化视角和世界模型观点,将语音理解分解为四个模块通过因果图通信,建立认知状态搜索空间,实现显式推理,让语音理解更透明可控。

Comments Accepted to 2026 ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新 84%

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

专题命中 通用世界模型 :world model(title);world model(title);分类 cs.CV

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04419 2026-07-14 cs.CL cs.AI cs.LG 版本更新 71%

Context-Dependent Affordance Computation in Vision-Language Models

视觉-语言模型中基于情境的可及性计算

Murad Farzulla

机构 * Dissensus AI King’s College London(伦敦国王学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。

Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23242 2026-07-14 cs.AI 版本更新 50%

A Model-Free Universal AI

无模型通用人工智能

Yegon Kim, Juho Lee

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

专题命中 通用世界模型 :environment model(abstract);分类 cs.AI

AI总结 提出首个在通用强化学习中证明渐近ε最优的无模型智能体AIQI,通过分布动作值函数的通用归纳实现,并扩展了Self-AIXI的渐近最优性证明。

Comments 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2605.18601 2026-07-14 cs.CV 版本更新 96%

Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, Ruili Feng

机构 * SJTU(上海交通大学) NVIDIA Research(英伟达研究) USTC(中国科学技术大学) UCAS(乌兹别克斯坦科学院) NUS(新加坡国立大学) UWaterloo(滑铁卢大学) HKUST(香港理工大学) HKU(香港大学) ZGCA(浙江大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 本研究提出了一种基于自然语言的动作接口,用于多实体视频世界模型,解决了传统接口在细粒度多实体控制和跨实体、跨世界泛化能力上的不足,通过引入自然语言条件化实现了更强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2607.09218 2026-07-14 cs.RO cs.AI 版本更新 64%

TACTIC: Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation

用于全臂操作的触觉和视觉条件下的以接触为中心的控制

Rishabh Madan, Angchen Xie, Samantha Saak, Andres Blanco, Dohyeok Lee, Sarah Grace Brown, Yunting Yan, Mark Zolotas, Jose Barreiros, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Toyota Research Institute(丰田研究机构)

专题命中 具身与机器人 :latent dynamics(abstract);分类 cs.AI、cs.RO;dynamics model(abstract);predictive model(abstract)

AI总结 研究全臂操作问题,提出TACTIC控制器,它采用以接触为中心的混合预测模型,结合多种传感,通过接触雅可比矩阵耦合动力学与运动学,集成到MPC规划器,在模拟和实际任务中表现出色,优于其他方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏