arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-20 至 2026-03-20 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 4 篇

2509.03636 2026-03-20 cs.AI cs.CL cs.LG 82%

CausalARC: Abstract Reasoning with Causal World Models

CausalARC:基于因果世界模型的抽象推理

Jacqueline Maasch, John Kalantari, Kia Khezeli

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 CausalARC通过因果世界模型进行低数据和分布外推理,结合原则性数据增强提供少量示例反馈,用于评估语言模型在抽象推理、反事实推理、程序合成和因果发现中的表现。

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18266 2026-03-20 cs.LG cs.AI 81%

Enactor: From Traffic Simulators to Surrogate World Models

Enactor:从交通模拟器到替代世界模型

Yash Ranjan, Rahul Sengupta, Anand Rangarajan, Sanjay Ranka

机构 * Department of CISE, University of Florida(佛罗里达大学计算机与信息科学系)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于transformer的生成模型,用于捕捉交通参与者间的复杂交互并生成物理一致的轨迹,通过模拟循环测试,展示了在长时间范围内优于传统方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08794 2026-03-20 cs.AI 79%

LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed

基于LLM的世界模型可以独立做出决策,但需要严谨的评估

Chang Yang, Xinrun Wang, Junzhe Jiang, Qinggang Zhang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文从决策视角出发,对基于LLM的世界模型进行综合评估,设计了政策验证、行动提案和政策规划三项任务,评估了GPT-4o和GPT-4o-mini在不同环境中的表现,发现LLM世界模型在长期决策任务中性能下降,且不同功能组合会引入额外的不稳定性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG 62%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏