arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-03 至 2026-04-03 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 6 篇

2604.01605 2026-04-03 cs.CV cs.RO 81%

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 具身推理 :world model(title);robotic(abstract);分类 cs.RO、cs.CV

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01607 2026-04-03 cs.DC cs.AI 79%

ModTrans: Translating Real-world Models for Distributed Training Simulator

ModTrans:用于分布式训练模拟器的现实世界模型翻译

Yi Lyu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 ModTrans通过将现实世界模型转换为分布式训练模拟器输入,解决了现有模拟器无法导入真实模型的问题,降低了ML研究者的使用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 67%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG 62%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01359 2026-04-03 cs.AI 57%

Semantic Modeling for World-Centered Architectures

面向世界中心架构的语义建模

Andrei Mantsivoda, Darya Gavrilina

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出世界中心多智能体系统(WMAS)作为传统智能体中心架构的替代方案,通过共享世界模型实现语义一致性、可解释性和长期稳定性,并介绍了Ontobox平台作为其实现。

Comments 15 pages, 1 figure, MathAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏