arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-26 至 2026-03-26 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 4 篇

2603.13904 2026-03-26 cs.CV cs.AI cs.LG cs.RO 77%

Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where Composition

单个token中的像素级场景理解:视觉状态需要什么在哪里的组成

Seokmin Lee, Yunghee Lee, Byeonghyun Pak, Byeongju Woo

机构 * Agency for Defense Development(国防发展机构)

专题命中 具身推理 :robot policy(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出CroBo框架,通过全局到局部重建目标,学习能捕捉场景元素语义身份和空间位置的视觉状态表示,以支持连续决策。

Comments Accepted to CVPR 2026 Workshop: Pixel-level Video Understanding in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02315 2026-03-26 cs.CV 74%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24581 2026-03-26 cs.CV cs.RO 62%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24541 2026-03-26 cs.CV cs.AI 62%

SEGAR: Selective Enhancement for Generative Augmented Reality

SEGAR:生成增强现实的定向增强

Fanjun Bu, Chenyang Yuan, Hiroshi Yasuda

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Toyota Research Institute(电装研究院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 SEGAR结合扩散世界模型与定向修正阶段,实现生成增强现实中的区域特定编辑与安全区域对齐,为未来帧的生成、缓存和定向修正提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏