Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where Composition
单个token中的像素级场景理解:视觉状态需要什么在哪里的组成
机构 * Agency for Defense Development(国防发展机构)
专题命中 具身推理 :robot policy(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出CroBo框架,通过全局到局部重建目标,学习能捕捉场景元素语义身份和空间位置的视觉状态表示,以支持连续决策。
Comments Accepted to CVPR 2026 Workshop: Pixel-level Video Understanding in the Wild