arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-28 至 2026-04-28 共收录 2 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 2 篇

2603.27507 2026-04-28 cs.CV 57%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23452 2026-04-28 cs.CV cs.LG 57%

From Edges to Depth: Probing the Spatial Hierarchy in Vision Transformers

从边缘到深度:探测视觉变换器中的空间层次

Jainum Sanghavi

机构 * Northeastern University(东北大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 研究探讨了视觉变换器中空间层次的编码机制,通过分析局部边缘和深度信息揭示了层次结构,发现边界结构在第5-6层可线性解码,而深度信息在第8层达到峰值,证明了分类训练的ViT能主动维护空间层次。

Comments 12 pages, 6 figures. Code available at https://github.com/JainumSanghavi/ProbingViTs

详情

展开后加载摘要…

URL PDF HTML 收藏