arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-12 至 2026-05-12 共收录 3 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 3 篇

2601.02954 2026-05-12 cs.SD cs.AI 71%

The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models

世界并非单一声场:为大型音频-语言模型启用空间理解

Yuhuan You, Lai Wei, Xihong Wu, Tianshu Qu

机构 * School of Intelligence Science and Technology(智能科学与技术学院)

专题命中 空间理解 :spatial understanding(title)

AI总结 本文提出TWNM框架,通过物理基础的FOA模拟和元数据引导训练,实现音频场景分析的三层次能力,提升空间音频语言理解的准确性和可审计性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 57%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08808 2026-05-12 cs.CV cs.AI cs.LG 57%

Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding

曲率感知的描述生成:利用测地注意力实现3D场景理解

Ziyao He, Yingjie Liu, ZhangYangRui, Mingsong Chen, Xuan Tang, Xian Wei

机构 * East China Normal University(东华大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出曲率感知描述生成框架,通过非欧几里得测地注意力机制解决定位与上下文化冲突,提升3D场景描述的精度与连贯性。

Comments CVPR2026 Highlight!

详情

展开后加载摘要…

URL PDF HTML 收藏