arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-21 至 2026-04-21 共收录 2 信号源:cs.CV, cs.GR, cs.RO

1. SLAM与定位 2 篇

2511.16857 2026-04-21 cs.CV cs.RO 62%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 SLAM与定位 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17422 2026-04-21 cs.CV 57%

DeepDetect: Learning All-in-One Dense Keypoints

DeepDetect: 一种统一的密集关键点检测器

Shaharyar Ahmed Khan Tareen, Filza Khan Tareen, Xiaojing Yuan

机构 * University of Houston(休斯顿大学) National University of Sciences and Technology(国家 sciences and Technology大学)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV

AI总结 DeepDetect结合传统检测器与深度学习,通过融合多检测器输出生成真实标签,训练高效模型生成高密度关键点,提升在复杂场景下的性能。

Comments 8 pages, 8 figures, 3 tables, 6 equations

详情

展开后加载摘要…

URL PDF HTML 收藏