arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-14 至 2026-07-14 共收录 37 信号源:cs.CV, cs.GR, cs.RO

1. 点云 12 篇

2503.15854 2026-07-14 math.AT cs.CG 版本更新 50%

Persistent Stiefel-Whitney Classes of Tangent Bundles

切丛的持久施蒂费尔 - 惠特尼类

Dongwoo Gang

专题命中 点云 :point cloud(abstract)

AI总结 研究如何从有限点样本计算切丛的施蒂费尔 - 惠特尼类,核心方法是构建单纯复形滤链计算持久上同调并应用吴公式,该算法时间复杂度为多项式,能在多种情况下准确计算出切丛的此类拓扑不变量。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 1 篇

2601.13132 2026-07-14 cs.CV 版本更新 87%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 新视角合成 :novel view synthesis(title,abstract);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 1 篇

2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 76%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 3D生成 :3D generation(title);分类 cs.CV、cs.GR

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 2 篇

2602.17665 2026-07-14 cs.CV 版本更新 57%

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

OpenEarthAgent:一个用于工具增强地理空间代理的统一框架

Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir, Hiyam Debary, Mustansar Fiaz, Muhammad Zaigham Zaheer, Paolo Fraccaro, Fahad Shahbaz Khan, Muhammad Haris Khan, Xiao Xiang Zhu, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) IBM Research(IBM研究院) Linköping University(林霍姆斯大学) Technical University Munich(慕尼黑技术大学) Australian National University(澳大利亚国立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10822 2026-07-14 cs.LG 新提交 50%

Graph Neural Networks for RFID-Based Spatial Geometry Inference in Spatial AI Systems

空间人工智能系统中基于 RFID 的空间几何推理的图神经网络

Curtis Shull, Merrick Green, Roy Rucker

专题命中 空间理解 :spatial understanding(abstract)

AI总结 针对室内空间理解难题,本文提出基于图神经网络的学习框架,整合信号强度等数据构建图表示,通过 GNN 训练预测空间几何模式,如线性轨迹等,为室内定位等提供新方法。

Comments 38 pages, 10 figures. Introduces a Graph Neural Network framework for RFID-based spatial geometry inference using indoor floorplan semantics and digital twin representations

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 2 篇

2607.10925 2026-07-14 cs.RO 新提交 74%

Mapping Pamir: Multi-Session Visual-Inertial SLAM and 3D Reconstruction of an Underwater Shipwreck

绘制帕米尔:水下沉船的多会话视觉惯性SLAM与3D重建

Michalis Chatzispyrou, Luke Horgan, Hyunkil Hwang, Harish Sathishchandra, Chinmay Burgul, Monika Roznere, Alberto Quattrini Li, Philippos Mordohai, Ioannis Rekleitis

机构 * University of Delaware(特拉华大学) Stevens Institute of Technology(史蒂文斯理工学院) Binghamton University(宾汉姆顿大学) Dartmouth College(达特茅斯学院)

专题命中 SLAM与定位 :3D reconstruction(title);分类 cs.RO

AI总结 该研究利用经济相机与潜水计算机数据,基于SVIn2和COLMAP框架,提出水下环境多会话映射框架,实现巴巴多斯海岸沉船的多会话映射,首次对沉船内外进行映射,第三个会话采用双相机拓宽视野。

Comments 8 pages, 12 figures. Accepted to ICRA 2026, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09985 2026-07-14 cs.CV 新提交 57%

UniPose9D: Universal Category-Agnostic Object Pose Estimation

UniPose9D:通用的类别无关物体姿态估计

Yang You, Yi Du, Cole Harrison, Leonidas Guibas

机构 * Stanford University(斯坦福大学) Amazon(亚马逊)

专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV

AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏