arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-21 至 2026-07-21 共收录 16 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2602.23204 2026-07-21 cs.CV cs.RO 版本更新 62%

Motion-aware Event Suppression for Event Cameras

面向事件相机的运动感知事件抑制

Roberto Pellerito, Nico Messikommer, Giovanni Cioffi, Marco Cannici, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组,瑞士)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 提出首个运动感知事件抑制框架,通过联合分割当前事件流中的独立运动物体并预测其未来运动,实现动态事件的预期抑制,在EVIMO基准上分割精度提升67%,推理速度提高53%。

Comments Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 57%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 5 篇

2606.26985 2026-07-21 cs.GR 版本更新 89%

Vis4GS: A Visual Analytic Tool for 3D Gaussian Splatting Reconstruction

Vis4GS: 3D高斯泼溅重建的可视分析工具

Kai-Yuan Lin, Aryabima Mandala Putra, Jui-Chi Lee, Shih-Hsuan Hung

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.GR

AI总结 针对3DGS重建中高斯属性对伪影的影响难以解释的问题,提出Vis4GS多视图可视分析工具,通过链接伪影与高斯属性、视图覆盖、训练进度和谱系,支持结构化诊断重建失败原因。

Comments Accepted to IEEE VIS 2026 Short Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20714 2026-07-21 cs.CV 版本更新 89%

The Role of Initialization in 3D Gaussian Splatting

初始化与密集化在3D高斯散射中的作用与关系

Ivan Desiatov, Torsten Sattler

机构 * Czech Technical University in Prague, Faculty of Electrical Engineering(布拉格捷克技术大学电子工程系) Czech Technical University in Prague, Czech Institute of Informatics, Robotics and Cybernetics(布拉格捷克技术大学信息技术、机器人学与自动化研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);point cloud(abstract);novel view synthesis(abstract)

AI总结 本文研究初始化与密集化在3D高斯散射中的关系,提出新基准测试,分析不同初始化类型与密集化方案的组合,发现现有密集化方法无法充分利用密集初始化。

Comments Sources are available at https://github.com/deivse/ivd_splat . Changes in this version: extended experiments, adjusted direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12972 2026-07-21 cs.RO 版本更新 85%

SplatSearch: Instance Image Goal Navigation for Mobile Robots using 3D Gaussian Splatting and Diffusion Models

SplatSearch:使用3D高斯点云和扩散模型的移动机器人实例图像目标导航

Siddarth Narasimhan, Matthew Lisondra, Haitong Wang, Goldie Nejat

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.RO

AI总结 研究移动机器人的实例图像目标导航问题,提出SplatSearch架构,利用3D高斯点云重建和多视角扩散模型,结合前沿探索策略,在多种环境实验中验证其性能优于现有方法。

Comments Project Page: https://splat-search.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09260 2026-07-21 cs.CV 版本更新 79%

AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration

AnythingReality:用于开放词汇VR场景探索的鲁棒在线高斯点云SLAM

Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯科尔科沃科学技术研究院) NLP Research Center(自然语言处理研究中心)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 该研究提出用于开放词汇VR场景探索的集成架构,结合ORB-SLAM3姿态估计与在线高斯重建处理现实数据,通过VR管道探索,语义模块转录语音等,在数据集和TUM-RGBD上提升图像质量,帧率可比或更优,实现88%的视觉语言模型对象识别率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08982 2026-07-21 cs.CV 版本更新 57%

CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation

CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位

Qi Ma, Runyi Yang, Bin Ren, Nicu Sebe, Ender Konukoglu, Luc Van Gool, Danda Pani Paudel

机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2509.07996 2026-07-21 cs.CV cs.RO 版本更新 62%

3D and 4D World Modeling: A Survey

3D和4D世界建模:一项综述

Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该综述针对世界建模中对3D和4D表示利用不足及定义分类缺失的问题,通过建立精确概念、引入结构化分类法,系统总结相关数据集和评估指标,讨论应用、挑战与方向,为3D和4D世界建模领域提供基础参考。

Comments Survey; Project Page at https://worldbench.github.io/survey GitHub Repo at https://github.com/worldbench/awesome-3d-4d-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22881 2026-07-21 cs.RO eess.SP 版本更新 57%

A Vendor-Agnostic LiDAR Data Conversion System with Multi-Signal Detection and Multi-Format Output

一种支持多信号检测和多格式输出的厂商无关LiDAR数据转换系统

Param Patel, Jay Dave, Pratyush Chakraborty

机构 * BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区) Department of Electrical and Electronics Engineering, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区电气与电子工程系) Department of Computer Science and Information Systems, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区计算机科学与信息系统系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种厂商无关的LiDAR数据转换系统,通过加权多信号方法自动识别传感器厂商,并输出五种标准格式,解决了多厂商SDK不兼容问题。

Comments Manuscript submitted at Software: Practice and Experience

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25623 2026-07-21 cs.RO 版本更新 57%

Neural Surface and Reflectance Modelling from 3D Radar Data

从3D雷达数据进行神经表面和反射率建模

Judith Treffler, Vladimír Kubelka, Henrik Andreasson, Martin Magnusson

机构 * Örebro University(厄勒布鲁大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种神经隐式方法,从雷达点云联合建模场景几何和视角相关雷达强度,利用混合特征编码学习连续SDF,生成更平滑准确的3D表面重建。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05610 2026-07-21 cs.CV 版本更新 57%

NormalView: tree species classification from backpack and aerial lidar data using geometric projections

NormalView:利用几何投影从背包和航空激光雷达数据进行树种分类

Juho Korkeala, Jesse Muhojoki, Josef Taher, Klaara Salolahti, Matti Hyyppä, Antero Kukko, Juha Hyyppä

机构 * Finnish Geospatial Research Institute FGI(芬兰地理研究 institute FGI) The National Land Survey of Finland(芬兰国家土地调查局) Department of Remote Sensing and Photogrammetry(遥感与摄影测量系) Department of Built Environment, School of Engineering(环境系,工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究利用NormalView方法,通过将几何信息嵌入二维投影并输入YOLOv11网络进行树种分类,在移动和航空激光雷达数据上测试,发现多传感器强度信息有益,该方法仅依赖几何信息,公开了相关数据集,取得较好分类结果。

Comments 25 pages, 10+4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11585 2026-07-21 cs.CV cs.AI 版本更新 57%

OV-MAP: Open-Vocabulary Zero-Shot 3D Instance Segmentation Map for Robots

OV-MAP:用于机器人的开放词汇零样本3D实例分割地图

Juno Kim, Yesol Park, Hye-Jung Yoon, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(人工智能交叉学科项目,首尔国立大学) Artificial Intelligence Institute, Seoul National University(人工智能研究所,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对移动机器人开放世界3D映射,提出OV-MAP方法,通过集成开放特征到3D地图提升物体识别能力,利用类无关分割模型等克服相邻体素特征重叠问题,经实验验证其在多环境下零样本性能、鲁棒性和适应性优越。

Comments 7 pages, 7 figures. Published in the Proceedings of the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024, pp. 13780-13786

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30868 2026-07-21 math.NA cs.NA hep-lat math-ph math.MP 版本更新 50%

Vector alignment in matrix Lie groups

矩阵李群中的向量对齐

Congzhou M Sha

专题命中 点云 :point cloud(abstract)

AI总结 提出一种李代数方法,通过伪逆、矩阵对数、投影到李代数和矩阵指数四步,实现任意矩阵李群中向量对齐的精确求解,并给出牛顿校正以优化噪声数据下的性能。

Comments 23 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2512.18953 2026-07-21 cs.CV 版本更新 57%

Symmetry Matters: Auditing and Symmetrizing 3D Generative Models

对称性至关重要:审计和对称化3D生成模型

Nicolas Caytuiro, Ivan Sipiran

机构 * University of Chile(智利大学)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。

Comments 12 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2606.27412 2026-07-21 cs.CV cs.AI cs.GR eess.IV 版本更新 62%

From Scene-Centric to Observer-Centric: Modeling Observer-Aware Relations for 3D Scene Graph Generation

并非所有关系都同样旋转:面向视角鲁棒的3D场景图生成的变换感知解耦

Jingjun Sun, Chaowei Wang, Zhirui Liu, Jiaxu Tian, Ming Yang, Yaoxing Wang, Yan Di, Shan Gao

机构 * Northwestern Polytechnical University(西北工业大学) ShanghaiTech University(上海科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.GR

AI总结 提出变换感知解耦(TAD)框架,通过将关系推理分解为视角稳定和视角变化两部分,结合视角稳定的对象表示,实现3D场景图生成在偏航视角变化下的鲁棒性,无需训练时旋转增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 57%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 空间理解 :3D reconstruction(abstract);分类 cs.RO

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏