arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-12 至 2026-08-12 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2608.10888 2026-08-12 cs.CV 新提交 57%

Sensor-Informed Per-Point Covariance for Structured-Light 3D Imaging

面向结构光三维成像的传感器感知逐点协方差

Sehoon Tak, Jae-Sang Hyun

机构 * Yonsei University(延世大学) Yonsei Institute for Embodied Intelligence(延世具身智能研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文针对结构光三维成像中逐点协方差未反映测量过程的问题,提出传感器感知一阶方法构建逐点3×3协方差场,实验验证其在G-ICP配准中性能优于各向同性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01214 2026-08-12 math.AT cs.CG 50%

Core Bifiltration

Nello Blaser, Morten Brun, Odin Hoff Gardaa, Lars M. Salbu

专题命中 三维重建 :point cloud(abstract)

Comments 24 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 11 篇

2608.10286 2026-08-12 cs.CV 新提交 91%

TRACE-GS: On-Policy Trajectory Distillation with Privileged Geometric Conditioning for Sparse-View 3DGS Restoration

TRACE-GS:用于稀疏视图3D高斯溅射(3DGS)恢复的带特权几何条件的在线策略轨迹蒸馏

Linlian Jiang, Yuchen Xi, Sadman Rakib Pinon, Ruigang Yang, Yang Wang, Xinxin Zuo

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 TRACE-GS是首个利用训练时的特权几何条件,将扩散先验适配到稀疏视图3DGS恢复的在线策略轨迹蒸馏框架,在各设置下实现了一致性能提升与强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 89%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10938 2026-08-12 cs.CV 新提交 87%

GS-CPE: Unified 6-Degree-of-Freedom Camera Pose Estimation via 3D Gaussian Splatting

GS-CPE:基于3D高斯溅射的统一6自由度相机位姿估计

Huaiyuan Weng, Chul Min Yeum, Su-Min Kang

机构 * University of Waterloo(滑铁卢大学) Soongsil University(崇实大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出GS-CPE框架,通过由粗到细策略统一几何粗位姿估计与3D高斯溅射精调,在多数据集上实现最优视觉定位性能,兼顾精度与泛化能力。

Comments 8 pages, accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10345 2026-08-12 cs.CV 新提交 87%

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

CasDeblurGS:用于从两张模糊图像重建3D高斯溅射的级联2D到3D多视图一致性方法

Haeyun Choi, Minhyuk Jang, I-Gil Kim

机构 * University of Virginia(弗吉尼亚大学) KT R&D Center(KT研发中心)

专题命中 Gaussian Splatting :NeRF(summary_cn,abstract);Gaussian Splatting(title);分类 cs.CV

AI总结 CasDeblurGS是一种级联框架,仅用两张已知内参的运动模糊图像即可重建连贯3D场景,在Deblur-NeRF场景上PSNR较基线提升1.19dB和2.11dB,渲染与几何一致性均改善。

Comments Accepted to the ECCV 2026 MUSTCV Workshop. Project page: https://haeyun-choi.github.io/Cascaded2D3D_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10602 2026-08-12 cs.CV cs.GR 新提交 87%

Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization

高斯雕刻:通过场优化实现端到端可控的表面重建

Ke Jiaxin, Juncheng Liu, Yi Wang, Zhouhui Lian, Bin Liu, Shengfa Wang, Xiangjia He

机构 * Dalian University of Technology(大连理工大学) Massey University(梅西大学) Peking University(北京大学) University of Nottingham Ningbo China(宁波诺丁汉大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对3DGS在视角有限时表面重建精度不足且几何误差难校正的问题,本文提出高斯雕刻框架,通过双层训练策略结合多分辨率细分方案实现高质量可控表面重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11100 2026-08-12 cs.GR 新提交 79%

WildFireGS: Physics-Based Wildfire Simulation in Large-Scale Semantics-Enriched Gaussian Splatting Forest Scenes

WildFireGS:基于物理的大规模语义增强高斯溅射森林场景野火模拟

Nienke Driessen, Joris Rijsdijk, Sören Pirk, Wojtek Palubicki, Dominik L. Michels, Michael Weinmann

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.GR

AI总结 WildFireGS是直接在大规模语义增强3D高斯溅射森林重建结果上运行的基于物理的野火模拟框架,可实现真实环境下的野火模拟,经实验验证其行为物理一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04597 2026-08-12 cs.CV 79%

Targetless LiDAR-Camera Calibration with Neural Gaussian Splatting

无目标激光雷达-摄像头校准与神经高斯点分布

Haebeom Jung, Namtae Kim, Jungwoo Kim, Jaesik Park

机构 * Department of Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目系,首尔国立大学) Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出无目标激光雷达-摄像头校准方法,通过神经高斯点分布优化传感器姿态,实现鲁棒且可推广的校准,优于现有方法并在多数据集上表现优异。

Comments IEEE RA-L 2026. Project page: https://zang09.github.io/tlc-calib-site

Journal ref 2026 IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 74%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11077 2026-08-12 cs.CV 新提交 70%

Learning Gaussian Structure: Intervention-Guided Density Control for Feed-Forward Driving Reconstruction

学习高斯结构:用于前向驾驶重建的干预引导密度控制

Hang Li, Jiahe Li, Meiying Gu, Jin Zheng, Lina Yu, Xiao Bai

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Learning Gaussian Structure(LGS)框架,通过干预引导的高斯结构调整与跨时间点查询,在Waymo Open Dataset和PandaSet上实现了优于现有方法的驾驶场景重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10712 2026-08-12 cs.CV 新提交 70%

Compact Feed-Forward 3D Gaussians via Saliency-Guided Primitive Merging

基于显著性引导基元合并的紧凑前馈三维高斯模型

Tim-Felix Fassch, Jochen Kall, Cyrill Stachniss

机构 * Bosch Research(博世研究院) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对前馈三维高斯方法基元冗余问题,提出显著性引导的基元合并流水线,可在仅1/20高斯数量下保留视觉质量,实现高效紧凑的三维场景表示与渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10682 2026-08-12 cs.CV 新提交 70%

Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction

面向单帧环视驾驶场景重建的视觉几何基础感知高斯模型

Junhong Lin, Jinlong Wang, Xianda Guo, Yanlun Peng, Wei Zheng, Guoqing Liu, Hanli Wang, Tiesong Zhao, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Minieye Corporation(Minieye公司) Tongji University(同济大学) Fuzhou University(福州大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VGGD框架,通过引入视觉几何先验、双路径颈部等模块,在nuScenes基准上实现了单帧环视驾驶场景重建的最优渲染质量与几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 5 篇

2608.10708 2026-08-12 cs.CV 新提交 74%

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

自几何:面向几何一致的3D视觉基础模型的无GT、即插即用测试时自适应方法

Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

机构 * Chung-Ang University(中央大学) Kyung Hee University(庆熙大学)

专题命中 点云 :3D vision(title);分类 cs.CV

AI总结 本文针对3D视觉基础模型测试时几何一致性不足的问题,提出即插即用的Self-Geometry自适应流水线,结合多视图与对极一致性损失等,在6种模型和4个基准上实现位姿与几何估计的一致提升。

Comments Project page: https://cmlab-korea.github.io/Self-Geometry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 57%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09997 2026-08-12 cs.LG cs.CV 新提交 57%

Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

Transformer几何观测站TGO-IV:发展拓扑观测站

Kaustubh Kapil, Kishor P. Upla

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究针对Transformer可解释性研究中表示演变分析的不足,提出基于持续同调的Transformer几何观测站TGO-IV拓扑框架,通过多种拓扑工具全面分析表示点云的全局拓扑演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14019 2026-08-12 math.AT cs.CG 50%

Monoidal Rips: Stable Multiparameter Filtrations of Directed Networks

Nello Blaser, Morten Brun, Odin Hoff Gardaa, Lars M. Salbu

专题命中 点云 :point cloud(abstract)

Comments 32 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07484 2026-08-12 math.AT 50%

Relative persistent homology

Nello Blaser, Morten Brun

专题命中 点云 :point cloud(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 4 篇

2604.08991 2026-08-12 cs.CV cs.AI 版本更新 79%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 57%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26087 2026-08-12 cs.CV 版本更新 57%

Easy3D-Labels: Supervising Semantic Occupancy Estimation with 3D Pseudo-Labels for Automotive Perception

Easy3D-Labels: 通过3D伪标签监督语义占用估计用于汽车感知

Seamie Hayes, Ganesh Sistu, Tim Brophy, Ciaran Eising

机构 * Department of Electronic and Computer Engineering, University of Limerick(利默里克大学电子与计算机工程系) Data Driven Computer Engineering Research Centre, University of Limerick(利默里克大学数据驱动计算机工程研究中心) SFI CRT Foundations in Data Science, University of Limerick(爱尔兰科学基金会数据科学基础研究中心,利默里克大学)

专题命中 空间理解 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Easy3D-Labels,利用Grounded-SAM和Metric3Dv2生成3D伪标签,提升汽车感知中语义占用估计的性能,实现mIoU和RayIoU显著提升。

Comments Accepted at IEEE OJVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 57%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏