arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-03 至 2026-04-03 共收录 18 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2604.00528 2026-04-03 cs.CV cs.AI 70%

Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding

思考、行动、构建:一种基于视觉语言模型的代理框架用于零样本3D视觉定位

Haibo Wang, Zihao Lin, Zhiyang Xu, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 三维重建 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出TAB框架,通过2D到3D重建范式直接处理原始RGB-D流,利用2D VLMs解析复杂空间语义并结合多视图几何构建3D结构,克服传统方法依赖预处理点云的局限,实验证明其在ScanRefer和Nr3D上优于零样本方法和全监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20331 2026-04-03 cs.CV 70%

GVGS: Gaussian Visibility-Aware Multi-View Geometry for Accurate Surface Reconstruction

GVGS: 基于高斯可见性感知的多视角几何用于准确表面重建

Mai Su, Qihan Yu, Zhongtao Wang, Yilong Li, Chengwei Pan, Yisong Chen, Guoping Wang, Fei Zhu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 三维重建 :Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV

AI总结 本文提出GVGS方法,通过显式建模高斯体的可见性,改进多视角几何一致性,提升表面重建精度,实验表明优于现有基于高斯的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2601.15475 2026-04-03 cs.CV 84%

Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events

透过光与暗:基于传感器物理的去模糊HDR NeRF从单曝光图像和事件

Yunshan Qi, Lin Zhu, Nan Bao, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 NeRF :NeRF(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出基于传感器物理的NeRF框架,通过单曝光模糊LDR图像和对应事件实现高动态范围和锐利3D表示的合成,利用CRF模型提升HDR和去模糊效果。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. Project Page: https://icvteam.github.io/See-NeRF.html. Our code and datasets are publicly available at https://github.com/iCVTEAM/See-NeRF

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 7 篇

2604.01605 2026-04-03 cs.CV cs.RO 88%

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);3D reconstruction(abstract);point cloud(abstract)

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01884 2026-04-03 cs.CV 85%

GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting

GS²:基于图的空间分布优化用于紧凑型3D高斯散射

Xianben Yang, Tao Wang, Yuxuan Li, Yi Jin, Haibin Ling

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(交通大数据与人工智能教育部重点实验室;北京交通大学计算机与信息技术学院) School of Computer and Information Technology, Beijing Jiaotong University(西湖大学人工智能系) Department of Artificial Intelligence, Westlake University

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出GS²,通过优化高斯点的空间分布提升3D高斯散射的重建质量,采用ELBO适应性密集策略和基于图的特征编码模块,实现更紧凑的表示和更高质量的渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01551 2026-04-03 cs.GR 83%

ColorGradedGaussians: Palette-Based Color Grading for 3D Gaussian Splatting via View-Space Sparse Decomposition

ColorGradedGaussians:基于调色板的3D高斯溅射颜色分级 via 视空间稀疏分解

Cheng-Kang Ted Chao, Yotam Gingold

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.GR

AI总结 本文提出基于调色板的3D高斯溅射颜色分级方法,通过视空间稀疏分解实现实时交互式颜色编辑,解决传统方法中颜色分解稀疏性不足导致的编辑质量下降问题。

Comments 9 pages, 2 figure pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22279 2026-04-03 cs.CV 81%

Learning Fine-Grained Geometry for Sparse-View Splatting via Cascade Depth Loss

通过级联深度损失学习细粒度几何以实现稀疏视角拼接

Wenjun Lu, Haodong Chen, Anqi Yi, Guoxi Huang, Yuk Ying Chung, Kun Hu, Zhiyong Wang

机构 * School of Computer Science The University of Sydney Sydney, Australia School of Computer Science University of Bristol Bristol, United Kingdom School of Science Edith Cowan University Perth, Australia

专题命中 Gaussian Splatting :NeRF(abstract);Gaussian Splatting(abstract);3DGS(abstract);novel view synthesis(abstract)

AI总结 本文提出HDGS框架,通过级联Pearson相关损失提升稀疏视角下几何重建的结构精度,实验表明在LLFF和DTU数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01844 2026-04-03 cs.CV 79%

FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting

FaCT-GS:基于高斯点撒的快速可扩展CT重建

Pawel Tomasz Pieta, Rasmus Juul Pedersen, Sina Borgi, Jakob Sauer Jørgensen, Jens Wenzel Andreasen, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出FaCT-GS框架,通过优化体素化和光栅化流程,实现快速且可扩展的CT重建,比现有方法快4-13倍,适用于不同投影尺寸。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01678 2026-04-03 cs.CV 74%

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director: 用于动态场景建模与理解的实例感知高斯点云

Yuheng Jiang, Yiwen Cai, Zihao Wang, Yize Wu, Sicheng Li, Zhuo Su, Shaohui Jiao, Lan Xu

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 Director通过联合建模人类性能、高保真渲染和实例级语义,实现动态场景的时空高斯表示,提升动态场景理解的稳定性与准确性。

Comments Project page: https://caiyw2023.github.io/Director/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01994 2026-04-03 cs.CV 57%

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

Resonance4D: 频域运动监督用于预设-free 物理参数学习的4D动态物理场景模拟

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang

机构 * Xidian University(西安电子科技大学) Jimei University(集美大学) Sun Yat-sen University(中山大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 Resonance4D通过结合3D高斯散射与物质点方法,提出轻量且物理表达的监督策略,解决动态一致性问题,减少训练成本和内存开销,实现高保真的4D物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 2 篇

2604.02252 2026-04-03 cs.CV 57%

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

专题命中 点云 :spatial understanding(abstract);分类 cs.CV

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01598 2026-04-03 cs.CV 57%

Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition

Riemannian和Symplectic几何用于层次化文本驱动的位置识别

Tianyi Shang, Zhenyu Li

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SympLoc框架,通过多级对齐策略提升文本到点云定位的鲁棒性,实验显示在KITTI360Pose数据集上Top-1召回率提升19%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2604.02331 2026-04-03 cs.CV 57%

EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors

EventHub:无需主动传感器的通用事件基立体网络数据工厂

Luca Bartolomei, Fabio Tosi, Matteo Poggi, Stefano Mattoccia, Guillermo Gallego

机构 * Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心 (ARCES)) TU Berlin, Robotics Institute Germany(柏林工业大学德国机器人研究所) Einstein Center Digital Future(爱因斯坦数字未来中心) SCIoI Excellence Cluster(SCIoI卓越集群)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 EventHub利用标准彩色图像生成代理标注和事件,无需主动传感器的地面真实标注,重新利用先进RGB立体模型处理事件数据,提升立体网络的泛化能力。

Comments CVPR 2026. Project Page: https://bartn8.github.io/eventhub/ Code: https://github.com/bartn8/eventhub

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 3D生成 1 篇

2604.02289 2026-04-03 cs.CV cs.AI 79%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 4 篇

2601.16885 2026-04-03 cs.CV cs.RO 62%

GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss

GPA-VGGT:通过几何和物理感知损失自监督学习适应大规模定位

Yangfan Xu, Lilian Zhang, Xiaofeng He, Pengdong Wu, Wenqi Wu, Jun Mao

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出GPA-VGGT框架,通过自监督学习提升大规模环境中的定位能力,利用几何约束和物理一致性损失优化模型,实验表明其在数百次迭代内收敛并显著提升定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02107 2026-04-03 cs.RO 57%

HyVGGT-VO: Tightly Coupled Hybrid Dense Visual Odometry with Feed-Forward Models

HyVGGT-VO:紧密耦合的混合密集视觉里程计与前馈模型

Junxiang Pan, Lipu Zhou, Baojie Chen

机构 * School of Instrument Science and Opto-electronics Engineering, Beihang University(北京航空航天大学仪器科学与光电工程学院)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出HyVGGT-VO框架,结合稀疏VO的高效计算与前馈模型的密集重建能力,实现高效实时姿态估计与密集重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01720 2026-04-03 cs.RO 57%

Hi-LOAM: Hierarchical Implicit Neural Fields for LiDAR Odometry and Mapping

Hi-LOAM:基于隐式神经场的层次化激光雷达里程计与建图

Zhiliu Yang, Jianyuan Zhang, Lianhui Zhao, Jinyu Dai, Zhu Yang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) Yunnan Key Laboratory of Intelligent Systems and Computing, Yunnan University(云南大学云南省智能系统与计算重点实验室)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.RO

AI总结 本文提出Hi-LOAM,通过多尺度隐式神经场实现激光雷达里程计与建图,采用自监督学习解决传统LOAM在复杂场景中的局限性,实验验证其在多种数据集上的优越性能。

Comments This manuscript is the accepted version of IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15557 2026-04-03 cs.RO 57%

OMCL: Open-vocabulary Monte Carlo Localization

OMCL:开放词汇蒙特卡洛定位

Evgenii Kruzhkov, Raphael Memmesheimer, Sven Behnke

机构 * Autonomous Intelligent Systems group, Computer Science Institute VI – Intelligent Systems and Robotics – and the Center for Robotics and the Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn(波恩大学自主智能系统组、计算机科学研究所VI – 智能系统与机器人学 –、机器人中心以及拉马尔机器学习和人工智能研究所)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.RO

AI总结 本文提出OMCL,结合视觉语言特征扩展蒙特卡洛定位,实现跨模态观测与地图元素关联,通过自然语言描述初始化全局定位,验证了其在室内和室外场景中的泛化能力。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏