arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-20 至 2026-05-20 共收录 20 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2605.19539 2026-05-20 cs.CV 79%

Trust It or Not: Evidential Uncertainty for Feed-Forward 3D Reconstruction with Trust3R

信任它还是不信任它:基于信任3R的证据不确定性用于前馈3D重建

Zihao Zhu, Wenyuan Zhao, Nuo Chen, Chao Tian, Zhiwen Fan

机构 * Department of Electrical and Computer Engineering, Texas A\&M University, College Station, TX, USA(电子与计算机工程系,德克萨斯农工大学,学院站,德克萨斯州,美国)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文提出Trust3R,一种轻量级的证据不确定性框架,用于前馈3D重建,通过结合门控残差均值细化和正态-逆 Wishart 证据头,生成点云不确定性估计,提升几何重建的准确性和可靠性。

Comments Accepted at ICML 2026. 10 pages main paper, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17942 2026-05-20 cs.CV 79%

UAVFF3D: A Geometry-Aware Benchmark for Feed-Forward UAV 3D Reconstruction

UAVFF3D: 一种面向无人机3D重建的几何感知基准

Xiang Yang, Yongli Wang, HaiFeng Li, Yunsheng Zhang

机构 * School of Geosciences and Info-Physics(地质科学与信息物理学院)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文提出UAVFF3D基准,旨在解决无人机摄影测量中因相机几何变化导致的重建问题,通过引入真实-合成图像和控制测试子集,提升无人机领域适应性和鲁棒性。

Comments 19 pages, 16 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06270 2026-05-20 cs.CV 79%

Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction

Spark3R: 非对称令牌缩减使快速前馈3D重建

Zecheng Tang, Jiaye Fu, Qiankun Gao, Haijie Li, Yanmin Wu, Jiaqi Zhang, Siwei Ma, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文提出Spark3R框架,通过非对称令牌缩减技术,在不重新训练的情况下加速前馈3D重建模型,实现高达28倍的速度提升同时保持高质量重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 73%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 三维重建 :point cloud(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 5 篇

2605.19304 2026-05-20 cs.CV cs.GR 92%

MMGS: 10$\times$ Compressed 3DGS through Optimal Transport Aggregation based on Multi-view Ranking

MMGS: 通过多视图排序基于最优传输的10倍压缩3DGS

Beizhen Zhao, Sicheng Yu, Ziran Yin, Dongxu Shen, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于最优传输聚合的多视图排序方法,通过全局几何分布匹配问题优化高斯参数,实现3DGS的10倍压缩和10倍加速训练速度,同时保持高质量渲染效果。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20044 2026-05-20 cs.CV 85%

OP2GS: Object-Aware 3D Gaussian Splatting with Dual-Opacity Primitives

OP2GS: 带双不透明度的物体感知3D高斯散射

Guiyu Liu, Niklas Vaara, Janne Mustaniemi, Juho Kannala, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰) Aalto University, Finland(阿尔托大学,芬兰)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 OP2GS通过引入双不透明度机制,为每个原始体素添加显式实例身份和专用实例不透明度σ*,以解决3D高斯散射在物体层面身份缺失的问题,从而提升开放词汇场景理解的性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19949 2026-05-20 cs.CV 79%

Feed-Forward Gaussian Splatting from Sparse Aerial Views

从稀疏航拍视图进行前馈高斯点扩散

Dongli Wu, Zhuoxiao Li, Tongyan Hua, Yinrui Ren, Xiaobao Wei, Rongjun Qin, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Peking University(北京大学) The Ohio State University(俄亥俄州立大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出AnyCity框架,通过观察驱动的生成重建方法,解决稀疏航拍视图中大规模城市场景重建中的证据不平衡问题,通过几何潜在表示和条件化空中完成标记预测,实现高质量的3D高斯点场重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19600 2026-05-20 cs.RO 77%

FlyMirage: A Fully Automated Generation Pipeline for Diverse and Scalable UAV Flight Data via Generative World Model

FlyMirage: 一种用于生成多样化和可扩展的无人机飞行数据的完全自动化生成流程

Jinhan Li, Xijie Huang, Zhaoqi Wang, Yijin Wang, Weiqi Ge, Qiyi He, Mo Zhu, Fei Gao, Yuze Wu, Xin Zhou

机构 * State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou 310027, China(浙江大学工业控制技术状态重点实验室,杭州310027,中国) Differential Robotics, Hangzhou 311121, China(差分机器人,杭州311121,中国)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 本文提出FlyMirage,一种完全自动化的生成流程,通过生成世界模型生成大规模、多样化且逼真的无人机视觉-语言导航数据,支持下一代具身导航模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17916 2026-05-20 cs.CV 77%

PanoWorld: A Generative Spatial World Model for Consistent Whole-House Panorama Synthesis

PanoWorld: 一种生成式空间世界模型,用于一致的整屋全景合成

Jinrang Jia, Zhenjia Li, Yijiang Hu, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract);3D generation(abstract);分类 cs.CV

AI总结 本文提出PanoWorld,一种生成式空间世界模型,通过自回归生成基于节点的360度全景图,实现一致的整屋全景合成,解决了纯2D生成器在视角变化时几何和材质重新想象的问题,以及单一3D生成在多房间尺度下的高成本和纹理丢失问题。

Comments 17

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2404.07106 2026-05-20 cs.CV cs.GR 81%

3DMambaComplete: Exploring Structured State Space Model for Point Cloud Completion

3DMambaComplete:探索结构状态空间模型用于点云补全

Yixuan Li, Weidong Yang, Ben Fei

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院数据科学实验室) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出3DMambaComplete,一种基于Mamba框架的点云补全网络,通过HyperPoint生成、分散和变形模块有效解决点云补全中的局部细节丢失和计算复杂度问题,实验表明其优于现有方法。

Comments 24 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00404 2026-05-20 cs.CV 79%

Hard-Label Black-Box Attacks on 3D Point Clouds

针对3D点云的硬标签黑盒攻击

Daizong Liu, Yunbo Tao, Junhao Dong, Keke Tang, Pan Zhou, Wei Hu, Yew-Soon Ong

机构 * Institute for Math & AI(数学与人工智能研究院) Wuhan University(武汉大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen Huazhong University of Science and Technology Research Institute(深圳华中科技大学研究机构) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) Cyberspace Institute of Advanced Technology(先进技术网络空间研究院) Guangzhou University(广州大学) Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于硬标签黑盒攻击的3D点云攻击方法,通过引入新的频谱感知决策边界算法生成高质量对抗样本,以提升攻击性能和对抗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09203 2026-05-20 cs.CV cs.RO 73%

3D Modeling and Automated Measurement of Concrete Cracks via Segment Anything Refinement and Visual Inertial LiDAR Fusion

通过段落任何精修和视觉惯性LiDAR融合进行混凝土裂缝的3D建模与自动测量

Pengru Deng, Jiapeng Yao, Chun Li, Su Wang, Xinrun Li, Varun Ojha, Xuhui He

机构 * School of Civil Engineering(土木工程学院) Central South University(中南大学) Hunan Provincial Key Laboratory for Disaster Prevention and Mitigation of Rail Transit Engineering Structures(湖南省铁路工程结构灾害预防与 mitigation 工程结构重点实验室) Nvidia School of Computing(计算学院) Newcastle University(新castle大学)

专题命中 点云 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种结合计算机视觉技术和多模态同时定位与建图(SLAM)的创新框架,用于二维裂缝检测、三维重建和三维自动裂缝测量,解决了现有方法在适应性和鲁棒性方面的不足,特别是在处理曲线或复杂几何形状时的挑战。

Comments Title and author list updated

Journal ref Computer-Aided Civil and Infrastructure Engineering, Volume 45, 2026, 100019, ISSN 1093-9687

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19191 2026-05-20 physics.optics 67%

Open-source segmentation and biometry dataset using spectrally-multiplexed whole-eye optical coherence tomography

开源的基于光谱复用全眼光学相干断层扫描的分割和生物特征数据集

Ruobing Qian, Catherine Fromm, Pushkar Anand, Kyle Johnson, Zach Willms, Yimin Ding, Weihan Zhang, Ali Behrooz, Mohamed El-Haddad

专题命中 点云 :3D reconstruction(abstract);point cloud(abstract)

AI总结 本文提出了一种新颖的光谱复用全眼光学相干断层扫描系统,结合深度学习进行表面分割和3D畸变校正,实现了高精度的3D重建,同时开源了包含6621个处理后的体积的数据集,用于改善相关领域的数据获取瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19727 2026-05-20 cs.CV 57%

Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

Tango3D: 向全局和局部2D-3D对应关系对齐迈进

Zebin He, Mingxin Yang, Shuhui Yang, Hanxiao Sun, Xintong Han, Chunchao Guo, Wenhan Luo

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Tango3D,一种统一密集对应和全局检索的3D基础模型,通过几何感知的2D视觉骨干网络和预训练的3D VAE将图像编码为2D片段,点云编码为3D标记,并映射到共享空间以实现局部像素-点对齐和全局语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19200 2026-05-20 cs.GR cs.CG 57%

Spatially Accelerated Winding Numbers for Curved Geometry

空间加速的 winding 数用于曲面几何

Jacob Spainhour, Brad Whitlock, Kenneth Weiss

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 本文提出了一种空间加速的 winding 数方法,用于处理曲面几何中的包含查询,通过构建包围盒层次结构来高效计算 NURBS 曲线和曲面的 winding 数,同时保持几何特征的准确性。

Comments 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2506.05317 2026-05-20 cs.CV 70%

ProJo4D: Progressive Joint Optimization for Sparse-View Inverse Physics Estimation

ProJo4D:渐进式联合优化用于稀疏视图逆物理估计

Daniel Rho, Jun Myeong Choi, Biswadip Dey, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Meta Reality Labs(Meta现实实验室)

专题命中 新视角合成 :3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出ProJo4D,一种渐进式联合优化框架,用于解决稀疏视图下逆物理参数估计问题,通过逐步扩展联合优化参数集,提高了4D未来状态预测和物理参数估计的准确性,达到几何精度提升10倍的性能。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 3 篇

2605.20165 2026-05-20 cs.CV 57%

CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

CaMo:基于摄像机运动的视觉-语言模型评估与训练

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jianxu Shangguan, Cheng-Yen Yang, Jenq-Neng Hwang

机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。

Comments Code and model available at https://github.com/hsiangwei0903/CaMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23747 2026-05-20 cs.CV cs.AI cs.LG 57%

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20006 2026-05-20 cs.AI 50%

GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

GeoX:通过自我对战和可验证奖励掌握地理空间推理

Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha

机构 * KAIST(韩国科学技术院) MPI-SP(马克斯·普朗克研究所) MPI-SWS(马克斯·普朗克研究所)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出GeoX框架,通过自我对战和可验证奖励解决图像 grounded 的复杂空间问题,无需大规模人工标注数据,提升了基础视觉语言模型在地理空间理解上的性能。

Comments 26 pages,12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 1 篇

2511.13864 2026-05-20 cs.CV 57%

GRLoc: Geometric Representation Regression for Visual Localization

GRLoc: 用于视觉定位的几何表示回归

Changyang Li, Xuejian Ma, Lixiang Liu, Zhan Li, Qingan Yan, Yi Xu

机构 * Goertek Alpha Labs(歌尔声学实验室)

专题命中 SLAM与定位 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于几何表示回归(GRR)的方法,通过分离旋转和翻译预测来提升视觉定位的性能,并在7-Scenes和Cambridge Landmarks数据集上实现了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏