arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-25 至 2026-03-25 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2603.22851 2026-03-25 cs.CV cs.AI 83%

UniQueR: Unified Query-based Feedforward 3D Reconstruction

UniQueR:统一的基于查询的前馈3D重建

Chensheng Peng, Quentin Herau, Jiezhi Yang, Yichen Xie, Yihan Hu, Wenzhao Zheng, Matthew Strong, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 三维重建 :3D reconstruction(title,abstract);NeRF(abstract);分类 cs.CV

AI总结 UniQueR通过统一的基于查询的前馈框架实现高效准确的3D重建,利用稀疏3D查询推理问题,减少内存和计算成本,提升几何表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22631 2026-03-25 cs.CV 79%

CAM3R: Camera-Agnostic Model for 3D Reconstruction

CAM3R:用于3D重建的相机无关模型

Namitha Guruprasad, Abhay Yadav, Cheng Peng, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Virginia(弗吉尼亚大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 CAM3R通过双视网络和Ray-Aware Global Alignment框架,实现对宽角度相机模型的3D重建,解决了传统方法在非矩形光学图像中的几何退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22572 2026-03-25 cs.CV 79%

FullCircle: Effortless 3D Reconstruction from Casual 360$^\circ$ Captures

FullCircle:从随意的360度拍摄中轻松进行3D重建

Yalda Foroutan, Ipek Oztas, Daniel Rebain, Aysegul Dundar, Kwang Moo Yi, Lily Goli, Andrea Tagliasacchi

机构 * Simon Fraser University(西蒙弗雷泽大学) Bilkent University(比尔肯特大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 三维重建 :3D reconstruction(title);3DGS(abstract);分类 cs.CV

AI总结 本文提出了一种直接从原始360度摄像机捕获数据进行3D重建的实用流程,无需特殊拍摄协议或预处理,且对人类操作员的干扰具有鲁棒性,展示了360度拍摄在随意重建中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22450 2026-03-25 cs.CV cs.GR 62%

Static Scene Reconstruction from Dynamic Egocentric Videos

从动态第一人称视频中进行静态场景重建

Qifei Cui, Patrick Chen

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种适应长时动态第一人称视频的鲁棒静态重建方法,通过抑制动态前景和分块重建策略提升全局一致性,有效减少轨迹漂移,实验表明在HD-EPIC和室内无人机数据集上显著提高了绝对轨迹误差和静态几何的视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07533 2026-03-25 cs.RO cs.CV 62%

ACCURATE: Arbitrary-shaped Continuum Reconstruction Under Robust Adaptive Two-view Estimation

ACCURATE:任意形状连续体的鲁棒自适应双视角估计下的精确重建

Yaozhi Zhang, Shun Yu, Yugang Zhang, Yang Liu

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出ACCURATE框架,结合图像分割神经网络与几何约束拓扑遍历算法,实现对任意形状连续体的高精度重建,实验表明在模拟和真实数据集上均达到亚毫米精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22757 2026-03-25 cs.CV 57%

Multimodal Industrial Anomaly Detection via Geometric Prior

基于几何先验的多模态工业异常检测

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出基于几何先验的异常检测网络GPAD,通过点云专家模型提取细粒度几何特征,并结合两阶段融合策略和几何先验实现高效多模态数据融合,提升几何缺陷检测精度。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 4 篇

2508.03643 2026-03-25 cs.CV 86%

Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images

Uni3R:通过通用高斯喷射从无序多视角图像实现统一的3D重建与语义理解

Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang, Eunbyung Park

机构 * Sungkyunkwan University(顺天乡大学) Huazhong University of Science & Technology(华中科技大学) Yonsei University(延世大学) Horizon Robotics(Horizon机器人) D-Robotics

专题命中 Gaussian Splatting :Gaussian Splatting(title);3D reconstruction(title);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Uni3R框架,通过统一的3D场景表示实现高保真视角合成和开放词汇语义分割,展示了其在多个基准上的优越性能。

Comments The code is available at https://github.com/HorizonRobotics/Uni3R

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23192 2026-03-25 cs.GR cs.MM 85%

GTLR-GS: Geometry-Texture Aware LiDAR-Regularized 3D Gaussian Splatting for Realistic Scene Reconstruction

GTLR-GS:基于几何与纹理的激光雷达正则化3D高斯点划法用于逼真场景重建

Yan Fang, Jianfei Ge, Jiangjian Xiao

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);point cloud(abstract);分类 cs.GR

AI总结 本文提出一种以激光雷达为中心的3D高斯点划法框架,通过引入度量几何先验,解决传统方法在尺度模糊、几何一致性差和视点依赖等问题,提升场景重建的几何精度和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 73%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV、cs.RO

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08809 2026-03-25 cs.CV 57%

Where, What, Why: Toward Explainable 3D-GS Watermarking

何处、何物、为何:迈向可解释的3D-GS水印

Mingshu Cai, Jiajun Li, Osamu Yoshie, Yuya Ieiri, Yixuan Li

机构 * Waseda University(早稻田大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出一种原生表示框架,通过三专家模块和安全预算感知门实现水印载体选择和质量保护,结合通道组掩码提升水印鲁棒性和可解释性,相比现有方法在PSNR和比特精度上均有提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2603.23356 2026-03-25 hep-ex cs.AI cs.CV cs.LG 79%

Contrastive Metric Learning for Point Cloud Segmentation in Highly Granular Detectors

基于对比度度量学习的点云分割方法用于高粒度探测器

Max Marriott-Clarke, Lazar Novakovic, Elizabeth Ratzer, Robert J. Bainbridge, Loukas Gouskos, Benedikt Maier

机构 * Blackett Laboratory, Imperial College London, UK(帝国理工学院伦敦学院布莱克特实验室) Brown Center for Theoretical Physics and Innovation (BCTPI), Brown University, USA(布朗大学理论物理与创新中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出基于监督对比度度量学习的点云分割方法,通过学习潜在表示实现点云分割,相比传统方法更稳定且分离度更高,提升重建效率和纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22420 2026-03-25 cs.CV 79%

Spatially-Aware Evaluation Framework for Aerial LiDAR Point Cloud Semantic Segmentation: Distance-Based Metrics on Challenging Regions

面向空中的激光雷达点云语义分割的空间感知评估框架:基于距离的挑战区域指标

Alex Salvatierra, José Antonio Sanz, Christian Gutiérrez, Mikel Galar

机构 * Department of Statistics, Computer Science and Mathematics and Institute of Smart Cities (ISC), Public University of Navarre (UPNA)(统计、计算机科学与数学系和智能城市研究所(ISC),纳瓦拉公共大学) Tracasa Instrumental

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出一种新的评估框架,通过引入基于距离的指标和聚焦于困难点的评估方法,解决传统指标在空中有激光雷达数据中的局限性,揭示空间误差模式,提升地球观测应用中的模型选择。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23162 2026-03-25 cs.RO 74%

LiZIP: An Auto-Regressive Compression Framework for LiDAR Point Clouds

LiZIP:一种用于激光雷达点云的自回归压缩框架

Aditya Shibu, Kayvan Karim, Claudio Zito

机构 * MACS Heriot Watt University Dubai, United Arab Emirates(MACS 哈罗德·瓦特大学迪拜,阿联酋)

专题命中 点云 :point cloud(title);分类 cs.RO

AI总结 本文提出LiZIP框架,通过神经预测编码实现轻量级近无损压缩,优于现有方法,在不同数据集上实现更高的压缩比和效率,适用于V2X和大规模云存储。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 57%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO 57%

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12602 2026-03-25 cs.CV cs.AI 57%

MS-DGCNN++: Multi-Scale Dynamic Graph Convolution with Scale-Dependent Normalization for Robust LiDAR Tree Species Classification

MS-DGCNN++:多尺度动态图卷积与尺度依赖归一化用于鲁棒点云树种分类

Said Ohamouddou, Hanaa El Afia, Mohamed Hamza Boulaich, Abdellatif El Afia, Raddouane Chiheb

机构 * ENSIAS Mohammed V University(摩洛哥穆罕默德五世大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MS-DGCNN++,通过多尺度动态图卷积与尺度依赖归一化提升点云树种分类鲁棒性,实验表明其在不同SNR环境下具有更高的准确率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2603.23246 2026-03-25 cs.CV 57%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 新视角合成 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 1 篇

2603.23386 2026-03-25 cs.CV cs.GR cs.RO 67%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR、cs.RO

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 3 篇

2512.02505 2026-03-25 cs.CV 79%

GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解

Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 本文提出GeoDiT,一种基于扩散的视觉-语言模型,用于地理空间理解。该模型通过并行细化过程实现整体粗到细的合成,解决了传统自回归模型在结构化输出生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV 57%

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 57%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2603.23370 2026-03-25 cs.CV 57%

Object Pose Transformer: Unifying Unseen Object Pose Estimation

物体姿态转换器:统一未见物体姿态估计

Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Toyota Motor Europe(丰田欧洲公司)

专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV

AI总结 本文提出Object Pose Transformer,通过任务分解统一解决未见实例姿态估计问题,同时预测深度、点云图、相机参数和归一化物体坐标,实现类别级绝对姿态和未见物体相对姿态估计。

Comments Project Page: https://colin-de.github.io/OPT-Pose/

详情

展开后加载摘要…

URL PDF HTML 收藏