arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-14 至 2026-05-14 共收录 27 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2605.13018 2026-05-14 cs.CV 79%

OCH3R: Object-Centric Holistic 3D Reconstruction

OCH3R: 以对象为中心的全局3D重建

Yi Du, Yang You, Xiang Wan, Leonidas Guibas

机构 * Stanford University(斯坦福大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 OCH3R提出一种统一框架,从单张RGB图像实现以对象为中心的全局3D重建,通过单次前向传递预测所有对象实例的6D位姿和详细3D重建,提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05876 2026-05-14 cs.GR cs.CV 62%

3DSS: 3D Surface Splatting for Inverse Rendering

3DSS:用于逆渲染的3D表面散射

Mae Younes, Adnane Boukhayma

机构 * INRIA, University of Rennes(INRIA,里昂大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 3DSS通过基于覆盖的合成模型,结合微facet着色和HDR光照,实现了形状、BRDF材料和光照的联合恢复,适用于多视角图像的逆渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11303 2026-05-14 cs.CV 57%

sketch2symm: Symmetry-aware sketch-to-shape generation via semantic bridging

sketch2symm: 通过语义桥梁实现的对称感知草图到形状生成

Yan Zhou, Mingji Li, Xiantao Zeng, Jie Lin, Yuexia Zhou

机构 * School of Electronic Information Engineering, Foshan University, Guangdong, China(佛山大学电子信息工程学院) School of Computer Science and Artificial Intelligence, Foshan University, Guangdong, China(佛山大学计算机科学与人工智能学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Sketch2Symm方法,通过语义桥梁增强稀疏草图表示,并利用对称约束作为几何先验,提升草图到3D形状的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV 57%

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 10 篇

2605.12919 2026-05-14 cs.CV 90%

GuardMarkGS: Unified Ownership Tracing and Edit Deterrence for 3D Gaussian Splatting

GuardMarkGS: 3D高斯溅射的统一所有权追溯与编辑威慑

Utae Jeong, Jaewan Choi, Junseok Lee, Jongheon Jeong, Sang Ho Yoon, ByoungSoo Koh, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Hanshin University(汉西大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);novel view synthesis(abstract)

AI总结 本文提出GuardMarkGS框架,通过结合全局水印目标与对抗目标,实现3D高斯溅射资产的统一所有权追溯与未经授权编辑的威慑,实验表明其在比特精度、编辑威慑和渲染质量间取得良好平衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13465 2026-05-14 cs.CV 87%

Z-Order Transformer for Feed-Forward Gaussian Splatting

Z-Order Transformer用于前馈高斯点云

Can Wang, Lei Liu, Wei Jiang, Dong Xu

机构 * The University of Hong Kong(香港大学) Futurewei Technologies Inc(未来科技公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Z-Order Transformer用于前馈高斯点云,通过稀疏注意力机制和Z-order策略有效捕捉高斯点间空间与语义关系,提升实时渲染质量与效率。

Comments Accept by CVPR 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12072 2026-05-14 cs.CV 85%

PairDropGS: Paired Dropout-Induced Consistency Regularization for Sparse-View Gaussian Splatting

PairDropGS: 基于配对 Dropout 引起的一致性正则化的稀疏视角高斯点云法

Hantang Li, Qiang Zhu, Xiandong Meng, Xingtao Wang, Debin Zhao, Xiaopeng Fan

机构 * School of Computer Science, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学学院,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,中国) Smart Coding Institute, Pengcheng Laboratory, Shenzhen, China(鹏城实验室智能编码研究所,中国) School of Computer Science, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机科学学院,中国)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出PairDropGS,通过配对Dropout引起的一致性正则化改进稀疏视角高斯点云法,提升训练稳定性与重建质量,同时保持方法的简洁性和易用性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09479 2026-05-14 cs.CV 85%

SkySplat: Generalizable 3D Gaussian Splatting from Multi-Temporal Sparse Satellite Images

SkySplat: 多时序稀疏卫星图像上的通用3D高斯点云生成

Xuejun Huang, Xinyi Liu, Yi Wan, Zhi Zheng, Bin Zhang, Mingtao Xiong, Yingying Pei, Yongjun Zhang

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部) Department of Geography and Resource Management, The Chinese University of Hong Kong(香港中文大学地理与资源管理系) China Railway Siyuan Survey and Design Group Co., LTD(中国铁路syuan调查设计集团有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 SkySplat通过整合RPC模型提升稀疏卫星图像的3D重建效率,采用自监督框架和跨自我一致性模块,实现86倍速度提升和更精确的重建结果。

Comments AAAI 2026. Code is available at https://github.com/NanCheng2001/SkySplat-main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21238 2026-05-14 cs.CV 81%

3D-UIR: 3D Gaussian for Underwater 3D Scene Reconstruction via Physics Based Appearance-Medium Decoupling

3D-UIR: 基于物理的3D场景重建中的3D高斯方法用于水下3D场景重建

Jieyu Yuan, Yujun Li, Yuanlin Zhang, Chunle Guo, Xiongxin Tang, Ruixing Wang, Chongyi Li

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Institute of Software, Chinese Academy of Sciences(软件研究所,中国科学院) DJI(大疆创新)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于物理的框架,通过定制的高斯建模分离物体外观与水介质影响,提升水下场景重建的几何一致性和渲染质量。

Comments Accepted to IEEE TIP 2026. Project webpage: https://bilityniu.github.io/3D-UIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11247 2026-05-14 cs.CV cs.RO 81%

Compact 3D Gaussian Splatting For Dense Visual SLAM

紧凑的3D高斯散射用于密集视觉SLAM

Tianchen Deng, Chang Nie, Shuhong Liu, Wenhua Wu, Jianfei Yang, Shenghai Yuan, Jiuming Liu, Danwei Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出紧凑的3D高斯散射SLAM系统,通过滑动窗口遮罩策略和几何代码本压缩高斯参数,提升训练和渲染速度,保持高质量场景表示。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13600 2026-05-14 cs.CV 79%

Sparse Code Uplifting for Efficient 3D Language Gaussian Splatting

稀疏编码提升用于高效3D语言高斯散射

Lovre Antonio Budimir, Yushi Guan, Steve Ryhner, Sven Lončarić, Nandita Vijaykumar

机构 * Faculty of Electrical Engineering and Computing(电子工程与计算学院) Department of Computer Science(计算机科学系) Vector Institute(向量研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出SCOUP方法,通过解耦语言表示学习与3D高斯优化,实现高效3D语义重建、存储和渲染。方法利用2D图像区域特征学习稀疏代码本表示,并通过加权稀疏聚合提升至3D高斯体,从而提升训练速度和内存效率。

Comments 18 pages (9 pages main paper), 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13591 2026-05-14 cs.CV 79%

Real2Sim: A Physics-driven and Editable Gaussian Splatting Framework for Autonomous Driving Scenes

Real2Sim:一种用于自动驾驶场景的物理驱动且可编辑的高斯点扩散框架

Kaicong Huang, Talha Azfar, Weisong Shi, Ruimin Ke

机构 * Department of Civil and Environmental Engineering, Rensselaer Polytechnic Institute(拉特克利夫理工学院土木与环境工程系) Department of Computer and Information Sciences, University of Delaware(德雷塞尔大学计算机与信息科学系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 Real2Sim结合4D高斯点扩散与可微材料点法求解器,实现动态驾驶场景的连续高斯原语重建,支持实例级编辑,并模拟真实物体间交互,提升自动驾驶场景生成的物理真实性和编辑灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13093 2026-05-14 cs.CV 79%

RoSplat: Robust Feed-Forward Pixel-wise Gaussian Splatting for Varying Input Views and High-Resolution Rendering

RoSplat:用于变化输入视角和高分辨率渲染的鲁棒前馈像素级高斯散射

Hoang Chuong Nguyen, Renjie Wu, Jose M. Alvarez, Miaomiao Liu

机构 * Australian National University(澳大利亚国立大学) NVIDIA

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出RoSplat,通过引入alpha归一化策略和辅助3D采样正则化器,解决高斯散射在不同输入视角下的过亮问题和高分辨率渲染中的孔洞 artifacts,提升渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04506 2026-05-14 cs.CV cs.AI 79%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 9 篇

2604.28045 2026-05-14 cs.CV 79%

TAFA-GSGC: Group-wise Scalable Point Cloud Geometry Compression with Progressive Residual Refinement

TAFA-GSGC:基于分组的可扩展点云几何压缩与渐进残差细化

Xiumei Li, Alexander Kopte, André Kaup

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出TAFA-GSGC,一种可扩展的点云几何编码器,通过分层残差细化和通道组熵编码,实现单比特流多质量解码,提升压缩效率并优于PCGCv2基准。

Comments Accepted at IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13152 2026-05-14 cs.CV cs.AI cs.LG cs.RO 62%

EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision

EvObj:学习无需场景监督的3D实例分割的演进对象表示

Jiahao Chen, Zihui Zhang, Yafei Yang, Jinxi Li, Shenxing Wei, Zhixuan Sun, Bo Yang

机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(深圳研究 institute,香港理工大学) vLAR Group, The Hong Kong Polytechnic University(vLAR 团队,香港理工大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 EvObj通过整合对象辨别和完成模块,解决合成数据与真实点云间的几何差距问题,实现无需场景监督的3D实例分割,实验表明其在真实和合成数据上均优于基线方法。

Comments CVPR 2026. Code and data are available at: https://github.com/vLAR-group/EvObj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13755 2026-05-14 cs.CV 57%

Generative Texture Diversification of 3D Pedestrians for Robust Autonomous Driving Perception

生成3D行人纹理多样化以实现自动驾驶感知的鲁棒性

Arka Bhowmick, Enes Ozeren, Ahmed Abdullah, Oliver Wasenmuller

机构 * BIT Technology Solutions GmbH(比特技术解决方案 GmbH) Mannheim University of Applied Sciences(曼海姆应用科学大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出一种简单有效的方法,通过StyleGAN2生成多样化的3D行人资产,用于合成场景生成,提升自动驾驶感知的鲁棒性。

Comments Published at SAIAD 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21360 2026-05-14 cs.CV 57%

Prototype-Based Test-Time Adaptation of Vision-Language Models

基于原型的测试时间适应性视觉-语言模型

Zhaohong Huang, Yuxin Zhang, Wenjing Liu, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(高效计算,中华人民共和国教育部,厦门大学,361005,中国)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出基于原型的测试时间适应方法PTA,通过类特定知识原型积累测试样本知识,提高效率并实现跨领域图像识别和点云分析的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13293 2026-05-14 cs.CV 57%

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

Img2CADSeq:通过序列扩散生成图像到CAD

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen

机构 * School of Software Tsinghua University China(软件学院清华大学中国) Tsinghua University(清华大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。

Comments Accepted by SIGGRAPH 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16868 2026-05-14 cs.CV q-bio.BM 57%

The Joint Gromov Wasserstein Objective for Multiple Object Matching

多对象匹配的联合Gromov-Wasserstein目标

Aryan Tajmir Riahi, Khanh Dao Duc

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Department of Mathematics, University of British Columbia(不列颠哥伦比亚大学数学系)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出联合Gromov-Wasserstein目标,扩展传统GW框架以实现多对象匹配,提供非负相似度度量并展示在合成和真实数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22445 2026-05-14 cs.CV cs.AI 57%

NFR: Neural Feature-Guided Non-Rigid Shape Registration

NFR:神经特征引导的非刚性形状注册

Zhangquan Chen, Puhua Jiang, Mingze Sun, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出一种基于学习的3D形状注册框架,通过神经特征提升非刚性变形和部分性处理能力,无需对应标注,实现高精度注册。

Comments 18 pages, 16 figures. arXiv admin note: substantial text overlap with arXiv:2311.04494

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13502 2026-05-14 eess.SP 50%

A Multi-Modal Intelligent U2V Channel Model for 6G Sensing-Communication Integration

一种面向6G感知通信一体化的多模智能U2V信道模型

Shuo Wang, Zengrui Han, Lu Bai, Xiang Cheng

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种基于三维散射体预测的新型U2V信道模型,通过构建宽车道场景下的高保真混合感知通信集成U2V仿真数据集,设计了3D-SPADE算法,利用LiDAR点云准确预测散射体分布,提升了动态U2V场景的建模精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12662 2026-05-14 cs.LG q-bio.GN 50%

scShapeBench: Discovering geometry from high dimensional scRNAseq data

scShapeBench: 从高维scRNAseq数据中发现几何结构

Andrew J Steindl, João Felipe Rocha, Brian Tshilengi Di Bassinga, Zachary Warren, Matthew Scicluna, César Miguel Valdez Córdova, Shabarni Gupta, Leire Torices, Daniel Neumann, Timothy J. Mann, Ihuan Gunawan, Dhananjay Bhaskar, John G Lock, Christine L Chaffer, Guy Wolf, Smita Krishnaswamy

机构 * Yale University(耶鲁大学) Mila / Université de Montréal(Mila / 蒙特利尔大学) Garvan Institute of Medical Research(Garvan医学研究机构) School of Biomedical Sciences, University of New South Wales(新南威尔士大学生物医学科学学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 点云 :point cloud(abstract)

AI总结 scShapeBench通过合成和专家标注的单细胞数据集,提供高维数据形状检测的基准,结合扩散几何提取Reeb图,改进拓扑-aware评估指标,优于PAGA和Mapper。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2605.12119 2026-05-14 cs.CV cs.GR 84%

MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics

MoCam:通过结构去噪动力学实现统一的新型视角合成

Haofeng Liu, Yang Zhou, Ziheng Wang, Zhengbo Xu, Zhan Peng, Jie Ma, Jun Liang, Shengfeng He, Jing Li

机构 * Orange-3DV-Team(橙色3D视觉团队)

专题命中 新视角合成 :novel view synthesis(title,abstract);point cloud(abstract);分类 cs.CV、cs.GR

AI总结 MoCam通过结构去噪动力学在扩散过程中协调从几何到外观的进展,统一静态和动态视角合成,优于现有方法,尤其在点云严重孔洞或失真时表现稳健。

Comments Project page: https://orange-3dv-team.github.io/MoCam

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2603.26839 2026-05-14 cs.LG cs.CV 57%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12586 2026-05-14 cs.CV cs.AI cs.DB 57%

3D Primitives are a Spatial Language for VLMs

3D基元是一种视觉语言模型的空间语言

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

机构 * Unity Technologies

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出通过3D基元作为中间表示来提升视觉语言模型的空间理解能力,通过SpatialBabel基准、Code-CoT推理策略和S³-FT自监督微调三种贡献,展示了基元在空间任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 1 篇

2605.12774 2026-05-14 cs.CV 57%

WildPose: A Unified Framework for Robust Pose Estimation in the Wild

WildPose:一种在动态环境中鲁棒的姿态估计统一框架

Jianhao Zheng, Liyuan Zhu, Zihan Zhu, Iro Armeni

机构 * Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV

AI总结 本文提出WildPose,一种统一的单目姿态估计框架,能鲁棒地处理动态环境并在静态和低自我运动数据集上保持最先进的性能。通过结合前馈模型的丰富感知前端和可微捆调整优化,该框架在动态、静态和低自我运动基准测试中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏