OCH3R: Object-Centric Holistic 3D Reconstruction
OCH3R: 以对象为中心的全局3D重建
机构 * Stanford University(斯坦福大学)
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV
AI总结 OCH3R提出一种统一框架,从单张RGB图像实现以对象为中心的全局3D重建,通过单次前向传递预测所有对象实例的6D位姿和详细3D重建,提升效率与鲁棒性。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
OCH3R: 以对象为中心的全局3D重建
机构 * Stanford University(斯坦福大学)
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV
AI总结 OCH3R提出一种统一框架,从单张RGB图像实现以对象为中心的全局3D重建,通过单次前向传递预测所有对象实例的6D位姿和详细3D重建,提升效率与鲁棒性。
3DSS:用于逆渲染的3D表面散射
机构 * INRIA, University of Rennes(INRIA,里昂大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.GR
AI总结 3DSS通过基于覆盖的合成模型,结合微facet着色和HDR光照,实现了形状、BRDF材料和光照的联合恢复,适用于多视角图像的逆渲染。
sketch2symm: 通过语义桥梁实现的对称感知草图到形状生成
机构 * School of Electronic Information Engineering, Foshan University, Guangdong, China(佛山大学电子信息工程学院) ; School of Computer Science and Artificial Intelligence, Foshan University, Guangdong, China(佛山大学计算机科学与人工智能学院)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出Sketch2Symm方法,通过语义桥梁增强稀疏草图表示,并利用对称约束作为几何先验,提升草图到3D形状的重建性能。
TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Google DeepMind(谷歌DeepMind)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。
Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/
GuardMarkGS: 3D高斯溅射的统一所有权追溯与编辑威慑
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Hanshin University(汉西大学)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);novel view synthesis(abstract)
AI总结 本文提出GuardMarkGS框架,通过结合全局水印目标与对抗目标,实现3D高斯溅射资产的统一所有权追溯与未经授权编辑的威慑,实验表明其在比特精度、编辑威慑和渲染质量间取得良好平衡。
Comments Preprint
Z-Order Transformer用于前馈高斯点云
机构 * The University of Hong Kong(香港大学) ; Futurewei Technologies Inc(未来科技公司)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出Z-Order Transformer用于前馈高斯点云,通过稀疏注意力机制和Z-order策略有效捕捉高斯点间空间与语义关系,提升实时渲染质量与效率。
Comments Accept by CVPR 2026, Oral
PairDropGS: 基于配对 Dropout 引起的一致性正则化的稀疏视角高斯点云法
机构 * School of Computer Science, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学学院,中国) ; Pengcheng Laboratory, Shenzhen, China(鹏城实验室,中国) ; Smart Coding Institute, Pengcheng Laboratory, Shenzhen, China(鹏城实验室智能编码研究所,中国) ; School of Computer Science, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机科学学院,中国)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出PairDropGS,通过配对Dropout引起的一致性正则化改进稀疏视角高斯点云法,提升训练稳定性与重建质量,同时保持方法的简洁性和易用性。
Comments 11 pages,8 figures
SkySplat: 多时序稀疏卫星图像上的通用3D高斯点云生成
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) ; Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部) ; Department of Geography and Resource Management, The Chinese University of Hong Kong(香港中文大学地理与资源管理系) ; China Railway Siyuan Survey and Design Group Co., LTD(中国铁路syuan调查设计集团有限公司)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV
AI总结 SkySplat通过整合RPC模型提升稀疏卫星图像的3D重建效率,采用自监督框架和跨自我一致性模块,实现86倍速度提升和更精确的重建结果。
Comments AAAI 2026. Code is available at https://github.com/NanCheng2001/SkySplat-main
3D-UIR: 基于物理的3D场景重建中的3D高斯方法用于水下3D场景重建
机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Institute of Software, Chinese Academy of Sciences(软件研究所,中国科学院) ; DJI(大疆创新)
专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出一种基于物理的框架,通过定制的高斯建模分离物体外观与水介质影响,提升水下场景重建的几何一致性和渲染质量。
Comments Accepted to IEEE TIP 2026. Project webpage: https://bilityniu.github.io/3D-UIR
紧凑的3D高斯散射用于密集视觉SLAM
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学) ; Harvard University(哈佛大学) ; University of Cambridge(剑桥大学)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO
AI总结 本文提出紧凑的3D高斯散射SLAM系统,通过滑动窗口遮罩策略和几何代码本压缩高斯参数,提升训练和渲染速度,保持高质量场景表示。
Comments Accepted by IJCV 2026
稀疏编码提升用于高效3D语言高斯散射
机构 * Faculty of Electrical Engineering and Computing(电子工程与计算学院) ; Department of Computer Science(计算机科学系) ; Vector Institute(向量研究所)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 本文提出SCOUP方法,通过解耦语言表示学习与3D高斯优化,实现高效3D语义重建、存储和渲染。方法利用2D图像区域特征学习稀疏代码本表示,并通过加权稀疏聚合提升至3D高斯体,从而提升训练速度和内存效率。
Comments 18 pages (9 pages main paper), 10 figures, preprint
Real2Sim:一种用于自动驾驶场景的物理驱动且可编辑的高斯点扩散框架
机构 * Department of Civil and Environmental Engineering, Rensselaer Polytechnic Institute(拉特克利夫理工学院土木与环境工程系) ; Department of Computer and Information Sciences, University of Delaware(德雷塞尔大学计算机与信息科学系)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 Real2Sim结合4D高斯点扩散与可微材料点法求解器,实现动态驾驶场景的连续高斯原语重建,支持实例级编辑,并模拟真实物体间交互,提升自动驾驶场景生成的物理真实性和编辑灵活性。
RoSplat:用于变化输入视角和高分辨率渲染的鲁棒前馈像素级高斯散射
机构 * Australian National University(澳大利亚国立大学) ; NVIDIA
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 本文提出RoSplat,通过引入alpha归一化策略和辅助3D采样正则化器,解决高斯散射在不同输入视角下的过亮问题和高分辨率渲染中的孔洞 artifacts,提升渲染质量。
Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解
机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) ; Queensland University of Technology(昆士兰理工大学) ; CSIRO Robotics(CSIRO机器人部) ; CSIRO
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。
Comments The International Conference on Pattern Recognition (ICPR) 2026
TAFA-GSGC:基于分组的可扩展点云几何压缩与渐进残差细化
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 本文提出TAFA-GSGC,一种可扩展的点云几何编码器,通过分层残差细化和通道组熵编码,实现单比特流多质量解码,提升压缩效率并优于PCGCv2基准。
Comments Accepted at IEEE International Conference on Image Processing (ICIP) 2026
EvObj:学习无需场景监督的3D实例分割的演进对象表示
机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(深圳研究 institute,香港理工大学) ; vLAR Group, The Hong Kong Polytechnic University(vLAR 团队,香港理工大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO
AI总结 EvObj通过整合对象辨别和完成模块,解决合成数据与真实点云间的几何差距问题,实现无需场景监督的3D实例分割,实验表明其在真实和合成数据上均优于基线方法。
Comments CVPR 2026. Code and data are available at: https://github.com/vLAR-group/EvObj
生成3D行人纹理多样化以实现自动驾驶感知的鲁棒性
机构 * BIT Technology Solutions GmbH(比特技术解决方案 GmbH) ; Mannheim University of Applied Sciences(曼海姆应用科学大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出一种简单有效的方法,通过StyleGAN2生成多样化的3D行人资产,用于合成场景生成,提升自动驾驶感知的鲁棒性。
Comments Published at SAIAD 2026 Workshop at CVPR 2026
基于原型的测试时间适应性视觉-语言模型
机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) ; Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(高效计算,中华人民共和国教育部,厦门大学,361005,中国)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出基于原型的测试时间适应方法PTA,通过类特定知识原型积累测试样本知识,提高效率并实现跨领域图像识别和点云分析的最优性能。
Img2CADSeq:通过序列扩散生成图像到CAD
机构 * School of Software Tsinghua University China(软件学院清华大学中国) ; Tsinghua University(清华大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。
Comments Accepted by SIGGRAPH 2026 Conference
多对象匹配的联合Gromov-Wasserstein目标
机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) ; Department of Mathematics, University of British Columbia(不列颠哥伦比亚大学数学系)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出联合Gromov-Wasserstein目标,扩展传统GW框架以实现多对象匹配,提供非负相似度度量并展示在合成和真实数据集上的有效性。
NFR:神经特征引导的非刚性形状注册
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出一种基于学习的3D形状注册框架,通过神经特征提升非刚性变形和部分性处理能力,无需对应标注,实现高精度注册。
Comments 18 pages, 16 figures. arXiv admin note: substantial text overlap with arXiv:2311.04494
一种面向6G感知通信一体化的多模智能U2V信道模型
专题命中 点云 :point cloud(abstract)
AI总结 本文提出一种基于三维散射体预测的新型U2V信道模型,通过构建宽车道场景下的高保真混合感知通信集成U2V仿真数据集,设计了3D-SPADE算法,利用LiDAR点云准确预测散射体分布,提升了动态U2V场景的建模精度与计算效率。
scShapeBench: 从高维scRNAseq数据中发现几何结构
机构 * Yale University(耶鲁大学) ; Mila / Université de Montréal(Mila / 蒙特利尔大学) ; Garvan Institute of Medical Research(Garvan医学研究机构) ; School of Biomedical Sciences, University of New South Wales(新南威尔士大学生物医学科学学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 点云 :point cloud(abstract)
AI总结 scShapeBench通过合成和专家标注的单细胞数据集,提供高维数据形状检测的基准,结合扩散几何提取Reeb图,改进拓扑-aware评估指标,优于PAGA和Mapper。
MoCam:通过结构去噪动力学实现统一的新型视角合成
机构 * Orange-3DV-Team(橙色3D视觉团队)
专题命中 新视角合成 :novel view synthesis(title,abstract);point cloud(abstract);分类 cs.CV、cs.GR
AI总结 MoCam通过结构去噪动力学在扩散过程中协调从几何到外观的进展,统一静态和动态视角合成,优于现有方法,尤其在点云严重孔洞或失真时表现稳健。
Comments Project page: https://orange-3dv-team.github.io/MoCam
从像素到BFS:高迷宫精度并不意味着视觉规划
机构 * Independent Researcher(独立研究者)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。
Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes
3D基元是一种视觉语言模型的空间语言
机构 * Unity Technologies
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文提出通过3D基元作为中间表示来提升视觉语言模型的空间理解能力,通过SpatialBabel基准、Code-CoT推理策略和S³-FT自监督微调三种贡献,展示了基元在空间任务中的有效性。
WildPose:一种在动态环境中鲁棒的姿态估计统一框架
机构 * Stanford University(斯坦福大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV
AI总结 本文提出WildPose,一种统一的单目姿态估计框架,能鲁棒地处理动态环境并在静态和低自我运动数据集上保持最先进的性能。通过结合前馈模型的丰富感知前端和可微捆调整优化,该框架在动态、静态和低自我运动基准测试中均优于现有方法。