arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-20 至 2026-03-20 共收录 25 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2603.18493 2026-03-20 cs.CV cs.AI cs.LG 79%

FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction

FILT3R:用于流式3D重建的潜在状态自适应卡尔曼滤波器

Seonghyun Jin, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 FILT3R通过将递归状态更新转化为token空间的随机状态估计,解决了流式3D重建中状态更新规则不稳定的问题,提升了长期稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19231 2026-03-20 cs.CV 74%

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt:基于渐进结构推理的单目关节3D重建

Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, 637335 Singapore(南洋理工大学S实验室)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 MonoArt通过渐进结构推理实现单目关节3D重建,无需外部运动模板或多阶段流程,提升重建精度和推理速度,并扩展至机器人操作和关节场景重建。

Comments Project page: https://lihaitian.com/MonoArt

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17781 2026-03-20 cs.CV cs.GR 73%

LiteGE: Lightweight Geodesic Embedding for Efficient Geodesics Computation and Non-Isometric Shape Correspondence

LiteGE:轻量级测地嵌入用于高效测地线计算和非等距形状对应

Yohanes Yudhi Adikusuma, Qixing Huang, Ying He

专题命中 三维重建 :3D vision(abstract);point cloud(abstract);分类 cs.CV、cs.GR

AI总结 LiteGE通过PCA处理信息体素的无符号距离场样本,构建紧凑且类别感知的形状描述符,实现高效测地线计算和非等距形状对应,显著降低内存使用和推理时间。

Journal ref Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI-26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02691 2026-03-20 cs.CV cs.GR 73%

FSFSplatter: Build Surface and Novel Views with Sparse-Views within 2min

FSFSplatter: 用稀疏视图在2分钟内构建表面和新视角

Yibin Zhao, Yihan Pan, Jun Nan, Liwei Chen, Jianjun Yi

机构 * East China University of Science and Technology, Shanghai(东华大学上海理工学院) Shanghai Xiaoyuan Innovation Center, Shanghai(上海小元创新中心)

专题命中 三维重建 :Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出FSFSplatter方法,通过端到端的密集高斯初始化、相机参数估计和几何增强场景优化,实现从自由稀疏图像快速重建表面和新视角,优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 57%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG 50%

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2603.18306 2026-03-20 cs.CV cs.LG 83%

Fast and Generalizable NeRF Architecture Selection for Satellite Scene Reconstruction

快速且通用的NeRF架构选择用于卫星场景重建

Devjyoti Chakraborty, Zaki Sukma, Rakandhiya D. Rachmanto, Kriti Ghosh, In Kee Kim, Suchendra M. Bhandarkar, Lakshmish Ramaswamy, Nancy K. O'Hare, Deepak Mishra

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Geography, University of Georgia(佐治亚大学地理系)

专题命中 NeRF :NeRF(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出PreSCAN框架,通过轻量几何和光度描述符预测NeRF质量,实现快速架构选择,提升卫星场景重建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 10 篇

2603.18218 2026-03-20 cs.CV cs.RO 88%

Semantic Segmentation and Depth Estimation for Real-Time Lunar Surface Mapping Using 3D Gaussian Splatting

基于3D高斯溅射的实时月球表面制图中的语义分割与深度估计

Guillem Casadesus Vila, Adam Dai, Grace Gao

机构 * Department of Aeronautics and Astronautics(航空航天系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);point cloud(abstract);novel view synthesis(abstract)

AI总结 本文提出一种实时制图框架,结合密集感知模型与3D高斯溅射表示,在挑战性环境下实现高精度月球表面制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19137 2026-03-20 cs.CV cs.RO 84%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV、cs.RO

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18707 2026-03-20 cs.LG cs.CV cs.GR 84%

From ex(p) to poly: Gaussian Splatting with Polynomial Kernels

从指数到多项式:基于多项式核的高斯点渲染

Joerg H. Mueller, Martin Winter, Markus Steinberger

机构 * Huawei Technologies(华为技术有限公司) Graz University of Technology(格拉茨理工大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV、cs.GR

AI总结 本文提出多项式核替代传统指数核,提升3DGS计算效率并保持数据集兼容性,实验显示性能提升4-15%且图像质量影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19193 2026-03-20 cs.CV 83%

Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting

重建至关重要:通过3D高斯点云学习几何对齐的鸟瞰图表示

Yiren Lu, Xin Ye, Burhaneddin Yaman, Jingru Luo, Zhexiao Xiong, Liu Ren, Yu Yin

机构 * Bosch Research North America \& Bosch Center for Artificial Intelligence (BCAI) Case Western Reserve University Washington University in St. Louis

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Splat2BEV框架,通过3D高斯点云生成几何对齐的鸟瞰图特征,提升自动驾驶中的感知性能。

Comments Project page at https://vulab-ai.github.io/Splat2BEV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 83%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09162 2026-03-20 cs.CV cs.GR 81%

GTAvatar: Bridging Gaussian Splatting and Texture Mapping for Relightable and Editable Gaussian Avatars

GTAvatar:融合高斯散射与纹理映射以实现可照明和可编辑的高斯头像

Kelian Baert, Mae Younes, Francois Bourel, Marc Christie, Adnane Boukhayma

机构 * Univ Rennes, Inria, CNRS, IRISA, France(里昂大学、法国国家科学研究中心、法国信息与自动化研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种结合2D高斯散射精度与UV纹理映射直观性的方法,通过高效嵌入局部坐标系到模板网格的UV空间,实现单目视频下的连续可编辑材质头像重建,并利用物理基础反射模型实现照明与编辑。

Comments Accepted to Eurographics 2026. Project page: https://kelianb.github.io/GTAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11431 2026-03-20 cs.CV 79%

Remove360: Benchmarking Residuals After Object Removal in 3D Gaussian Splatting

Remove360: 3D高斯散射中物体移除后残差的基准测试

Simona Kocour, Assia Benbihi, Torsten Sattler

机构 * CTU in Prague, Czech Republic(布拉格CTU,捷克共和国)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出Remove360数据集和评估框架,用于量化3D高斯散射中物体移除后的语义残差,揭示几何移除与语义擦除之间的差距,强调隐私保护移除方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV 79%

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18402 2026-03-20 cs.CV 79%

Inst4DGS: Instance-Decomposed 4D Gaussian Splatting with Multi-Video Label Permutation Learning

Inst4DGS:基于多视频标签排列学习的实例分解4D高斯点划法

Yonghan Lee, Dinesh Manocha

机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出Inst4DGS,通过引入视频标签排列潜在变量,解决多视角视频中实例标签不一致的问题,实现实例分解与跟踪,并在渲染和分割质量上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15376 2026-03-20 cs.CV 57%

DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes

DriveSplat:统一的神经高斯重建用于动态驾驶场景

Cong Wang, Ruiqi Song, Wei Tian, Chenming Zhang, Lingxi Li, Long Chen

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Waytous

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出DriveSplat,一种统一的神经高斯框架,用于重建动态驾驶场景。通过引入场景感知的LOD模型和对象中心的神经高斯原语,实现对静态背景和动态物体的高效重建,实验表明其在新视角合成和时空稳定性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 7 篇

2505.21854 2026-03-20 cs.CV cs.AI 79%

Rethinking Gradient-based Adversarial Attacks on Point Cloud Classification

重新思考基于梯度的点云分类对抗攻击

Jun Chen, Xinke Li, Mingyue Xu, Chongshou Li, Truiani Li

机构 * Southwest Jiaotong University(西南交通大学) City University of Hong Kong(香港城市大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出WAAttack和SubAttack两种策略,通过动态调整点扰动幅度和适应性步长,提升攻击效果和隐蔽性,实验表明其在生成高隐蔽性对抗示例方面优于现有方法。

Comments ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22592 2026-03-20 cs.LG 78%

OT-MeanFlow3D: Bridging Optimal Transport and Meanflow for Efficient 3D Point Cloud Generation

OT-MeanFlow3D: 通过最优传输与Meanflow弥合,实现高效的3D点云生成

Elaheh Akbari, Shansita Sharma, Ping He, Ahmadreza Moradipari, Kyungtae Han, Hamed Pirsiavash, Yikun Bai, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) Toyota InfoTech Labs(丰田信息技术实验室) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出OT-MeanFlow3D框架,通过整合最优传输采样,提升3D点云生成与修复的效率与准确性,实验表明其在ShapeNet上优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00992 2026-03-20 cs.CV 57%

SuperDec: 3D Scene Decomposition with Superquadric Primitives

SuperDec:基于超二次体的3D场景分解

Elisabetta Fedele, Boyang Sun, Leonidas Guibas, Marc Pollefeys, Francis Engelmann

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 SuperDec通过将场景分解为超二次体基元,实现紧凑的3D表示。该方法利用实例分割技术扩展到完整3D场景,并在ShapeNet和ScanNet++上验证了其泛化能力,适用于机器人任务和可控视觉内容生成。

Comments Project page: https://super-dec.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18496 2026-03-20 cs.CV 57%

NymeriaPlus: Enriching Nymeria Dataset with Additional Annotations and Data

NymeriaPlus:通过额外标注和数据丰富Nymeria数据集

Daniel DeTone, Federica Bogo, Eric-Tuan Le, Duncan Frost, Julian Straub, Yawar Siddiqui, Yuting Ye, Jakob Engel, Richard Newcombe, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文通过改进人体动作标注、添加密集3D标注和多模态数据,提升Nymeria数据集的综合性能,为野外观测数据研究提供更强大的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV 57%

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 57%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18017 2026-03-20 cs.LG cs.CL 50%

Frayed RoPE and Long Inputs: A Geometric Perspective

断裂的RoPE与长输入:一种几何视角

Davis Wertheimer, Aozhong Zhang, Derrick Liu, Penghang Yin, Naigang Wang

机构 * IBM Research(IBM研究院) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 点云 :point cloud(abstract)

AI总结 本文从几何角度分析RoPE在长输入下的问题,发现注意力机制导致键和查询向量紧密聚类,而RoPE在长输入时破坏这种聚类,产生病态行为。提出RoPE-ID方法通过高频率应用部分通道解决此问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2509.23098 2026-03-20 cs.CV cs.AI 74%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 空间理解 :spatial understanding(title);分类 cs.CV

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏