arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-19 至 2026-03-19 共收录 26 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 10 篇

2603.17519 2026-03-19 cs.CV 85%

UniSem: Generalizable Semantic 3D Reconstruction from Sparse Unposed Images

UniSem: 从稀疏未定位图像进行通用语义3D重建

Guibiao Liao, Qian Ren, Kaimin Liao, Hua Wang, Zhi Chen, Luchao Wang, Yaohua Tang

机构 * Moore Threads AI

专题命中 三维重建 :3D reconstruction(title,abstract);Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV

AI总结 UniSem通过误差感知高斯丢弃和混合训练课程提升深度精度和语义泛化能力,在ScanNet和Replica数据集上实现了更优的深度预测和开放词汇3D分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17571 2026-03-19 cs.CV 83%

PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery

PanoVGGT:从全景影像进行前馈3D重建

Yijing Guo, Mengjun Chao, Luo Wang, Tianyang Zhao, Haizhao Dai, Yingliang Zhang, Jingyi Yu, Yujiao Shi

机构 * ShanghaiTech University(上海科技大学) Sudo

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出PanoVGGT模型,通过单次前向传递从单或多张全景影像联合预测相机姿态、深度图和3D点云,采用球面感知位置嵌入和全景特定三轴SO(3)旋转增强,解决全局框架模糊问题,并贡献PanoCity大规模户外全景数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17358 2026-03-19 cs.CV eess.IV 79%

A 3D Reconstruction Benchmark for Asset Inspection

用于资产检查的3D重建基准测试

James L. Gray, Nikolai Goncharov, Alexandre Cardaillac, Ryan Griffiths, Jack Naylor, Donald G. Dansereau

机构 * Australian Centre for Robotics, School of Aerospace, Mechanical and Mechatronic Engineering, University of Sydney(澳大利亚机器人中心,航空航天、机械与机电工程学院,悉尼大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文提出一个包含真实场景的3D重建基准数据集,用于评估在复杂表面条件和密集拍摄轨迹下的重建方法性能。

Comments 29 pages, 15 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV 79%

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 三维重建 :3D vision(title,abstract);分类 cs.CV

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17735 2026-03-19 cs.CV 70%

TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos

TAPESTRY:从几何到外观 via 一致的旋转台视频

Yan Zeng, Haoran Jiang, Kaixin Yao, Qixuan Zhang, Longwen Zhang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 三维重建 :3DGS(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 TAPESTRY通过基于显式3D几何的视频扩散方法生成高保真旋转台视频,用于驱动纹理合成和神经渲染,实现高质量3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17995 2026-03-19 cs.CV cs.GR cs.LG 62%

LoST: Level of Semantics Tokenization for 3D Shapes

LoST:3D形状的语义层次标记化

Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出LoST,通过语义显著性对3D形状进行标记化,实现高效的自回归生成。实验表明LoST在几何和语义重建上优于现有方法,并提升下游任务性能。

Comments CVPR 2026; Project website-- https://lost3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18694 2026-03-19 cs.RO cs.AI cs.SY eess.SY 61%

AgriChrono: A Multi-modal Dataset Capturing Crop Growth and Lighting Variability with a Field Robot

AgriChrono:一种捕捉作物生长和光照变化的多模态数据集

Jaehwan Jeong, Tuan-Anh Vu, Mohammad Jony, Shahab Ahmad, Md. Mukhlesur Rahman, Sangpil Kim, M. Khalid Jawed

机构 * Korea University(韩国大学) University of California, Los Angeles(加州大学洛杉矶分校) North Dakota State University(北达科他州立大学)

专题命中 三维重建 :3D reconstruction(abstract,comments);分类 cs.RO

AI总结 本文提出AgriChrono数据集,通过多传感器平台采集农田动态变化数据,验证了高精度动态非刚性场景重建的挑战,推动农业机器人研究。

Comments Keywords: Agricultural Robotics, In-the-wild Dataset, 3D Reconstruction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 57%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO 57%

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.RO

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12789 2026-03-19 cs.CV 57%

Coherent Human-Scene Reconstruction from Multi-Person Multi-View Video in a Single Pass

从多视角多人物视频中单次通过进行一致的人-场景重建

Sangmin Kim, Minhyuk Hwang, Geonho Cha, Dongyoon Wee, Jaesik Park

机构 * Seoul National University(首尔国立大学) NAVER Cloud(NAVER云)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CHROMM框架,通过单次处理联合估计相机、场景点云和人体网格,无需额外模块或预处理,提升多视角人体姿态估计性能。

Comments Project page: https://nstar1125.github.io/chromm

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2603.17236 2026-03-19 cs.RO cs.CV 62%

Neural Radiance Maps for Extraterrestrial Navigation and Path Planning

神经辐射图用于外星导航和路径规划

Adam Dai, Shubh Gupta, Grace Gao

机构 * Stanford University(斯坦福大学)

专题命中 NeRF :NeRF(abstract);分类 cs.CV、cs.RO

AI总结 本文提出利用神经辐射场构建地图,用于自主导航中的路径规划,通过整合局部和全局信息,实现更高效的路径规划。

Comments Published in the Proceedings of the ION GNSS+ 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 5 篇

2603.11298 2026-03-19 cs.CV 88%

InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction

InstantHDR:单次前向高斯散射用于高动态范围3D重建

Dingqiang Ye, Jiacong Xu, Jianglu Ping, Yuxiang Guo, Chao Fan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Shenzhen University(深圳大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);3D reconstruction(title);point cloud(abstract);novel view synthesis(abstract)

AI总结 本文提出InstantHDR,通过单次前向传递从未校准的多曝光LDR图像集重建HDR场景,采用几何引导的外观建模和元网络实现通用的场景特定色调映射,提升重建速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06462 2026-03-19 cs.CV cs.AI 85%

StructGS: Adaptive Spherical Harmonics and Rendering Enhancements for Superior 3D Gaussian Splatting

StructGS: 适应性球面谐波与渲染增强以提升3D高斯点撒技术

Zexu Huang, Min Xu, Stuart Perry

机构 * Perceptual Imaging Laboratory (PILab), School of Electrical and Data Engineering, University of Technology Sydney(感知成像实验室(PILab),电气与数据工程学院,悉尼技术大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出StructGS框架,通过引入基于补丁的SSIM损失、动态球面谐波初始化和多尺度残差网络,改进3D高斯点撒技术,减少计算冗余,提升细节捕捉能力并支持低分辨率输入的高分辨率渲染。

Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 1499-1510, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26219 2026-03-19 cs.CV cs.AI 79%

Parameterizing Dataset Distillation via Gaussian Splatting

通过高斯点撒技术参数化数据集

Chenyang Jiang, Zhengcen Li, Hang Zhao, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * The School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学与技术学院) Institute of Perceptual Intelligence, Pengcheng Laboratory(感知智能研究院,鹏城实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出GSDD,一种基于高斯点撒的数据集参数化技术,通过高效存储结构提升数据集压缩效率,增强多样性并提升蒸馏性能。

Comments 19 pages; Code is available on https://github.com/j-cyoung/GSDatasetDistillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17605 2026-03-19 cs.CV 74%

ReLaGS: Relational Language Gaussian Splatting

ReLaGS:关系语言高斯点云

Yaxu Xie, Abdalla Arafa, Alireza Javanmardi, Christen Millerdurai, Jia Cheng Hu, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU University Kaiserslautern-Landau(科布伦茨-兰道大学(RPTU)) University of Modena and Reggio Emilia(摩德纳和雷吉奥-艾米利亚大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 ReLaGS通过构建层次化的语言蒸馏高斯场景和3D语义场景图,实现无需场景特定训练的统一3D感知与推理,结合多视角语言对齐策略和图神经网络进行关系推理。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17131 2026-03-19 cs.CV 57%

SMAL-pets: SMAL Based Avatars of Pets from Single Image

基于SMAL的宠物单图像生成高保真可编辑3D宠物化身

Piotr Borycki, Joanna Waczyńska, Yizhe Zhu, Yongqiang Gao, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) Huawei(华为)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出SMAL-pets框架,通过混合架构结合3D高斯溅射与SMAL参数模型,实现单图像生成高质量可编辑宠物3D化身,支持通过文本提示进行外观和行为编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 6 篇

2603.16945 2026-03-19 cs.CV cs.AI 83%

Joint Optimization of Storage and Loading for High-Performance 3D Point Cloud Data Processing

高绩效3D点云数据处理中存储与加载的联合优化

Ke Wang, Yanfei Cao, Xiangzhi Tao, Naijie Gu, Jun Yu, Zhengdong Wang, Shouyang Dong, Fan Yu, Cong Wang, Yang Luo

专题命中 点云 :point cloud(title,abstract);3D vision(abstract);分类 cs.CV

AI总结 本文提出.PcRecord格式和高效数据处理流水线,通过多阶段并行架构优化计算资源,提升大规模点云数据处理效率,实验显示在多个数据集上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17538 2026-03-19 cs.CV cs.AI 79%

Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysis

学习基于坐标的卷积核以实现连续SE(3)等价性和高效的点云分析

Jaein Kim, Hee Bin Yoo, Dong-Sig Han, Byoung-Tak Zhang

机构 * Interdisciplinary Program in Neuroscience, Seoul National University(首尔国立大学神经科学跨学科项目) Département d’Informatique, École Normale Supérieure (ENS)(规范高等学校计算机系) Department of Computing, Imperial College London(伦敦帝国学院计算系) Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出ECKConv,通过坐标基网络设计实现SE(3)等价性和高效点云处理,在分类、姿态注册等任务中验证了其性能优势。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 62%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17753 2026-03-19 cs.CV 57%

PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation

PC-CrossDiff:点-簇双级跨模态微分注意力用于统一的3D指称与分割

Wenbin Tan, Jiawen Lin, Fangyong Wang, Yuan Xie, Yong Xie, Yachao Zhang, Yanyun Qu

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出PC-CrossDiff框架,通过双级跨模态微分注意力解决复杂多物体场景中指称理解和分割的挑战,提升3D视觉定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17228 2026-03-19 cs.CV cs.AI cs.LG 57%

From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs

从丢弃到恢复:对MLLMs分割能力的机理分析

Boyong Wu, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 点云 :spatial understanding(abstract);分类 cs.CV

AI总结 本文通过逐层线性探测评估MLLMs整个流程,揭示适配器导致的分割表示下降及LLM层通过注意力机制逐步恢复的机制,为未来分割模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16270 2026-03-19 cs.RO 57%

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架

Kangxu Wang, Siang Chen, Chenxing Jiang, Shaojie Shen, Yixiang Dai, Guijin Wang

机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2603.17382 2026-03-19 cs.CV 79%

VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm

VisionNVS: 一种基于虚拟位移范式的自监督补全方法用于新型视角合成

Hongbo Lu, Liang Yao, Chenghao He, Fan Liu, Wenlong Liao, Tao He, Pai Peng

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 本文提出VisionNVS,通过引入虚拟位移策略,将视角合成问题转化为自监督补全任务,利用单目深度代理模拟遮挡模式,提升自动驾驶中新型视角合成的几何精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 3D生成 1 篇

2509.23728 2026-03-19 cs.CV cs.AI 74%

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

专题命中 3D生成 :3D generation(title);分类 cs.CV

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 空间理解 2 篇

2603.17333 2026-03-19 cs.CL 71%

Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures

网格空间理解:一个用于文本空间推理、具身场景和坐标结构的数据集

Risham Sidhu, Julia Hockenmaier

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 空间理解 :spatial understanding(title)

AI总结 本文提出GSU数据集,用于评估LLM在导航、物体定位和结构组合任务中的空间推理能力,发现模型在具身代理参考框架和坐标列表识别上存在困难,且微调小模型可能达到前沿模型性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 57%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏