arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-05 至 2026-08-05 共收录 21 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2601.13706 2026-08-05 cs.CV 87%

ParkingTwin: Training-Free Streaming 3D Reconstruction for Parking-Lot Digital Twins

ParkingTwin: 无需训练的实时停车区三维重建

Xinhao Liu, Yu Wang, Xiansheng Guo, Gordon Owusu Boateng, Yu Cao, Haonan Si, Xingchen Guo, Nirwan Ansari

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(信息与通信工程学院,电子科学与技术大学) Department of Communications and Networking, Xi'an Jiaotong-Liverpool University(通信与网络系,西安交通大学利物浦大学) School of Electrical Engineering, Hebei University of Technology(电气工程学院,河北工业大学) Advanced Networking Lab., Department of Electrical and Computer Engineering, New Jersey Institute of Technology(高级网络实验室,电气与计算机工程系,新泽西理工学院)

专题命中 三维重建 :3D reconstruction(title,abstract);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 ParkingTwin通过无需训练的轻量级系统实现停车区实时三维重建,利用OSM拓扑生成一致TSDF,实时过滤动态遮挡,并在CIELAB中鲁棒融合光照,提升重建精度和效率。

Comments 35 pages, 10 figures. Submitted to ISPRS Journal of Photogrammetry and Remote Sensing. Under review

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing 240 (2026) 114-129

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交 57%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03423 2026-08-05 cs.CV 新提交 57%

SGFormer: Structure-Guided Transformer for Robust Local Feature Matching

SGFormer:用于鲁棒局部特征匹配的结构引导Transformer

Runyu Zhu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对局部特征匹配中Transformer注意力发散的问题,提出SGFormer结构引导Transformer,通过三重结构注意力模块增强显著结构区域的注意力,有效提升了匹配精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00238 2026-08-05 cs.GR cs.LG 版本更新 57%

Robust Biharmonic Skinning Using Geometric Fields

基于几何场的鲁棒双调和蒙皮技术

Ana Dodik, Vincent Sitzmann, Justin Solomon, Oded Stein

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 本文提出一种基于几何场的无网格鲁棒自动蒙皮技术,借助硬件光线追踪实现的拉格朗日表示优化双调和能量,可在开放曲面等现有方法失效的场景生成与最优方法相当的权重,经全面评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 8 篇

2509.17390 2026-08-05 cs.RO 版本更新 91%

FGGS-LiDAR: Ultra-Fast, GPU-Accelerated Simulation from General 3DGS Models to LiDAR

FGGS-LiDAR:从通用3DGS模型到LiDAR的超快速GPU加速仿真

Junzhe Wu, Yufei Jia, Yiyi Yan, Zhixing Chen, Tiao Tan, Zifan Wang, Guangyu Wang, BoKui Chen, Guyue Zhou

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) DISCOVER Robotics Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 提出FGGS-LiDAR框架,通过体积离散化和TSDF提取将预训练3DGS资产转换为水密网格,结合GPU加速光线投射实现超500 FPS的LiDAR仿真,在并行设置中比Isaac Sim低一个数量级延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03279 2026-08-05 cs.CV 新提交 90%

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment

3DGSI-Assessor:面向3D高斯溅射图像质量评估的大规模数据集与基于大视觉语言模型的方法

Yuke Xing, Jiarui Wang, William Gordon, Zhu Li, Guangtao Zhai, Yiling Xu

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对3D高斯溅射压缩的失真评估缺口,提出含15200张图像的多维IQA数据集3DGS-IEval-15K+,并构建基于大视觉语言模型的一体化IQA框架3DGSI-Assessor,该框架在对应数据集上达SOTA且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12686 2026-08-05 eess.SP 87%

RadCloudSplat: Scatterer-Driven 3D Gaussian Splatting with Point-Cloud Priors for Radiomap Extrapolation

RadCloudSplat:基于点云先验的散射体驱动三维高斯泼溅用于无线地图外推

Yiheng Wang, Ye Xue, Shutao Zhang, Hongmiao Fan, Tsung-Hui Chang

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);point cloud(abstract)

AI总结 提出RadCloudSplat框架,将3D高斯泼溅扩展到射频领域,通过建模环境散射体和无线路径,利用稀疏测量实现高效准确的无线地图外推。

Journal ref Proc. IEEE INFOCOM 2026 - IEEE Conference on Computer Communications, 2026, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02437 2026-08-05 cs.CV 版本更新 84%

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

InfiniSplat:用于大基线单目视图合成的隐式高斯解码

Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Shenzhen University(深圳大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 InfiniSplat是一种前馈单图像3DGS框架,通过几何引导采样和查询条件隐式解码器实现表面对齐表示,在跨数据集NVS任务中达SOTA,且具零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 (Journal Track). Code: https://github.com/zju3dv/InfiniSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新 84%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.RO

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22673 2026-08-05 cs.GR cs.CV 版本更新 84%

URHead: A Unified UV-Space Representation for Joint Mesh-3DGS Optimization in Head Avatars

URHead:用于头部虚拟形象中联合网格-3DGS优化的统一UV空间表示

Seonghak Lee, Junhee Cho, Jisoo Park, Min-Gyu Park, Jongmin Lee, Ju Hong Yoon, Junseok Kwon

专题命中 Gaussian Splatting :3DGS(title,title_cn);分类 cs.CV、cs.GR

AI总结 研究针对头部虚拟形象,提出URHead统一表示法,通过UV空间统一及联合优化,让网格与高斯方法互补,保持参数可控性与特定主体细节,在重建质量和动画一致性上超越现有方法。

Comments Project page/code: https://lseonghak.github.io/website/project/urhead/, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 77%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 57%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 7 篇

2512.03621 2026-08-05 cs.CV 版本更新 81%

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成

Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

机构 * Sun Yat-sen University(中山大学) ZYT Shenzhen Polytechnic University(深圳职业技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 点云 :3DGS(summary_cn,abstract);分类 cs.CV

AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。

Comments Project page: https://recamdriving.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03637 2026-08-05 cs.CV 新提交 79%

Learning Biomechanically Plausible Human Motion from Sparse Radar Point Clouds

从稀疏雷达点云学习符合生物力学原理的人体运动

Jonas Leo Mueller, Markus Gambietz, Alexander Weiss, Daniel Krauss, Bjoern M. Eskofier

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本研究构建整合全身骨骼模型的端到端雷达姿态估计框架,在11名康复训练受试者的交叉验证中实现多项精准指标,证明从低成本雷达恢复生物力学描述符的可行性,为临床运动分析奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02883 2026-08-05 cs.CV 新提交 79%

Test Time Adaptation Methods for Point Cloud Registration in Laparoscopic Surgery

腹腔镜手术中点云配准的测试时自适应方法

Nina Bodelot, Soufiane Belharbi, Eric Granger

机构 * ETS Montreal(蒙特利尔理工学院) LIVIA(LIVIA实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究针对腹腔镜手术中点云配准的域偏移问题,修改三类测试时自适应方法适配三维配准,经实验验证输入自适应是低延迟且误差降低效果稳定的最优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 62%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 57%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17568 2026-08-05 cs.CV 57%

PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception

PAGE-4D: 通过解耦姿态与几何估计实现VGGT-4D感知

Kaichen Zhou, Yuhan Wang, Grace Chen, Xinhai Chang, Gaspard Beaudouin, Fangneng Zhan, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Media Lab and Electrical Engineering and Computer Science, Massachusetts Institute of Technology(媒体实验室和电气工程与计算机科学,麻省理工学院) Department of Computing, Imperial College London(计算系,帝国理工学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出PAGE-4D,扩展VGGT到动态场景,通过动态感知聚合器解耦静态与动态信息,同时提升相机姿态估计、深度预测和点云重建性能。

Comments ICLR 2026, VGGT-4D, Dynamic VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 50%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 点云 :point cloud(abstract)

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2605.21472 2026-08-05 cs.CV 版本更新 76%

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

专题命中 3D生成 :3D generation(title,comments);分类 cs.CV

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2608.02980 2026-08-05 cs.CV 新提交 84%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 空间理解 :3D vision(title);spatial understanding(title);分类 cs.CV

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏