arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-05 至 2026-08-05 共收录 10 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2608.03851 2026-08-05 cs.CV 新提交 57%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03423 2026-08-05 cs.CV 新提交 57%

SGFormer: Structure-Guided Transformer for Robust Local Feature Matching

SGFormer:用于鲁棒局部特征匹配的结构引导Transformer

Runyu Zhu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对局部特征匹配中Transformer注意力发散的问题,提出SGFormer结构引导Transformer,通过三重结构注意力模块增强显著结构区域的注意力,有效提升了匹配精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2608.03279 2026-08-05 cs.CV 新提交 90%

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment

3DGSI-Assessor:面向3D高斯溅射图像质量评估的大规模数据集与基于大视觉语言模型的方法

Yuke Xing, Jiarui Wang, William Gordon, Zhu Li, Guangtao Zhai, Yiling Xu

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对3D高斯溅射压缩的失真评估缺口,提出含15200张图像的多维IQA数据集3DGS-IEval-15K+,并构建基于大视觉语言模型的一体化IQA框架3DGSI-Assessor,该框架在对应数据集上达SOTA且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 57%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 5 篇

2608.03637 2026-08-05 cs.CV 新提交 79%

Learning Biomechanically Plausible Human Motion from Sparse Radar Point Clouds

从稀疏雷达点云学习符合生物力学原理的人体运动

Jonas Leo Mueller, Markus Gambietz, Alexander Weiss, Daniel Krauss, Bjoern M. Eskofier

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本研究构建整合全身骨骼模型的端到端雷达姿态估计框架,在11名康复训练受试者的交叉验证中实现多项精准指标,证明从低成本雷达恢复生物力学描述符的可行性,为临床运动分析奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02883 2026-08-05 cs.CV 新提交 79%

Test Time Adaptation Methods for Point Cloud Registration in Laparoscopic Surgery

腹腔镜手术中点云配准的测试时自适应方法

Nina Bodelot, Soufiane Belharbi, Eric Granger

机构 * ETS Montreal(蒙特利尔理工学院) LIVIA(LIVIA实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究针对腹腔镜手术中点云配准的域偏移问题,修改三类测试时自适应方法适配三维配准,经实验验证输入自适应是低延迟且误差降低效果稳定的最优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 62%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 57%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 50%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 点云 :point cloud(abstract)

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 1 篇

2608.02980 2026-08-05 cs.CV 新提交 84%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 空间理解 :3D vision(title);spatial understanding(title);分类 cs.CV

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏