arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-07 至 2026-08-07 共收录 20 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2608.05539 2026-08-07 cs.CV 新提交 79%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06208 2026-08-07 cs.RO 新提交 57%

ErgoSurf: Ergodic Control for the Coverage of Unknown Surfaces

ErgoSurf:用于未知表面覆盖的遍历控制

Stefan Schneyer, Timo Bachmann, Maged Iskandar, Korbinian Nottensteiner, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR)(德国航空航天中心) Technical University of Munich (TUM)(慕尼黑工业大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出ErgoSurf框架,结合GPIS模型与触觉传感,实现未知表面的遍历覆盖与几何在线学习,经仿真和真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 6 篇

2608.05218 2026-08-07 cs.AI cs.SD 新提交 90%

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

PD-GS:音素驱动的3DGS用于音频驱动的说话头生成

Ao Fu, Yi Zhou

机构 * Southeast University(东南大学) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract)

AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06117 2026-08-07 cs.CV cs.GR 新提交 90%

Confidence matters: Leveraging Multi-view Geometric Priors for GS-based Reconstruction

置信度很重要:利用多视图几何先验实现基于3D高斯溅射(3DGS)的重建

Hongyu Zhou, Zorah Lähner

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 Gaussian Splatting :3DGS(title_cn,summary_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 该研究针对3D高斯溅射(3DGS)几何重建不佳的问题,提出融入多视图几何先验并利用其附带的置信度图加权,在标准基准及含镜面物体的复杂场景中实现了重建质量的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05704 2026-08-07 cs.CV 新提交 85%

G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation

G$^2$ARD-GS:几何引导的锚点正则化高斯溅射蒸馏

Puyuan Zhang, Jianming Huang, Wenkai Ye, Wei Dong

机构 * Shanghai Jiao Tong University(上海交通大学) Jishu Technology Co., Ltd.(集度科技有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 针对3D高斯溅射模型基元过多导致成本高的问题,提出G$^2$ARD-GS几何引导蒸馏方法,在MatrixCity数据集上实现最优压缩性能,提升了外观适配与配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05564 2026-08-07 cs.GR 新提交 84%

ESVR: 3D Ellipsoid-based Sparse Volume Rendering via Structure-aware Primitive Learning and Per-primitive Ray Sampling

ESVR:基于椭球的稀疏体绘制方法,通过结构感知基元学习与逐基元光线采样实现

Suemin Jeon, Youjin Kim, Jungwoo Park, Kyungryun Lee, Won-Ki Jeong

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.GR

AI总结 针对现有3DGS方法依赖DVR图像学习导致信息损失与传递函数控制受限的问题,提出ESVR框架,结合结构感知基元学习与逐基元光线采样等技术,实现大规模稀疏体数据的高效压缩与实时高质量渲染。

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05896 2026-08-07 cs.AI cs.IT math.IT 新提交 78%

GSBF: Gaussian Splatting for Environment-Aware Beamforming

GSBF:面向环境感知波束成形的高斯溅射

Yijie Bian, Wei Guo, Zixin Wang, Shenghui Song, Jun Zhang, Khaled B. Letaief

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05482 2026-08-07 cs.CV 新提交 70%

CDSeg: A Renderable Gaussian Carrier for Image-to-3D Label Transfer

CDSeg:用于图像到3D标签迁移的可渲染高斯载体

Wentao Sun, Yiping Chen, Zhengsen Xu, Jonathan Li, John S. Zelek

机构 * University of Waterloo(滑铁卢大学) Sun Yat-sen University(中山大学) University of Calgary(卡尔加里大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 CDSeg是基于高斯溅射的跨域分割接口,无需特定任务3D分割训练,可复用2D掩码实现多视图标签迁移,在多个数据集上取得高mIoU,能快速处理大规模场景。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 8 篇

2608.05586 2026-08-07 cs.RO 新提交 79%

PathCover: A Fast Convex Decomposition along a Path via Randomized Iterative Space Partitioning (RISP) on Point Clouds

PathCover:基于点云的随机迭代空间划分(RISP)沿路径的快速凸分解

Kunal S. Narkhede, Abhijeet M. Kulkarni, Guoquan Huang, Ioannis Poulakakis

机构 * University of Delaware(特拉华大学) Athena Research Center(雅典娜研究中心) National Technical University of Athens(雅典国家技术大学) HERON–Center of Excellence in Robotics(赫伦机器人卓越中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.RO

AI总结 PathCover是基于点云的快速凸分解框架,采用RISP算法,可高效生成无障碍物多面体,速度较现有方法提升一个数量级,经仿真与实机验证适用于机器人导航。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05557 2026-08-07 cs.CV 新提交 79%

Hierarchical Flow Matching for 3D Point Cloud Generation

用于三维点云生成的分层流匹配

Linhao Wang, Qichang Zhang, Ye Su, Hao Wang

机构 * Shandong Normal University(山东师范大学) University of Macau(澳门大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对现有三维点云生成方法的缺陷,提出分层流匹配(HFM),将流匹配扩展为双级结构,在ShapeNet等基准上实现了有竞争力的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06267 2026-08-07 math.NA cs.NA 新提交 78%

Gradient Descent on Point Clouds and Applications in Learned Operator Correction

点云上的梯度下降及其在学习算子校正中的应用

Andreas Hauptmann, Yury Korolev, Matthew Thorpe

专题命中 点云 :point cloud(title,abstract)

AI总结 该研究针对点云隐式未知流形上的能量最小化问题,提出了一种保持在流形邻域内的梯度下降格式,并将其应用于逆问题的学习算子校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06307 2026-08-07 cs.CV 新提交 57%

UQ-Loc: Uncertainty-Aware LiDAR Scene Coordinate Regression

UQ-Loc:感知不确定性的激光雷达场景坐标回归

Jacek Komorowski

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 UQ-Loc扩展LightLoc架构,添加各向同性高斯协方差头,采用NLL损失结合kNN正则化训练,改进SC2-PCR求解器推理,提升6自由度定位精度并校准不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 57%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05774 2026-08-07 cs.CV cs.LG 新提交 57%

SR-JEPA: Learning Predictive Latent State in 3D Scenes

SR-JEPA:在3D场景中学习预测性隐状态

Zihan Zhou, Qifu Wen, Xi Zeng

机构 * Boston University(波士顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 57%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06180 2026-08-07 math.AT cs.CG 新提交 50%

The Intersection Euler Characteristic Profile: Euler Calculus and Stability for Topological Interaction of Ball Unions

相交欧拉特征轮廓:球并集拓扑交互的欧拉演算与稳定性

Kazuhiro Kawamura, Sushovan Majhi, Atish Mitra

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出相交欧拉特征轮廓(Intersection ECP),基于欧拉演算刻画多球并集拓扑交互,具多项稳定性,可高效计算,其细化能解析精细交互,稠密采样下可恢复基础形状的同调与欧拉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2608.05879 2026-08-07 cs.CV 新提交 57%

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

在生活语境中看世界:统一的室内-室外城市世界生成

Xiaobin Huang, Zilong Huang, Yang Luo, Hongchao Fan, Yiping Chen, Ting Han

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 HoloWorld是首个统一室内-室外生成的3D城市世界框架,通过跨尺度语境实现对应,在城市外部生成上优于SOTA,且保持室内外对应与跨街区连续性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2608.06236 2026-08-07 cs.CV cs.AI 新提交 57%

Depth-Guided Video Object Counting in Crowded Scenes

拥挤场景中基于深度引导的视频目标计数

Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05747 2026-08-07 cs.CV 新提交 57%

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

机构 * ByteDance Seed(字节跳动 Seed) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 1 篇

2608.05579 2026-08-07 cs.RO 新提交 79%

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO

AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。

Comments Project webpage: https://rsathua.github.io/ARGUS/

详情

展开后加载摘要…

URL PDF HTML 收藏