arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-07 至 2026-08-07 共收录 27 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2608.05539 2026-08-07 cs.CV 新提交 79%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06208 2026-08-07 cs.RO 新提交 57%

ErgoSurf: Ergodic Control for the Coverage of Unknown Surfaces

ErgoSurf:用于未知表面覆盖的遍历控制

Stefan Schneyer, Timo Bachmann, Maged Iskandar, Korbinian Nottensteiner, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR)(德国航空航天中心) Technical University of Munich (TUM)(慕尼黑工业大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出ErgoSurf框架,结合GPIS模型与触觉传感,实现未知表面的遍历覆盖与几何在线学习,经仿真和真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06923 2026-08-07 cs.CV 版本更新 57%

Bi-PT: Bidirectional Cross-Attention Point Transformers for Four-Chamber Heart Reconstruction from Sparse Cardiac MRI Data

Bi-PT:用于从稀疏心脏MRI数据重建四腔心的双向交叉注意力点变换器

Chenchuhui Hu, Shaoming Pan, Leon Axel, Meng Ye

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) New York University(纽约大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 针对从稀疏心脏MRI数据重建四腔心的问题,Bi-PT通过双向点交叉注意力学习点特征,结合逐点语义标签改进对应估计,将变形场公式化为神经常微分方程,集成语义标签损失和添加平滑正则化,实验证明其性能准确且稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 9 篇

2608.05218 2026-08-07 cs.AI cs.SD 新提交 90%

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

PD-GS:音素驱动的3DGS用于音频驱动的说话头生成

Ao Fu, Yi Zhou

机构 * Southeast University(东南大学) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract)

AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06117 2026-08-07 cs.CV cs.GR 新提交 90%

Confidence matters: Leveraging Multi-view Geometric Priors for GS-based Reconstruction

置信度很重要:利用多视图几何先验实现基于3D高斯溅射(3DGS)的重建

Hongyu Zhou, Zorah Lähner

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 Gaussian Splatting :3DGS(title_cn,summary_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 该研究针对3D高斯溅射(3DGS)几何重建不佳的问题,提出融入多视图几何先验并利用其附带的置信度图加权,在标准基准及含镜面物体的复杂场景中实现了重建质量的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 89%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05704 2026-08-07 cs.CV 新提交 85%

G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation

G$^2$ARD-GS:几何引导的锚点正则化高斯溅射蒸馏

Puyuan Zhang, Jianming Huang, Wenkai Ye, Wei Dong

机构 * Shanghai Jiao Tong University(上海交通大学) Jishu Technology Co., Ltd.(集度科技有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 针对3D高斯溅射模型基元过多导致成本高的问题,提出G$^2$ARD-GS几何引导蒸馏方法,在MatrixCity数据集上实现最优压缩性能,提升了外观适配与配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05564 2026-08-07 cs.GR 新提交 84%

ESVR: 3D Ellipsoid-based Sparse Volume Rendering via Structure-aware Primitive Learning and Per-primitive Ray Sampling

ESVR:基于椭球的稀疏体绘制方法,通过结构感知基元学习与逐基元光线采样实现

Suemin Jeon, Youjin Kim, Jungwoo Park, Kyungryun Lee, Won-Ki Jeong

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.GR

AI总结 针对现有3DGS方法依赖DVR图像学习导致信息损失与传递函数控制受限的问题,提出ESVR框架,结合结构感知基元学习与逐基元光线采样等技术,实现大规模稀疏体数据的高效压缩与实时高质量渲染。

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11183 2026-08-07 cs.CV 版本更新 79%

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

基于前馈二维高斯溅射标记化的通用视频表示

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。

Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05896 2026-08-07 cs.AI cs.IT math.IT 新提交 78%

GSBF: Gaussian Splatting for Environment-Aware Beamforming

GSBF:面向环境感知波束成形的高斯溅射

Yijie Bian, Wei Guo, Zixin Wang, Shenghui Song, Jun Zhang, Khaled B. Letaief

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05482 2026-08-07 cs.CV 新提交 70%

CDSeg: A Renderable Gaussian Carrier for Image-to-3D Label Transfer

CDSeg:用于图像到3D标签迁移的可渲染高斯载体

Wentao Sun, Yiping Chen, Zhengsen Xu, Jonathan Li, John S. Zelek

机构 * University of Waterloo(滑铁卢大学) Sun Yat-sen University(中山大学) University of Calgary(卡尔加里大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 CDSeg是基于高斯溅射的跨域分割接口,无需特定任务3D分割训练,可复用2D掩码实现多视图标签迁移,在多个数据集上取得高mIoU,能快速处理大规模场景。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02006 2026-08-07 cs.CV 版本更新 70%

ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment

ASTRA:基于轨迹对齐的异步时空重建

Junyu Zhu, Hao Zhu, Xinzhuo Zhang, Hongdong Li, Zhan Ma, Xun Cao

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 针对动态三维场景重建中多相机异步导致的问题,提出ASTRA框架,通过轨迹对齐联合优化时间偏移与三维表示,在实验中实现了显著的性能提升。

Comments We wish to withdraw this preprint because the current statistical analysis of the experimental data is incomplete and requires re-verification. We plan to submit a revised and thoroughly checked version in the near future

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 10 篇

2608.05586 2026-08-07 cs.RO 新提交 79%

PathCover: A Fast Convex Decomposition along a Path via Randomized Iterative Space Partitioning (RISP) on Point Clouds

PathCover:基于点云的随机迭代空间划分(RISP)沿路径的快速凸分解

Kunal S. Narkhede, Abhijeet M. Kulkarni, Guoquan Huang, Ioannis Poulakakis

机构 * University of Delaware(特拉华大学) Athena Research Center(雅典娜研究中心) National Technical University of Athens(雅典国家技术大学) HERON–Center of Excellence in Robotics(赫伦机器人卓越中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.RO

AI总结 PathCover是基于点云的快速凸分解框架,采用RISP算法,可高效生成无障碍物多面体,速度较现有方法提升一个数量级,经仿真与实机验证适用于机器人导航。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05557 2026-08-07 cs.CV 新提交 79%

Hierarchical Flow Matching for 3D Point Cloud Generation

用于三维点云生成的分层流匹配

Linhao Wang, Qichang Zhang, Ye Su, Hao Wang

机构 * Shandong Normal University(山东师范大学) University of Macau(澳门大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对现有三维点云生成方法的缺陷,提出分层流匹配(HFM),将流匹配扩展为双级结构,在ShapeNet等基准上实现了有竞争力的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06267 2026-08-07 math.NA cs.NA 新提交 78%

Gradient Descent on Point Clouds and Applications in Learned Operator Correction

点云上的梯度下降及其在学习算子校正中的应用

Andreas Hauptmann, Yury Korolev, Matthew Thorpe

专题命中 点云 :point cloud(title,abstract)

AI总结 该研究针对点云隐式未知流形上的能量最小化问题,提出了一种保持在流形邻域内的梯度下降格式,并将其应用于逆问题的学习算子校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06307 2026-08-07 cs.CV 新提交 57%

UQ-Loc: Uncertainty-Aware LiDAR Scene Coordinate Regression

UQ-Loc:感知不确定性的激光雷达场景坐标回归

Jacek Komorowski

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 UQ-Loc扩展LightLoc架构,添加各向同性高斯协方差头,采用NLL损失结合kNN正则化训练,改进SC2-PCR求解器推理,提升6自由度定位精度并校准不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 57%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05774 2026-08-07 cs.CV cs.LG 新提交 57%

SR-JEPA: Learning Predictive Latent State in 3D Scenes

SR-JEPA:在3D场景中学习预测性隐状态

Zihan Zhou, Qifu Wen, Xi Zeng

机构 * Boston University(波士顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 57%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14768 2026-08-07 cs.RO 版本更新 57%

CADRE: Dynamic Catching via Implicit Contact Descriptors and Task-Appropriate Recovery Affordances

CADRE:基于隐式接触描述符和任务适配恢复可供性的动态抓取

Fan Yang, Zixuan Huang, Abhinav Kumar, Sergio Aguilera Marinovic, Soshi Iba, Rana Soltani Zarrin, Dmitry Berenson

机构 * Honda Research Institute USA(本田美国研究院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 该研究针对灵巧操作中物体掉落的问题,提出CADRE强化学习框架,结合NDF提取接触特征与隐式恢复可供性函数,可高效成功恢复并零样本泛化到不同几何的未见物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14243 2026-08-07 cs.CV 版本更新 57%

Multi-Representation Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition

多表示几何层次融合:一种用于鲁棒三维地点识别的隐式子图驱动框架

Xiaohui Jiang, Haijiang Zhu, Chade Li, Ning An

机构 * College of Information and Technology, Beijing University of Chemical Technology(信息与技术学院,北京化工大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Research Institute of Mine Artificial Intelligence, China Coal Research Institute(矿山人工智能研究院,中国煤炭科研院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对激光雷达地点识别中描述子不稳定与表示脆弱性问题,本文提出隐式神经点驱动的多表示几何层次融合框架,在多数据集上实现鲁棒性能,平衡了精度、效率与内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06180 2026-08-07 math.AT cs.CG 新提交 50%

The Intersection Euler Characteristic Profile: Euler Calculus and Stability for Topological Interaction of Ball Unions

相交欧拉特征轮廓:球并集拓扑交互的欧拉演算与稳定性

Kazuhiro Kawamura, Sushovan Majhi, Atish Mitra

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出相交欧拉特征轮廓(Intersection ECP),基于欧拉演算刻画多球并集拓扑交互,具多项稳定性,可高效计算,其细化能解析精细交互,稠密采样下可恢复基础形状的同调与欧拉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2608.05879 2026-08-07 cs.CV 新提交 57%

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

在生活语境中看世界:统一的室内-室外城市世界生成

Xiaobin Huang, Zilong Huang, Yang Luo, Hongchao Fan, Yiping Chen, Ting Han

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 HoloWorld是首个统一室内-室外生成的3D城市世界框架,通过跨尺度语境实现对应,在城市外部生成上优于SOTA,且保持室内外对应与跨街区连续性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 3 篇

2608.06236 2026-08-07 cs.CV cs.AI 新提交 57%

Depth-Guided Video Object Counting in Crowded Scenes

拥挤场景中基于深度引导的视频目标计数

Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05747 2026-08-07 cs.CV 新提交 57%

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

机构 * ByteDance Seed(字节跳动 Seed) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 1 篇

2608.05579 2026-08-07 cs.RO 新提交 79%

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO

AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。

Comments Project webpage: https://rsathua.github.io/ARGUS/

详情

展开后加载摘要…

URL PDF HTML 收藏