arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-18 至 2026-08-18 共收录 25 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2608.15260 2026-08-18 cs.CV cs.AI 新提交 83%

VGGT-Align: Bridging Local Reconstruction and Global Consistency for Long-Sequence 3D Reconstruction

VGGT-Align:为长序列三维重建连接局部重建与全局一致性

Wei Zhang, Yihang Wu, Songhua Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 该研究针对长序列三维重建的尺度漂移问题,提出VGGT-Align框架,通过SGIA和测试时适配策略,在多基准上实现顶尖性能,降低绝对轨迹误差最多32%

Comments 10 pages, 6 figures, 6 tables. ACM Multimedia 2026 (MM '26). Code: this https URL (https://github.com/WZ-CS/VGGT-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 62%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16725 2026-08-18 cs.CV cs.AI 新提交 57%

Unsupervised Anomaly Detection for Image Dataset Quality Assurance in Multi-Center Breast MRI

面向多中心乳腺MRI图像数据集质量保证的无监督异常检测

Chiara Tappermann, Steffen Renisch, Lars Ole Schwen, Hans Meine, Horst K. Hahn, Eike Petersen

机构 * Cambridge University Hospitals(剑桥大学医院) Mitera Hospital(米特拉医院) Radboud University Medical Center(拉德堡德大学医学中心) University Hospital Aachen(亚琛大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Ribera Hospital(里贝拉医院) Duke Breast Cancer MRI(杜克乳腺癌磁共振成像项目)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 该研究针对多中心乳腺MRI数据集,构建含17种异常类型的无监督异常检测基准,评估四种方法,发现带位置编码的投影法性能最优,为医疗AI的可扩展无监督质量保证提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15251 2026-08-18 cs.CV 新提交 57%

Robust structure from motion for aerial-ground images via detector-free feature matching and multi-view track refinement

基于无检测器特征匹配与多视图轨迹优化的空地图像鲁棒运动恢复结构

San Jiang, Hui Wang, Xing Zhang, Zhongwen Hu, Zhijun Wang, Ruisheng Wang, Wanshou Jiang, Qingquan Li

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院) Guangdong Key Laboratory of Urban Informatics, Shenzhen University(深圳大学广东省城市信息学重点实验室) MNR Key Laboratory for Geo-Environmental Monitoring of Great Bay Area, Shenzhen University(深圳大学自然资源部大湾区地理环境监测重点实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本研究提出结合无检测器匹配网络与多视图轨迹优化的方法,用于解决空地图像三维重建中特征匹配鲁棒性问题,在5°位姿误差下AUC较LoFTR提升93.9%,实现更高精度的ISfM重建。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2608.15420 2026-08-18 cs.CV 新提交 81%

HistReNeRF: Historic Image Relocalisation within Contemporary Neural Radiance Field Reconstructions

HistReNeRF:在当代神经辐射场重建中进行历史图像重定位

Benjamin T. Hughes, Stuart James

专题命中 NeRF :NeRF(summary_cn,abstract);分类 cs.CV

AI总结 针对历史图像与当代场景的外观差异导致重定位困难的问题,提出HistReNeRF框架,通过适配DINOv2特征与NeRF候选射线匹配实现跨时间域适配,在含三地标的数据集上使平移、旋转误差平均降低11%、16%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 10 篇

2608.16103 2026-08-18 cs.CV 新提交 91%

Beyond Similarity Matching: Structured Reasoning for Open-Vocabulary Referring Segmentation in 3DGS

超越相似度匹配:面向3D高斯溅射(3DGS)的开放词汇指称分割的结构化推理

Yizhao Wang, Xinfa Wang, Jingbo Wang, Jingbo Wang, Guantao Zhang, Yafeng Han, Guohong Gao, Yuhe Xia

机构 * School of Computer Science, Henan Institute of Science and Technology(河南科技学院计算机学院)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 针对现有3DGS指称分割方法依赖相似度匹配的缺陷,提出QAGaussian框架,经Mosaic3D-5.6M预训练后,在基准上实现性能提升,优于现有最强基线。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16324 2026-08-18 cs.CV cs.LG 新提交 87%

LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting

LaGSplat:使用潜拉格朗日高斯溅射从单目视频中推断物理控制的交互式模拟

Louen Pottier

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CEA(法国原子能和替代能源委员会) CEA, List(法国原子能和替代能源委员会 电子与信息技术实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出LaGSplat框架,可从单目视频推断物理控制的交互式模拟,能对刚性/可变形物体施加训练外的力并实时渲染响应,解决了无约束预测器发散问题。

Comments 25 pages, 11 figures, 4 tables. Project page with interactive demo: this https URL (https://louenpottier.github.io/lagsplat.html)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14713 2026-08-18 cs.RO cs.CV 新提交 86%

SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception

SpotlessGS:面向机器人感知的动态光照下可重光照三维高斯溅射技术

Liang Hong, Jiaxin Wei, Simon Schaefer, Stefan Leutenegger, Jaehyung Jung

机构 * Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 该研究针对机器人在差光照环境下感知性能下降问题,提出SpotlessGS方法,通过优化光照参数、引入SH光照模型及MLP-BRDF,实现可重光照三维重建,提升了渲染与感知性能。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16042 2026-08-18 cs.CV 新提交 85%

TR-GS: High-Fidelity Sparse-View CT Volumetric Rendering via t-Distribution Gaussian Splatting and Ray-Confidence Modeling

TR-GS:基于t分布高斯溅射和射线置信度建模的高保真稀疏视图CT体积渲染

Zedong Xiao, Yiren Wang, Zhou Liu, Xiaolin Liu, Zhangji Lu

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 TR-GS用学生t分布基元与射线置信度模型优化3D高斯溅射,实现高保真稀疏视图CT体积渲染,在多数场景优于基线,可支撑下游医学多媒体应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15785 2026-08-18 cs.CV 新提交 85%

RoofGS: Roofline-Guided End-to-End Acceleration of 3D Gaussian Splatting

RoofGS:基于Roofline模型的3D高斯溅射端到端加速

Yang Luo, Yan Gong, Yongsheng Gao, Jie Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对3D高斯溅射高分辨率GPU加速瓶颈,提出RoofGS框架,采用分辨率自适应量化深度排序键与范围感知比特级快速指数近似等优化,在RTX 4090的4K场景下实现10.1倍加速且PSNR损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14902 2026-08-18 cs.RO 新提交 85%

Geometry-Aware Online Mapping for 3D Gaussian Splatting SLAM

面向3D高斯溅射SLAM的几何感知在线建图

Thai Luu, Quan Tran, Hieu Phan, Tuan Dang

机构 * University of Arkansas(阿肯色大学) VinUniversity

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.RO

AI总结 本研究针对现有3D高斯溅射SLAM流水线的启发式方法在在线场景下的脆弱问题,提出三种几何感知建图方法,实现渲染质量提升且开销可忽略,并将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15651 2026-08-18 cs.CV 新提交 78%

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract,comments);分类 cs.CV

AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标

Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15024 2026-08-18 cs.RO cs.AI cs.CV 新提交 76%

MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM

MotionGS-SLAM:面向运动模糊鲁棒SLAM的事件调制高斯溅射

Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa

机构 * Research Institute for Science & Technology, Tokyo University of Science(东京理科大学科学技术研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV、cs.RO

AI总结 MotionGS-SLAM通过事件调制高斯核与双调制机制,在渲染流水线中建模运动模糊形成,实现相机轨迹与场景几何联合优化,显著提升高运动下SLAM的轨迹与地图精度。

Comments 8 pages, 5 figures. Published in the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16499 2026-08-18 cs.RO cs.CV 新提交 73%

OccamView: Object-Conditioned View Selection for Frame-Budgeted Active 3D Gaussian Reconstruction

OccamView:面向帧预算约束下主动式3D高斯重建的物体条件视角选择方法

Hongbo Gao, Wei Zhang, Zeyu Ni, Dihao Zhu, Ruifeng Li, Yunke Wang, Chang Xu

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV、cs.RO

AI总结 针对帧预算紧张时现有主动3D高斯重建方法易漏重建物体的问题,提出OccamView框架,通过物体条件视角选择与Geo-Floor机制优化规划,在多数据集上提升了重建表现。

Comments 7 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14986 2026-08-18 cs.RO cs.AI 新提交 57%

GaussMemory: Task-Driven 3D Gaussian Scene Memory for Long-Horizon Robotic Manipulation

GaussMemory:面向长时程机器人操作的任务驱动三维高斯场景记忆

Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa

机构 * Research Institute for Science & Technology, Tokyo University of Science(东京理科大学科学技术研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.RO

AI总结 该研究针对现有三维机器人记忆系统被动存储的缺陷,提出任务驱动的主动场景记忆框架GaussMemory,在LIBERO、VLABench基准上超越了MemoryVLA、π₀-FAST等方法。

Comments 8 pages, 10 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 7 篇

2608.16225 2026-08-18 cs.CV 新提交 79%

PCT-Prompt: A Prompt-Guided Transformer Framework for Dense Prediction Tasks in Point Clouds

PCT-Prompt:用于点云密集预测任务的提示引导Transformer框架

Dejun Zhang, Yanzi Bai, Yiqi Wu

机构 * China University of Geosciences(中国地质大学) Li Auto Inc(理想汽车)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 PCT-Prompt是一种提示引导Transformer框架,通过引入提示引导特征分支和提示丢弃机制,提升了标准Transformer在点云密集预测任务中的适应性,在多个公开数据集上取得了优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15104 2026-08-18 cs.CV 新提交 79%

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

机构 * Hunan University(湖南大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对现有点云补全方法几何一致性与适应性不足的问题,提出ProjFormer跨模态框架,通过投影引导视图注意力模块与几何感知路由网络实现高效特征聚合与融合,在轻量级设计下取得了具竞争力的补全性能。

Comments Accepted by ACM Multimedia 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16673 2026-08-18 cs.CV 新提交 57%

How Sampling Strategy Affects Imbalance Mitigation in LiDAR Segmentation: A Study of Structured vs. Random Point-Based Architectures

采样策略如何影响激光雷达分割中的不平衡缓解:结构化与基于随机点的架构研究

Antonis Savva, Christos Kyrkou, Theocharis Theocharides

机构 * University of Cyprus(塞浦路斯大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究在DALES、S3DIS、STPLS3D数据集上,针对KPConv和RandLA-Net架构,测试了6种重加权方案与5种感知不平衡损失,发现采样策略、不平衡程度及数据采集特征的相互作用影响激光雷达分割的不平衡缓解效果。

Comments 9 pages, 6 figures, IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16264 2026-08-18 cs.RO 新提交 57%

Cyclops: LiDAR as a Camera That Dreams in Color

Cyclops:以彩色进行“梦境”的相机式激光雷达

Wei Gao, Jian Shu, Mingle Zhao, Maani Ghaffari, David Kong, Chengzhong Xu, Hui Kong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出Cyclops框架,将稀疏NRS-LiDAR强度转为RGB视频,通过LBM等技术缓解帧间闪烁,合成RGB可使感知模型在多任务上优于LiDAR基线与传统相机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15890 2026-08-18 cs.CE 新提交 50%

COOL: A Cooling-Aware Point Transformer Framework for Thermal Prediction in Advanced 3D/3.5D IC Packaging

COOL:面向先进3D/3.5D IC封装热预测的感知冷却的点Transformer框架

Yao Lu, Zhicheng Guo, Qijun Zhang, Shang Liu, Wenji Fang, Wenkai Li, Zhiyao Xie

专题命中 点云 :point cloud(abstract)

AI总结 针对先进3D/3.5D IC封装热管理挑战,提出感知冷却的点Transformer框架COOL,显式编码几何与冷却结构,引入PI-BC损失,在自建基准上NMAE达2.4%,速度较商用FEM求解器提升超15.7倍且优于现有学习方法。

Comments 7 pages, accepted at DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16799 2026-08-18 math.OC math.NA 新提交 50%

Doubling the dimension yields a benign landscape for the squared-stress

维度加倍可产生平方应力的良性景观

Christopher Criscitiello

专题命中 点云 :point cloud(abstract)

AI总结 本文针对欧氏距离几何问题,证明当k≥2(ℓ+1)时,完全图平方应力的优化景观为良性,将k≥ℓ+1的猜想因子缩小一半,采用二阶临界性的对偶视角推导结论。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15157 2026-08-18 physics.comp-ph 新提交 50%

Plasolver: Physics-Informed Neural Operators for Elastoplasticity

Plasolver:用于弹塑性问题的物理信息神经算子

Yizheng Wang, Mohammad Sadegh Eshaghi, Huadong Zhang, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 点云 :point cloud(abstract)

AI总结 研究针对弹塑性分析计算成本高的问题,提出Plasolver物理信息神经算子框架,结合算子学习与经典求解器优势,预训练结合热启动阶段,实现高精度与大幅加速,减少迭代次数,为弹塑性问题提供高效计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2608.16863 2026-08-18 cs.CV 新提交 91%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 新视角合成 :3DGS(summary_cn,abstract);novel view synthesis(title,abstract);NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 2 篇

2608.15788 2026-08-18 cs.CV 新提交 57%

ChainSpace: A Chained-Reasoning Paradigm for Spatial Intelligence

ChainSpace:面向空间智能的链式推理范式

Xiaohan Zhang, Feng Gu, Xudong Rao, Xuhao Pan, Tao Wei, Zhou Pan, Kun Zhan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Li Auto Inc.(理想汽车有限公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14721 2026-08-18 cs.CV 新提交 57%

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

AeroGround:用于空-地协同推理的综合基准

Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Chongqing Technology and Business University(重庆工商大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏