arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-11 至 2026-08-11 共收录 14 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 1 篇

2509.08813 2026-08-11 cs.RO 版本更新 57%

Calib3R: Hand-Eye Calibration and 3D Metric-Scaled Scene Reconstruction with 3D Foundation Models

Calib3R:基于三维基础模型的手眼标定与三维度量尺度场景重建

Davide Allegro, Matteo Terreran, Stefano Ghidoni

机构 * Department of Information Engineering (DEI) at the University of Padova(帕多瓦大学信息工程系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 Calib3R是一种基于3D基础模型的无标定板方法,通过统一优化联合完成手眼标定与度量尺度三维重建,仅用不到10张图像即可实现精确标定,性能优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2607.27825 2026-08-11 eess.IV cs.CV 版本更新 90%

Endo-NeRF++: Uncertainty-Aware Neural Rendering with Multi-Resolution Hash Encoding for Dynamic Surgical Scene Reconstruction

Endo-NeRF++:面向动态手术场景重建的不确定性感知神经辐射场,采用多分辨率哈希编码

Gousia Habib, Laura Ruotsalainen

专题命中 NeRF :NeRF(title,title_cn);分类 cs.CV

AI总结 本研究提出Endo-NeRF++框架,采用多分辨率哈希编码等技术提升动态手术场景重建精度,其不确定性引导自适应采样在机器人手术视频实验中获多项指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 3 篇

2608.01958 2026-08-11 cs.CV cs.AI 版本更新 89%

FAST-GS: Frequency Aware Space-time Gaussian Splatting for Photorealistic Dynamic Novel View Synthesis

FAST-GS:用于逼真动态新视图合成的频率感知时空高斯溅射

Zhengyang Zhang, Ziyu Lu, PengCheng Li, Hongbo Duan, Yi Liu, Pengting Luo, Peiyu Zhuang, Xinghui Li, Shaohua Ma

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文针对现有4DGS动态建模的不足,提出傅里叶运动建模模块与运动感知正则化策略,在N3V和Google Immersive数据集上验证了方法在复杂动态场景下的性能。

Comments accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06343 2026-08-11 cs.CV 版本更新 74%

Uncertainty-Aware 4D Gaussian Splatting for Monocular Occluded Human Rendering

考虑不确定性的4D高斯点散布用于单目遮挡人体渲染

Weiquan Wang, Feifei Shao, Lin Li, Zhen Wang, Fengda Zhang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 本文提出U-4DGS框架,通过概率变形网络和联合光栅化流程,在异方差观测噪声下实现最大后验估计,解决单目视频中遮挡导致的高保真动态人体渲染问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04224 2026-08-11 cs.CV 版本更新 70%

SplitGaussian: Reconstructing Dynamic Scenes via Visual Geometry Decomposition

SplitGaussian:通过视觉几何分解重建动态场景

Lechao Cheng, Jiahui Li, Jingxuan He, Shengeng Tang, Gang Huang, Tianrui Hui, Yaxiong Wang, Zhun Zhong

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 SplitGaussian将场景表示分解为静态与动态分量,解耦运动建模与背景几何,提升动态场景重建的时间一致性、保真度与收敛速度,性能优于现有SOTA方法。

Comments version 2. Accepted By ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 5 篇

2602.11554 2026-08-11 cs.RO cs.CV cs.LG 版本更新 81%

HyperDet: 3D Object Detection with Hyper 4D Radar Point Clouds

HyperDet: 基于超4D雷达点云的3D目标检测

Yichun Xiao, Runwei Guan, Jin Jin, Fangqiang Ding

机构 * University of Edinburgh(爱丁堡大学) HKUST (GZ)(香港科技大学(广州)) University of Oxford(牛津大学) MIT(麻省理工学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07558 2026-08-11 cs.CV cs.LG cs.RO 版本更新 81%

Unsupervised Point Cloud Registration with Self-Distillation

基于自蒸馏的无监督点云配准

Christian Löwens, Thorben Funke, André Wagner, Alexandru Paul Condurache

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 本文针对点云配准依赖真实位姿标注的问题,提出自蒸馏无监督方法,在3DMatch基准上优于现有方法,且可泛化至汽车雷达场景。

Comments Oral at BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24052 2026-08-11 cs.CV 版本更新 79%

PointCHR: Point Cloud Analysis via Curvature-Aware Hyperbolic Rectification

PointCHR:通过曲率感知双曲整流进行点云分析

Xinxing Yu, Liying Yang, Hao Mo, Hui Ma, Fang Kai, Ajian Liu, Yanyan Liang

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对三维点云中高曲率区域难以解析的问题,提出PointCHR方法,利用双曲流形指数体积膨胀特性,通过曲率引导径向整流机制,有效缓解表示拥挤问题,提升主干网络捕捉细节能力,在多基准测试中达最优性能。

Journal ref Proceedings of the 43 rd International Conference on Machine Learning,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07282 2026-08-11 cs.CV cs.LG 版本更新 57%

Compatibility of Face Embeddings Across Deep Neural Networks

人脸嵌入在不同深度神经网络模型间是否兼容?

Fizza Rubab, Yiying Tong, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09062 2026-08-11 cs.CV cs.LG 版本更新 57%

SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding

SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解

Seongyong Kim, Yong Kwon Cho

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2603.05868 2026-08-11 cs.RO 版本更新 57%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2510.14357 2026-08-11 cs.RO cs.AI 版本更新 83%

SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation

SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 空间理解 :spatial understanding(title,abstract);3D reconstruction(abstract);分类 cs.RO

AI总结 针对现有农业视觉语言导航方法忽视重复指令的空间记忆潜力的局限,提出SUM模块并集成至AgriVLN构建SUM-AgriVLN,在A2A基准上将SR从0.47提至0.54,NE仅微增,达领域顶尖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2604.13183 2026-08-11 cs.CV cs.MM 版本更新 57%

GeoLink: A 3D-Aware Framework Towards Better Generalization in Cross-View Geo-Localization

GeoLink:一种面向跨视角地理定位更好泛化的3D-aware框架

Hongyang Zhang, Yinhao Liu, Haitao Zhang, Zhongyi Wen, Zhenyu Kuang, Shuxian Liang, Xiansheng Hua

机构 * CUHK(SZ)(香港中文大学(深圳)) XMU(厦门大学) UESTC(电子科技大学) Foshan University(佛山大学) Tongji University(同济大学)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 本文提出GeoLink框架,通过3D感知的语义一致方法提升跨视角地理定位的泛化能力,实验表明其在多个基准测试中优于现有方法,能适应未见领域和多变天气。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他3D视觉 1 篇

2506.00633 2026-08-11 cs.CV cs.AI 版本更新 57%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏