arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-12 至 2026-06-12 共收录 8 信号源:cs.CV, cs.GR, cs.RO

1. Gaussian Splatting 1 篇

2606.11894 2026-06-12 cs.CV 新提交 85%

Wild3R: Feed-Forward 3D Gaussian Splatting from Unconstrained Sparse Photo Collection

Wild3R: 从无约束稀疏照片集合进行前馈式3D高斯泼溅

Yuto Furutani, Takashi Otonari, Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出Wild3R,一种针对无约束稀疏照片集合的前馈式3D高斯泼溅方法,通过引入包含多样光照和瞬态物体的WildCity数据集,学习跨视角外观一致性并移除瞬态内容,性能优于现有前馈方法,与基于逐场景优化的方法相当。

Comments Project page: https://furuschool.github.io/wild3r-page/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 点云 4 篇

2606.13488 2026-06-12 cs.CV 新提交 79%

Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery

面向计算机辅助手术中部分到完整点云配准的点级几何感知Transformer

Siyu Zhou, Zhongliang Jiang

机构 * The Chair for Computer Aided Medical Procedures, Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) The University of Hong Kong(香港大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出GAPR-Net,一种结合卷积与Transformer的粗到细框架,通过交叉注意力融合局部与全局信息,并设计变换不变的点级几何特征,在四个骨骼数据集上实现94.2%配准召回率、1.992mm RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12939 2026-06-12 cs.CV 新提交 79%

MAMVI: 3D Test-Time Adaptation via Masked Multi-View Point Clouds

MAMVI:通过掩蔽多视角点云实现3D测试时自适应

Inseok Kong, Geunyoung Jung, Jiyoung Jung

机构 * Department of Geo Informatics, University of Seoul(首尔大学地理信息学系) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对3D点云在分布偏移下性能下降的问题,提出MAMVI方法,用统一单步自适应替代顺序优化,结合混合掩蔽策略和多视角损失聚合,实现快速且高精度的测试时自适应。

Comments Accepted by ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12988 2026-06-12 cs.CV cs.AI 新提交 57%

A Machine Learning Framework for Real-Time Personalized Ergonomic Pose Analysis

一种用于实时个性化人体工学姿态分析的机器学习框架

Manex Atxa, Bruno Simoes, Julen Balzategui

机构 * Vicomtech Foundation(Vicomtech基金会) Basque Research and Technology Alliance(巴斯克研究与技术联盟) BRTA

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出利用三维体积视频数据实时预测人体工学/非工学姿态的方法,结合3D点云多角度分析与个性化深度学习分类器,克服固定视角遮挡问题,实现实时评估。

Comments 13 pages, 7 figures, conference 24CMH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12981 2026-06-12 cs.CV 新提交 57%

Camera and LiDAR BEV Fusion for Cooperative 3D Object Detection on TUMTraf V2X

用于TUMTraf V2X协同3D目标检测的相机与LiDAR BEV融合

Muhammad Shahbaz, Shaurya Agarwal

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中佛罗里达大学土木、环境与建筑工程系)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种融合路边相机与基础设施-车辆点云的BEV空间检测器,采用CenterPoint风格头部和IoU重排序,在DriveX 2026挑战赛公开测试集上达到0.85 mAP,并分析了训练/验证与测试集重叠对分数的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 新视角合成 1 篇

2606.12635 2026-06-12 cs.CV 新提交 74%

CD-RCM: Generalizable Continuous-Depth Novel View Synthesis for Reflectance Confocal Microscopy

CD-RCM:面向反射共聚焦显微镜的泛化连续深度新视角合成

Tooba Imtiaz, Milind Rajadhyaksha, Kivanc Kose, Jennifer Dy

机构 * Northeastern University(东北大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 新视角合成 :novel view synthesis(title);分类 cs.CV

AI总结 针对反射共聚焦显微镜各向异性3D体积,提出首个RCM专用新视角合成方法CD-RCM,通过前馈模型从稀疏z-stack预测连续深度切片,实现亚秒级高保真合成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 2 篇

2606.13394 2026-06-12 cs.RO 新提交 70%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 空间理解 :3D vision(abstract);spatial understanding(abstract);分类 cs.RO

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07436 2026-06-12 cs.CV 新提交 57%

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Skill-3D:面向智能体3D空间推理的场景感知技能进化

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) University of Technology Sydney(技术悉尼大学) OPPO Research Institute(OPPO研究院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。

详情

展开后加载摘要…

URL PDF HTML 收藏