arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-19 至 2026-06-19 共收录 9 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2512.03199 2026-06-19 cs.CV 版本更新 57%

Does Head Pose Correction Improve Biometric Facial Recognition?

姿态校正是否能提升生物特征面部识别?

Justin Norman, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究探讨了AI驱动的头部姿态校正与图像修复对面部识别准确率的影响,发现选择性应用CFR-GAN与CodeFormer可提升识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10873 2026-06-19 cs.CV cs.AI 版本更新 57%

CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

CADBench:一个用于AI辅助CAD程序生成的多模态基准

Anna C. Doris, Jacob Thomas Sony, Ghadi Nehme, Era Syla, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出CADBench,一个统一的多模态CAD程序生成基准,包含18000个样本和六类基准,评估11种视觉语言模型,揭示了CAD程序生成中的三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2512.00850 2026-06-19 cs.CV 版本更新 85%

Smol-GS: Compact Representations for Abstract 3D Gaussian Splatting

Smol-GS: 抽象3D高斯溅射的紧凑表示

Haishan Wang, Mohammad Hassan Vali, Arno Solin

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿alto大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出Smol-GS方法,通过八叉树位置编码和熵压缩学习高效溅射特征,实现3D高斯溅射的紧凑表示,在保持渲染质量的同时大幅降低存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23172 2026-06-19 cs.CV cs.AI cs.RO 版本更新 81%

Latent Gaussian Splatting for 4D Panoptic Occupancy Tracking

潜在高斯泼溅用于4D全景占据跟踪

Maximilian Luz, Rohit Mohan, Thomas Nürnberg, Yakov Miron, Daniele Cattaneo, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Bosch Research(博世研究院) University of Haifa(海法大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 提出潜在高斯泼溅(LaGS)方法,通过特征高斯体作为动态关键点实现多视图特征聚合,用于4D全景占据跟踪,在Occ3D nuScenes和Waymo上达到最优性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 2 篇

2605.09383 2026-06-19 cs.RO 版本更新 57%

Safety-Critical LiDAR-Inertial Odometry with On-Manifold Deterministic Protection Level

安全关键的激光雷达-惯性里程计与在线流形确定性保护级别

Yueqi Zhu, Yan Pan, Chufan Rui, Jiasheng Luo, Shihua Li, Bo Zhou

机构 * School of Automation, Southeast University(东南大学自动化学院) Key Laboratory of Measurement and Control of CSE, Ministry of Education(教育部测控CSE重点实验室)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出一种安全关键的激光雷达-惯性里程计,通过在线流形确定性状态估计提供确定性保护级别,以提升移动机器人在安全关键场景中的导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16333 2026-06-19 math.AT 版本更新 50%

Computation of degree-1 persistent homology on larger point-clouds using the Reduced Vietoris-Rips filtration

使用简化 Vietoris-Rips 过滤计算更大点云上的 1 次持续同调

Musashi Ayrton Koyama, Facundo Mémoli, Vanessa Robins, Katharine Turner

专题命中 点云 :point cloud(abstract)

AI总结 提出一种算法,利用简化 Vietoris-Rips 过滤高效计算低维欧氏空间中更大点云的 1 次持续同调,降低了计算复杂度。

Comments 54 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2508.15228 2026-06-19 cs.CV 版本更新 83%

Collaborative Multi-Modal Coding for High-Quality 3D Generation

协作多模态编码用于高质量3D生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 3D生成 :3D generation(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出TriMM,首个前馈式3D原生生成模型,通过协作多模态编码融合RGB、RGBD和点云特征,结合辅助2D/3D监督和三平面潜在扩散模型,实现高质量3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2605.20448 2026-06-19 cs.CV cs.LG 版本更新 57%

Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?

视觉-语言模型是理解3D场景还是仅仅 catalogue 物体?

Animesh Maheshwari, Divyansh Sahu, Nishit Verma

机构 * Deccan AI(德克南人工智能)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文通过一个包含3034个样本的人工整理基准,探讨了视觉-语言模型对空间理解的深度有序遮挡、光学几何推断和体积重新安排规划能力,发现模型在重新安排可见布局时表现优异,但在遮挡和反射推断上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04917 2026-06-19 cs.CV cs.AI cs.CL 版本更新 57%

Vero: An Open RL Recipe for General Visual Reasoning

Vero: 通用视觉推理的开放RL配方

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出Vero系列开放视觉语言模型,通过构建600K样本数据集Vero-600K和任务路由奖励,在30个基准测试中平均提升2.9-5.4点,Vero-Qwen3I-8B超越Qwen3-VL-8B-Thinking 3.8点。

Comments Project page: https://vero-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏