arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-13 至 2026-08-13 共收录 12 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2608.12179 2026-08-13 cs.CV 新提交 79%

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D:面向流输入的多视图3D目标检测的度量前馈3D重建先验

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Hermann Blum, Peter Kontschieder, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(元宇宙实验室) University of Bonn(波恩大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 Map-Det3D是一种在线多视图3D目标检测模型,通过将短时间窗口映射为多视图并利用前馈度量3D重建模型作为几何骨干,直接在度量3D空间预测边界框,实现了稳定的单目视频3D检测,且具有良好的在线性能与鲁棒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12232 2026-08-13 cs.CV 新提交 57%

ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference

ScaleVid:基于无网格推理的几何感知视频目标缩放

Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Shihao Zhao, Rong Xiao

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 ScaleVid提出无网格推理的两阶段训练框架,实现几何感知视频目标缩放,在野外视频评估中,其几何一致性、前景保真度等优于需显式3D重建的方法,推理更实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11409 2026-08-13 cs.RO 新提交 57%

From Self-Normal-Positioning to Omni-Directional Tracking: Real-Time Surface Modeling Enabled Probe Tilt Control for Robotic Ultrasound Imaging

从自正常定位到全向跟踪:用于机器人超声成像的实时表面建模支持的探头倾斜控制

Xihan Ma, Haichong Zhang

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 该研究针对机器人超声成像中现有系统仅支持探头法向定位的局限,提出整合RGB-D感知等的全向探头朝向控制框架,实现了高精度的任意角度跟踪,可获取临床所需非法向诊断视图。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2608.12175 2026-08-13 cs.CV 新提交 70%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 NeRF :NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 1 篇

2608.11928 2026-08-13 cs.CV 新提交 84%

Seed2GS: Camera-Free, Training-Free Object Extraction from 3D Gaussian Scenes via a Single Reference-View Grounding

Seed2GS:通过单个参考视图定位从3D高斯溅射(3DGS)场景中进行无相机、无训练的目标提取

Zongjian Ding, Yudong Gao, Jiale Liu, Xinglin Yu, Junxing Ren, Dong Wei, Yajing Chen, Shan Huang, Mingjun Cheng, Min Li

专题命中 Gaussian Splatting :3DGS(title_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 Seed2GS是一种无相机、无训练的目标提取方法,通过分离目标身份与3D覆盖范围,在LERF-MASK和3D-OVS数据集上实现了高精度,且计算延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 6 篇

2608.11273 2026-08-13 eess.IV cs.CV cs.MM 新提交 83%

Geometry-Based Compression of Plenoptic Point Clouds

基于几何的全光点云压缩

Davi R. Freitas, Gustavo L. Sandri, Ricardo L. de Queiroz

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出一种整合进MPEG G-PCC标准的PPC属性压缩方法,经不同分辨率PPC测试,性能优于现有同类方案,有望成为新最优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11697 2026-08-13 cs.CV 新提交 79%

Boundary-Enhanced Segmentation of Pig Point Clouds in Commercial Housing Environments

商业养殖环境下猪只点云的边界增强分割

Zhankang Xu, Fei Shi, Xiangyu Qi, Zhaoyang Wang, Mengxin Guo, Yikai Fan, Simon X. Yang, Qifeng Li, Weihong Ma

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对商业猪舍中猪只点云分割的边界模糊等问题,采用Octree Transformer骨干网络,结合软距离边界伪标签与双向跨边界语义模块,提升分割性能,为精准畜牧养殖提供可靠输入。

Comments 24 pages,9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11845 2026-08-13 eess.IV cs.MM 新提交 78%

ResPCC: A Loss-Resilient Neural Point Cloud Codec over Lossy Networks

ResPCC:有损网络中具备抗丢包能力的神经点云编解码器

Xueqin Niu, Mufan Liu, Yifan Wang, Le Yang, Jun Sun, Yiling Xu

专题命中 点云 :point cloud(title,abstract)

AI总结 针对有损网络中点云压缩的数据包丢失问题,提出具备感知丢包率能力的ResPCC编解码器,通过CALM、SCI、MGLR、DBR等模块提升稳定性与率失真性能,在5%-30%丢包率下优于基线方法,为3D数据传输提供可靠方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12148 2026-08-13 cs.GR 新提交 57%

MVFM-3DAD: Multi-view Flow Matching for 3D Anomaly Detection via Density Proxy Estimation

MVFM-3DAD:基于密度代理估计的三维异常检测多视图流匹配方法

Liangwei Li, Lin Liu, Jing Zhang, Xiaohui Du, Ruqian Hao, Xinwei Li, Hanzhe Liang, Juanxiu Liu

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 该研究针对现有三维异常检测方法的局限性,提出MVFM-3DAD框架,将3DAD转化为密度代理估计,在Real3D-AD等数据集上性能优于竞争方法。

Comments ICIG 2026 oral presentation, 13 pages, 3 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11645 2026-08-13 cs.CV 新提交 57%

Cloak of Invisibility: Real-Time Privacy-Preserving Volumetric Video Streaming

隐形斗篷:实时隐私保护的体视频流

Hossein Khalili, Philip Do, Alexander Vilesov, Kittipat Apicharttrisorn, Nader Sehatbakhsh

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 57%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2608.12220 2026-08-13 cs.CV cs.AI 新提交 57%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏