arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-13 至 2026-08-13 共收录 21 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2608.12179 2026-08-13 cs.CV 新提交 79%

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D:面向流输入的多视图3D目标检测的度量前馈3D重建先验

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Hermann Blum, Peter Kontschieder, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(元宇宙实验室) University of Bonn(波恩大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 Map-Det3D是一种在线多视图3D目标检测模型,通过将短时间窗口映射为多视图并利用前馈度量3D重建模型作为几何骨干,直接在度量3D空间预测边界框,实现了稳定的单目视频3D检测,且具有良好的在线性能与鲁棒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12232 2026-08-13 cs.CV 新提交 57%

ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference

ScaleVid:基于无网格推理的几何感知视频目标缩放

Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Shihao Zhao, Rong Xiao

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 ScaleVid提出无网格推理的两阶段训练框架,实现几何感知视频目标缩放,在野外视频评估中,其几何一致性、前景保真度等优于需显式3D重建的方法,推理更实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11409 2026-08-13 cs.RO 新提交 57%

From Self-Normal-Positioning to Omni-Directional Tracking: Real-Time Surface Modeling Enabled Probe Tilt Control for Robotic Ultrasound Imaging

从自正常定位到全向跟踪:用于机器人超声成像的实时表面建模支持的探头倾斜控制

Xihan Ma, Haichong Zhang

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 该研究针对机器人超声成像中现有系统仅支持探头法向定位的局限,提出整合RGB-D感知等的全向探头朝向控制框架,实现了高精度的任意角度跟踪,可获取临床所需非法向诊断视图。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 2 篇

2505.05474 2026-08-13 cs.CV 版本更新 77%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 NeRF :NeRF(abstract,abstract_cn);3D vision(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12175 2026-08-13 cs.CV 新提交 70%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 NeRF :NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 4 篇

2605.13794 2026-08-13 cs.GR cs.CV 版本更新 89%

BlitzGS: City-Scale Gaussian Splatting at Lightning Speed

BlitzGS:闪电速度实现城市级高斯点云渲染

Zhongtao Wang, Huishan Au, Yilong Li, Mai Su, Haojie Jin, Yisong Chen, Meng Gai, Fei Zhu, Guoping Wang

机构 * Peking University(北京大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV、cs.GR

AI总结 BlitzGS通过分布式3DGS框架实现城市级场景快速重建,通过分层工作负载管理减少活跃高斯点云计算量,提升渲染效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新 85%

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11928 2026-08-13 cs.CV 新提交 84%

Seed2GS: Camera-Free, Training-Free Object Extraction from 3D Gaussian Scenes via a Single Reference-View Grounding

Seed2GS:通过单个参考视图定位从3D高斯溅射(3DGS)场景中进行无相机、无训练的目标提取

Zongjian Ding, Yudong Gao, Jiale Liu, Xinglin Yu, Junxing Ren, Dong Wei, Yajing Chen, Shan Huang, Mingjun Cheng, Min Li

专题命中 Gaussian Splatting :3DGS(title_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 Seed2GS是一种无相机、无训练的目标提取方法,通过分离目标身份与3D覆盖范围,在LERF-MASK和3D-OVS数据集上实现了高精度,且计算延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04348 2026-08-13 cs.CV cs.GR 版本更新 84%

SCAR-GS: Spatial Context Attention for Residuals in Progressive Gaussian Splatting

SCAR-GS:用于渐进高斯点扩散中残差的空间上下文注意力

Diego Revilla, Pooja Suresh, Ooi Wei Tsang, Anand Bhojan

机构 * National University of Singapore(新加坡国立大学) University of Deusto(德乌斯大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 SCAR-GS通过残差向量量化和自回归熵模型提升3D高斯点扩散的压缩效率与率-失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 9 篇

2608.11273 2026-08-13 eess.IV cs.CV cs.MM 新提交 83%

Geometry-Based Compression of Plenoptic Point Clouds

基于几何的全光点云压缩

Davi R. Freitas, Gustavo L. Sandri, Ricardo L. de Queiroz

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出一种整合进MPEG G-PCC标准的PPC属性压缩方法,经不同分辨率PPC测试,性能优于现有同类方案,有望成为新最优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11697 2026-08-13 cs.CV 新提交 79%

Boundary-Enhanced Segmentation of Pig Point Clouds in Commercial Housing Environments

商业养殖环境下猪只点云的边界增强分割

Zhankang Xu, Fei Shi, Xiangyu Qi, Zhaoyang Wang, Mengxin Guo, Yikai Fan, Simon X. Yang, Qifeng Li, Weihong Ma

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对商业猪舍中猪只点云分割的边界模糊等问题,采用Octree Transformer骨干网络,结合软距离边界伪标签与双向跨边界语义模块,提升分割性能,为精准畜牧养殖提供可靠输入。

Comments 24 pages,9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11845 2026-08-13 eess.IV cs.MM 新提交 78%

ResPCC: A Loss-Resilient Neural Point Cloud Codec over Lossy Networks

ResPCC:有损网络中具备抗丢包能力的神经点云编解码器

Xueqin Niu, Mufan Liu, Yifan Wang, Le Yang, Jun Sun, Yiling Xu

专题命中 点云 :point cloud(title,abstract)

AI总结 针对有损网络中点云压缩的数据包丢失问题,提出具备感知丢包率能力的ResPCC编解码器,通过CALM、SCI、MGLR、DBR等模块提升稳定性与率失真性能,在5%-30%丢包率下优于基线方法,为3D数据传输提供可靠方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21112 2026-08-13 cs.CV cs.AI cs.RO 版本更新 62%

LiDAR-based 3D Change Detection at City Scale

基于LiDAR的城市级三维变化检测

Hezam Albaqami, Haitian Wang, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * Department of Computer Science and Artificial Intelligence, University of Jeddah(计算机科学与人工智能系,朱德亚大学) Department of Computer Science and Software Engineering, University of Western Australia(计算机科学与软件工程系,西澳大学) Department of Data Science, Umm Al-Qura University(数据科学系,乌姆·阿勒·卡拉大学) Department of Information and Technology Systems, College of Computer Science and Engineering, University of Jeddah(信息与技术系统系,计算机科学与工程学院,朱德亚大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种基于LiDAR的城市级三维变化检测方法,通过多分辨率NDT和ICP对齐数据,结合语义分割和双分匹配优化,实现了高精度的变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12148 2026-08-13 cs.GR 新提交 57%

MVFM-3DAD: Multi-view Flow Matching for 3D Anomaly Detection via Density Proxy Estimation

MVFM-3DAD:基于密度代理估计的三维异常检测多视图流匹配方法

Liangwei Li, Lin Liu, Jing Zhang, Xiaohui Du, Ruqian Hao, Xinwei Li, Hanzhe Liang, Juanxiu Liu

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 该研究针对现有三维异常检测方法的局限性,提出MVFM-3DAD框架,将3DAD转化为密度代理估计,在Real3D-AD等数据集上性能优于竞争方法。

Comments ICIG 2026 oral presentation, 13 pages, 3 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11645 2026-08-13 cs.CV 新提交 57%

Cloak of Invisibility: Real-Time Privacy-Preserving Volumetric Video Streaming

隐形斗篷:实时隐私保护的体视频流

Hossein Khalili, Philip Do, Alexander Vilesov, Kittipat Apicharttrisorn, Nader Sehatbakhsh

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 57%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20338 2026-08-13 physics.comp-ph physics.chem-ph 版本更新 50%

Reconstructing local environments from concise atomistic representations

从简洁的原子表示重建局部环境

Jigyasa Nigam, Tuong Phung, Ameya Daigavane, Aria Mansouri Tehrani, Tess Smidt

专题命中 点云 :point cloud(abstract)

AI总结 研究从不变描述符恢复原子结构的逆问题,利用不同相关阶数的紧凑描述符实现准确重建,提供识别描述符近似简并性及恢复不同原子环境的算法手段,还探究了描述符扰动与结构畸变的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18184 2026-08-13 physics.comp-ph cs.MS cs.NA math.NA math.OC 版本更新 50%

anyakrakusuma: A Python Library for Entropic Schrödinger Bridges on Idealized Geometries

anyakrakusuma:用于理想化几何上熵薛定谔桥的Python库

Dasapta Erwin Irawan, Sandy Hardian Susanto Herho, Agus Wahyu Jatmiko, Sito Fossy Biosa, Candrasa Surya Dharma, Edi Riawan, Astyka Pamumpuni, Rendy Dwi Kartiko, Rusmawan Suwarman, Deny Juanda Puradimaja

专题命中 点云 :point cloud(abstract)

AI总结 anyakrakusuma库用对数域Sinkhorn - Knopp迭代解决离散静态薛定谔桥问题,重建点云间熵插值。经四个理想化平面案例测试,该方法在特定参数下效果良好,残差小,能恢复重新定向,为相关研究提供了有效工具。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2608.12220 2026-08-13 cs.CV cs.AI 新提交 57%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 57%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏