arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-29 至 2026-04-29 共收录 20 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2604.19133 2026-04-29 cs.CV 85%

BALTIC: A Benchmark and Cross-Domain Strategy for 3D Reconstruction Across Air and Underwater Domains Under Varying Illumination

BALTIC:跨空气和水域的3D重建基准与跨域策略

Michele Grimaldi, David Nakath, Oscar Pizarro, Jonatan Scharff Willners, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞瓦德大学工程与物理科学学院) Marine Data Science Group, Christian Albrechts University of Kiel(基尔大学海洋数据科学组) Frontier Robotics, The National Robotarium(前沿机器人,国家机器人中心)

专题命中 三维重建 :3D reconstruction(title,abstract);Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出BALTIC基准,通过不同介质和光照条件下的多样化数据集评估3D重建方法,结合COLMAP和神经辐射场方法验证跨域重建性能,发现简单预处理的高斯点云在纹理一致条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11349 2026-04-29 cs.CV cs.AI cs.GR 62%

Representation Paradigms in AI-based 3D Radiological Image Reconstruction: A Systematic Review

基于人工智能的3D放射学图像重建的表示范式:系统综述

Yuezhe Yang, Lei Bi, Boyu Yang, Yaqian Wang, Yang He, Yige Peng, Zhe Jin, Xingbo Dong, Jinman Kim

机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据与可视化实验室,计算机科学学院) Anhui Provincial International Joint Research Center for Advanced Technology in Medical Imaging, School of Artificial Intelligence(安徽省国际联合先进医学影像技术研究中心,人工智能学院) Institute of Translational Medicine, Shanghai Jiao Tong University(转化医学研究院,上海交通大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了基于人工智能的3D放射学图像重建算法,按重建目标参数化方式分为四类表示方法,并讨论了当前发展、挑战及未来方向。

Comments 58 pages, Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 8 篇

2604.25330 2026-04-29 eess.IV 89%

Generalizable 3D Gaussian Splatting enabled Semantic Coding for Real-Time Immersive Video Communications

可泛化3D高斯点云实现语义编码的实时沉浸式视频通信

Dingxi Yang, Wenqi Guo, Yue Liu, Jungong Han, Zhijin Qin

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);3D reconstruction(abstract)

AI总结 本文提出GS-SCNet框架,整合可泛化的3DGS重建与专用深度语义编码流水线,提升压缩效率与实时性能,实现跨域泛化和抗压缩伪影。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09923 2026-04-29 cs.CV 87%

Splatent: Splatting Diffusion Latents for Novel View Synthesis

Splatent: 基于扩散模型的潜在空间光场表示用于新视角合成

Or Hirschorn, Omer Sela, Inbar Huberman-Spiegelglas, Netalee Efrat, Eli Alshan, Ianir Ideses, Frederic Devernay, Yochai Zvik, Lior Fritz

机构 * Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 Gaussian Splatting :novel view synthesis(title);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);3D reconstruction(abstract)

AI总结 Splatent通过多视图注意力机制在2D中恢复细节,提升VAE潜在空间光场重建质量,实现高精度稀疏视角3D重建。

Comments CVPR 2026. Project's webpage at https://orhir.github.io/Splatent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22339 2026-04-29 cs.CV 85%

Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM

Flow4DGS-SLAM:基于光流的4D高斯点划法SLAM

Yunsong Wang, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出基于光流的4D高斯点划法SLAM框架,通过光流引导实现动态环境的高效重建与姿态估计,结合时间一致性模型提升训练效率和动态重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25466 2026-04-29 cs.CV 79%

Generalizable Human Gaussian Splatting via Multi-view Semantic Consistency

基于多视角语义一致性的通用人体高斯点云生成

Jingi Kim, Wonjun Kim

机构 * Konkuk University(韩国 Konkuk 大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出基于多视角语义一致性的方法,通过预测深度图和跨视角注意力机制,解决多视角输入下人体3D高斯点云定位不一致问题,提升渲染质量。

Comments 10 pages, 8 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22793 2026-04-29 cs.LG 78%

GSpaRC: Gaussian Splatting for Real-time Reconstruction of RF Channels

GSpaRC:高斯点云用于射频信道的实时重建

Bhavya Sai Nukapotula, Rishabh Tripathi, Seth Pregler, Dileep Kalathil, Srinivas Shakkottai, Theodore S. Rappaport

机构 * Texas A&M University(德克萨斯A&M大学) New York University(纽约大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 GSpaRC通过高斯点云技术实现射频信道的高精度实时重建,显著降低训练和推理时间,适用于5G及未来无线系统。

Comments Project website: https://nbhavyasai.github.io/GSpaRC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24994 2026-04-29 cs.GR cs.CV 73%

Power Foam: Unifying Real-Time Differentiable Ray Tracing and Rasterization

功率泡沫:统一实时可微射线追踪与光栅化

Shrisudhan Govindarajan, Daniel Rebain, Dor Verbin, Kwang Moo Yi, Anish Prabhu, Andrea Tagliasacchi

机构 * Simon Fraser University(西蒙弗雷泽大学) University of British Columbia(不列颠哥伦比亚大学) Google Deepmind(谷歌DeepMind) Google(谷歌) University of Toronto(多伦多大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出一种可微3D表示,结合泡沫射线追踪能力与现代光栅化管线效率,通过可控的功率图实现空间有界原始体,提升实时可微渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04021 2026-04-29 cs.CV 70%

C3G: Learning Compact 3D Representations with 2K Gaussians

C3G:通过2K高斯学习紧凑的3D表示

Honggyu An, Jaewoo Jung, Mungyeom Kim, Chaehyun Kim, Minkyeong Jeon, Jisang Han, Kazumi Fukuda, Takuya Narihira, Hyuna Ko, Junsu Kim, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国成均馆大学人工智能研究所) ETH AI Center, ETH Zürich(苏黎世联邦理工学院人工智能中心) SONY AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出C3G框架,通过学习可训练标记聚合多视图特征,生成紧凑且几何意义明确的3D高斯表示,提升场景重建与理解的效率和精度。

Comments Project Page : https://cvlab-kaist.github.io/C3G/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25695 2026-04-29 cs.CG 67%

Point Group Symmetry of Polyhedral Diagrams in Graphic Statics

多面体图在图形静力学中的点群对称性

Yefan Zhi, Yao Lu, Masoud Akbarzadeh

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn)

AI总结 本文研究多面体图在三维图形静力学中的对称性,通过点群约束保持对称性,提出基于边长的对称性约束方法,提升设计效率与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 7 篇

2604.25405 2026-04-29 cs.CV cs.RO 81%

Leveraging Previous-Traversal Point Cloud Map Priors for Camera-Based 3D Object Detection and Tracking

利用先前遍历点云地图先验进行基于摄像头的3D物体检测与跟踪

Markus Käppeler, Özgün Çiçek, Yakov Miron, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) Bosch Research, Robert Bosch GmbH(博世研究)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出DualViewMapDet框架,通过在线检索先前遍历生成的点云地图先验,提升无LiDAR情况下基于摄像头的3D物体检测与跟踪性能,通过双空间融合策略增强特征表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23069 2026-04-29 cs.CV 57%

Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception

对齐后再适应:重新思考4D感知中的参数高效迁移学习

Yiding Sun, Jihua Zhu, Haozhe Cheng, Chaoyi Lu, Zhichuan Yang, Lin Chen, Yaonan Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室) School of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院) National Engineering Research Center for Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出PointATA方法,通过分阶段对齐和适应解决4D感知中的模态差距和过拟合问题,实现参数高效迁移学习,实验显示其在动作识别、分割等任务中表现优异。

Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10210 2026-04-29 cs.CV 57%

TARS: Traffic-Aware Radar Scene Flow Estimation

TARS:面向交通的雷达场景流估计

Jialong Wu, Marco Braun, Dominic Spata, Matthias Rottmann

机构 * University of Wuppertal(乌尔姆大学) Osnabrück University(奥斯纳布吕克大学) Aptiv Services Deutschland GmbH(Aptiv Services德国公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TARS方法,通过交通层面的运动刚性提升雷达场景流估计,结合目标检测与场景流联合优化,构建交通向量场以实现交通层面的场景理解。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 26075-26084

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07269 2026-04-29 cs.CV cs.LG 57%

A graph generation pipeline for critical infrastructures based on heuristics, images and depth data

基于启发式、图像和深度数据的临界基础设施图生成管道

Mike Diessner, Yannick E. Tarant

机构 * German Aerospace Center (DLR) Institute for the Protection of Terrestrial Infrastructure(德国航空航天中心(DLR)地面基础设施保护研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出基于光束摄影的图生成管道,利用RGB图像和立体相机深度数据,通过深度学习和用户定义的启发式规则生成临界基础设施的图结构,验证了其在水力系统中的有效性。

Journal ref Front. Signal Process. 6:1761293 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25885 2026-04-29 hep-ph cs.LG hep-ex 50%

Explainable AI for Jet Tagging: A Comparative Study of GNNExplainer, GNNShap, and GradCAM for Jet Tagging in the Lund Jet Plane

可解释的AI用于喷注标记:GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的比较研究

Pahal D. Patel, Sanmay Ganguly

机构 * Department of Physics, Indian Institute of Technology, Kanpur Uttar-Pradesh-208016, India(印度理工学院坎浦尔分校物理系)

专题命中 点云 :point cloud(abstract)

AI总结 本文比较了GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的性能,通过蒙特卡洛真实解释掩码和物理指导评估框架,揭示了非微扰与微扰区域的解释质量变化,并量化了解释器分配的节点重要性与经典喷注子结构观测量的相关性。

Comments 25 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25666 2026-04-29 physics.optics 50%

Intensity-guided pose-free multiview fusion for single photon sensing

基于强度的无姿态多视角融合单光子传感

Jinyi Liu, Lijun Liu, Shuming Cheng, Xiaomin Hu, Yiguang Hong, Weiping Zhang

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种无姿态多视角融合框架,通过结合物理感知预处理、几何-强度网格特征聚合、全局匹配和局部歧义消除,实现单光子传感的多视角配准,提升了在极端环境下的点云重建一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25160 2026-04-29 physics.optics 50%

Target-depth sensing with metasurface-encoder integrated optoelectronic neural network

基于元表面编码器的光学电子神经网络深度传感

Shuo Wang, Deyu Zhu, Chenjie Xiong, Bin Hu, Chunqi Jin, Yu Wang, Chengjun Zou

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种集成元表面编码器的光学电子神经网络,通过双螺旋点扩散函数将3D信息压缩为2D图像,利用轻量级阴影ResNet网络实现目标分类和深度估计,实现实时目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2511.07743 2026-04-29 cs.CV cs.AI 88%

UltraGS: Real-Time Physically-Decoupled Gaussian Splatting for Ultrasound Novel View Synthesis

UltraGS:实时物理解耦高斯点扩散用于超声新视角合成

Yuezhe Yang, Qingqing Ruan, Wenjie Cai, Yudang Dong, Dexin Yang, Xingbo Dong, Zhe Jin, Yong Dai

机构 * 2 Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, Shanghai, China 3 School of Medicine, Nankai University, Tianjin, China 4 School of Medicine, Anhui University of Science \& Technology, Huainan, China

专题命中 新视角合成 :Gaussian Splatting(title,abstract);novel view synthesis(title,abstract);分类 cs.CV

AI总结 UltraGS通过结合显式辐射场与轻量物理启发声学模型,实现了实时无传感器超声新视角合成,提升了几何一致性并达到新的性能效率前沿。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2512.17492 2026-04-29 cs.CV 79%

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 62%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏