arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-28 至 2026-05-28 共收录 16 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2605.28125 2026-05-28 cs.CV cs.GR 93%

CLEAR-NeRF: Collinearity and Local-region Enhanced Accurate 3D Reconstruction in Unbounded Scenes

CLEAR-NeRF: 共线性和局部区域增强的无界场景精确三维重建

Vladislav Polianskii, Elijs Dima, Isabel Salmerón Marazuela, Gergő László Nagy, Sigurdur Sverrisson, Volodya Grancharov

机构 * Ericsson Research(爱立信研究)

专题命中 三维重建 :NeRF(title,title_cn);3D reconstruction(title,abstract);分类 cs.CV、cs.GR

AI总结 提出CLEAR-NeRF方法,通过自动局部区域定位、共线性射线采样、深度局部邻域点提取和几何相关颜色聚合,在无界复杂场景中实现高保真度和度量精度的三维重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28431 2026-05-28 eess.SP 67%

A Unified Maximum-Likelihood Framework for 3D InISAR Phase Unwrapping with Outlier Rejection

一种用于3D InISAR相位解缠的统一最大似然框架及异常值剔除

Matteo Pardi, Francesco Mancuso, Elisa Giusti, Marco Martorella

专题命中 三维重建 :3D reconstruction(abstract);point cloud(abstract)

AI总结 提出一种基于混合整数最小二乘理论的统一最大似然框架,用于3D InISAR相位解缠,无需空间连续性假设,并自然生成后验质量度量以剔除异常值。

Comments 6 pages, 4 figures. Accepted for publication in the Proceedings of the 2026 IEEE Radar Conference (RadarConf26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26368 2026-05-28 cs.CV cs.AI 57%

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

统一全景几何估计:基于多视角基础模型

Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出PaGeR框架,利用预训练3D基础模型,从单张全景图像中统一预测尺度不变深度、度量深度、表面法线和天空掩码,实现360度场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13177 2026-05-28 cs.RO 57%

ROOM: A Physics-Based Continuum Robot Simulator for Photorealistic Medical Datasets Generation

ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集

Salvatore Esposito, Matías Mattamala, Daniel Rebain, Francis Xiatian Zhang, Kevin Dhaliwal, Mohsen Khadem, Subramanian Ramamoorthy

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2501.04144 2026-05-28 cs.CV cs.GR 79%

Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation

Chirpy3D: 面向创意细粒度物体生成的部件感知多视角扩散

Kam Woh Ng, Jing Yang, Jia Wei Sii, Chee Seng Chan, Jiankang Deng, Yi-Zhe Song, Tao Xiang, Xiatian Zhu

机构 * University of Surrey(萨里大学) University of Cambridge(剑桥大学) Universiti Malaya(马来亚大学) Imperial College London(伦敦帝国学院)

专题命中 NeRF :NeRF(abstract,abstract_cn);3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出Chirpy3D,一种部件感知多视角扩散框架,从无姿态2D图像中学习层次化部件潜在空间,实现部件级交换、插值和零样本组合,无需3D数据或手动标注。

Comments 20 pages. Code at https://github.com/kamwoh/chirpy3d

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 4 篇

2601.17354 2026-05-28 cs.CV cs.GR 86%

PocketGS: On-Device Training of 3D Gaussian Splatting for High Perceptual Modeling

PocketGS: 用于高感知建模的3D高斯泼溅设备端训练

Wenzhi Guo, Guangchi Fang, Shu Yang, Bing Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 提出PocketGS,通过三个协同设计的算子(G、I、T)在移动设备上实现3D高斯泼溅的高效训练,在严格资源约束下保持高保真重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20150 2026-05-28 cs.CV cs.PF 85%

TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization

TideGS: 通过外存优化训练超过十亿个3D高斯溅射基元

Chonghao Zhong, Linfeng Shi, Hua Chen, Tiecheng Sun, Hao Zhao, Binhang Yuan, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 针对大规模3D高斯溅射训练的内存瓶颈,提出TideGS外存训练框架,通过SSD-CPU-GPU层次化管理和三种协同技术,在单GPU上实现超过十亿高斯基元的训练并达到最优重建质量。

Comments Accepted to ICML 2026 as Spotlight. Website: https://sponge-lab.github.io/TideGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28237 2026-05-28 cs.RO cs.CV 79%

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

POINav: 在真实世界视觉语言导航中基准测试与增强最终米级到达

Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao, Mingchao Sun, Yanfen Shen, Zedong Chu, Zhining Gu, Wei Guo, Xiaolong Cheng, Qiming Li, Kangning Niu, Yanqing Zhu, Xiaolong Wu, Tianlun Li, Mu Xu

机构 * Amap CV Lab, Alibaba Group(阿里集团阿里的Amap视觉实验室)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 针对真实世界POI导航的“最后几米”挑战,提出首个闭环评估基准POINav-Bench,并设计脑-动作框架结合70K真实标志-入口数据对,实现高保真度导航。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12875 2026-05-28 eess.IV 75%

3D Gaussian Adaptive Reconstruction for Fourier Light-Field Microscopy

傅里叶光场显微镜的三维高斯自适应重建

Chenyu Xu, Zhouyu Jin, Chengkang Shen, Hao Zhu, Zhan Ma, Bo Xiong, You Zhou, Xun Cao, Ning Gu

专题命中 Gaussian Splatting :NeRF(abstract,abstract_cn);Gaussian Splatting(abstract)

AI总结 针对傅里叶光场显微镜重建中轴向分辨率差和信号退化问题,提出基于三维高斯溅射的自监督学习框架3DGAT,在保持计算效率的同时显著提升体积重建质量。

Journal ref Advanced Imaging 2, 055001 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 3 篇

2504.04540 2026-05-28 cs.CV cs.AI 79%

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28270 2026-05-28 cs.CV 57%

Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects

Every9D-21M:日常物体的大规模真实世界9D规范化

Leonhard Sommer, Emil Akopyan, Adam Kortylewski

机构 * University of Freiburg(弗赖堡大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨研究中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对真实世界9D姿态数据缺乏的问题,提出包含2180万张图像、700类物体的Every9D-21M数据集,通过多视图几何重建点云并跨实例对齐实现大规模标注,验证了其在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28075 2026-05-28 cs.LG 50%

Measure-to-measure Regression with Transformers

基于Transformer的测度到测度回归

Matthew Vandergrift, Martha White, Yury Polyanskiy, Philippe Rigollet, Lazar Atanackovic

机构 * University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) MIT(麻省理工学院) The Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

专题命中 点云 :point cloud(abstract)

AI总结 针对概率测度之间的映射学习问题,提出利用Transformer的测度依赖和平均场结构,实现静态和动态两种非线性测度到测度回归方法,并在合成实验、粒子系统和癌症治疗反应预测中验证其泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2508.13544 2026-05-28 cs.CV cs.AI 57%

FLAIR: Frequency- and Locality-Aware Implicit Neural Representations

FLAIR: 频率与位置感知的隐式神经表示

Sukhun Ko, Seokhyun Youn, Dahyeon Kye, Kyle Min, Chanho Eom, Jihyong Oh

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 针对隐式神经表示缺乏频率选择性和空间定位导致频谱偏差的问题,提出带限局部激活和小波能量引导编码,提升2D图像表示、3D形状重建和新视角合成性能。

Comments CVPR Findings 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FLAIR/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 3D生成 1 篇

2603.05425 2026-05-28 cs.CV cs.AI 79%

RelaxFlow: Text-Driven Amodal 3D Generation

RelaxFlow: 文本驱动的非模态3D生成

Jiayin Zhu, Guoji Fu, Xiaolu Liu, Qiyuan He, Yicong Li, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 针对遮挡下图像到3D生成的语义歧义问题,提出无训练的双分支框架RelaxFlow,通过多先验共识模块和松弛机制解耦控制粒度,实现文本提示引导下对未观察区域的补全,同时严格保留输入观测。

Comments Accepted as a spotlight presentation at ICML 2026. Code: https://github.com/viridityzhu/RelaxFlow

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 空间理解 2 篇

2605.28229 2026-05-28 cs.CV cs.AI 57%

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

VidPrism: 用于图像到视频迁移的异构混合专家模型

Rui Lin, Chuanming Wang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出VidPrism,一种异构时间混合专家框架,通过功能专业化专家、内容感知多速率采样和动态双向融合机制,解决传统MoE中专家同质化问题,在视频识别基准上达到最先进性能。

Comments CVPR2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03048 2026-05-28 cs.CV cs.AI cs.CC 57%

On the Intrinsic Limits of Transformer Image Embeddings in Non-Solvable Spatial Reasoning

关于Transformer图像嵌入在非可解空间推理中的内在限制

Siyi Lyu, Quan Liu, Feng Yan

机构 * School of Electronic Science and Engineering, Nanjing University, Nanjing, China(电子科学与工程学院,南京大学,南京,中国)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文通过将空间理解形式化为群同态问题,证明恒定深度Transformer由于TC⁰复杂度限制,无法在单次前向传播中捕获非可解群(如SO(3))的空间结构。

详情

展开后加载摘要…

URL PDF HTML 收藏