arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-06 至 2026-08-06 共收录 12 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2603.18774 2026-08-06 cs.CV 版本更新 79%

SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for Unpaired RGB+Thermal 3D Reconstruction

SEAR: 一种简单且高效的视觉几何变换器在RGB+热成像3D重建中的适应

Vsevolod Skorokhodov, Chenghao Xu, Shuo Sun, Olga Fink, Malcolm Mielle

机构 * Schindler EPFL Lab(施耐德EPFL实验室) EPFL(瑞士联邦理工学院) Örebro University(奥雷布罗大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 SEAR通过简单高效的微调策略,使预训练的几何变换器适应多模态RGB-热成像输入,显著提升了3D重建和姿态估计性能,尤其在低光照和浓烟等挑战条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29098 2026-08-06 cs.CV 版本更新 74%

Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals

透视箱子:基于雷达信号的非视距三维重建

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

机构 * École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑校区)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 提出统一视距与非视距神经几何重建框架GeRaF 2.0,利用外部视距几何约束引导射频信号传播,实现稳定训练和物理一致的重建,在射频几何重建中达到新最优。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 57%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 3 篇

2608.01659 2026-08-06 cs.CV 版本更新 89%

StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting

StreamSplat:流式前馈三维高斯溅射

Changhao Song, Yuxuan Wang, Qibiao Li, Youcheng Cai, Ligang Liu

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出StreamSplat流式前馈3DGS框架,通过VACC、HPDA、CGFI技术实现长输入流下的高效因果场景更新,在多数据集上的新视角合成质量优于固定视角基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25569 2026-08-06 eess.SP cs.AI cs.CV cs.IT math.IT 版本更新 84%

CORF-GS: Real-Time Wireless Radiance Field Reconstruction via Coupled Optical-RF Gaussian Splatting

CORF-GS:通过耦合光学-射频高斯格点法进行实时无线辐射场重建

Jinya Zhang, Jiajia Guo, Chao-Kai Wen, Shi Jin

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,comments);分类 cs.CV

AI总结 提出CORF-GS实时无线辐射场重建框架,通过处理光学和射频关键帧,构建统一高斯表示,利用光学引导采样和耦合优化,实现了高射频频谱合成质量并大幅减少重建时间。

Comments A collection of paper on 3DGS for Wireless Communications can be found at https://github.com/AI4Wireless/3DGS4Wireless

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04004 2026-08-06 cs.RO 版本更新 83%

Gaussian-LIC2: LiDAR-Inertial-Camera Gaussian Splatting SLAM

Gaussian-LIC2:激光雷达-惯性-相机高斯溅射SLAM

Xiaolei Lang, Jiajun Lv, Kai Tang, Laijian Li, Jianxin Huang, Lina Liu, Yong Liu, Xingxing Zuo

机构 * Institute of Cyber-Systems and Control(控制系统研究所) Zhejiang University(浙江大学) Department of Robotics(机器人系) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈罗德·本·扎耶德人工智能大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.RO

AI总结 本文提出首个兼顾视觉质量、几何精度与实时性的激光雷达-惯性-相机高斯溅射SLAM系统,引入零样本深度补全与CUDA加速策略,构建专用数据集,可实现高质量新视角渲染及下游应用。

Comments Accepted by IJRR

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 2 篇

2606.09123 2026-08-06 cs.CV cs.AI 版本更新 79%

An Enhanced Geometric-Spectral Feature Learning Framework for Airborne Multispectral Point Cloud Classification

一种增强的几何-光谱特征学习框架用于机载多光谱点云分类

Xian Li, Yanfeng, Gu Linghua Xu, Aleksandra Pižurica

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对机载多光谱点云高维异构、样本不平衡和类间光谱相似问题,提出基于注意力的双流特征融合框架,结合残差注意力融合块和联合损失函数,实现高精度地物分类。

Comments Revised V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03891 2026-08-06 math.ST math.AT stat.TH 版本更新 50%

Topological Clustering via Sliced Wasserstien Kernels

基于切片沃尔什斯坦核的拓扑聚类

Vikram Aithal, Ajit Kumar, Ambika Sharma

专题命中 点云 :point cloud(abstract)

AI总结 该研究针对TDA中聚类问题,提出基于各同调SW核凸组合的核k均值算法,在基准及合成数据集上表现优于基线且计算高效,权重可识别具判别性的同调。

Comments 20 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2607.12000 2026-08-06 cs.CV 版本更新 79%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20853 2026-08-06 cs.CV cs.AI cs.LG eess.IV 版本更新 57%

MODEST: Multi-Optics Depth-of-Field Stereo Dataset

MODEST:多光学深度景深立体数据集

Nisarg K. Trivedi, Vinayaka A. Belludi, Li-Yun Wang

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。

Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2506.18266 2026-08-06 cs.CV 版本更新 57%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 1 篇

2604.16954 2026-08-06 cs.CV 版本更新 57%

TSM-Pose: Topology-Aware Learning with Semantic Mamba for Category-Level Object Pose Estimation

TSM-Pose: 基于语义Mamba的拓扑感知学习用于类别级物体姿态估计

Jinshuo Liu, Bingtao Ma, Junlin Su, Guanyuan Pan, Beining Wu, Cheng Yang, Jiaxuan Lu, Chenggang Yan, Shuai Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TSM-Pose框架,通过拓扑提取器和语义Mamba聚合器提升类别级物体姿态估计的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏