arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-06 至 2026-08-06 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2603.18774 2026-08-06 cs.CV 版本更新 79%

SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for Unpaired RGB+Thermal 3D Reconstruction

SEAR: 一种简单且高效的视觉几何变换器在RGB+热成像3D重建中的适应

Vsevolod Skorokhodov, Chenghao Xu, Shuo Sun, Olga Fink, Malcolm Mielle

机构 * Schindler EPFL Lab(施耐德EPFL实验室) EPFL(瑞士联邦理工学院) Örebro University(奥雷布罗大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 SEAR通过简单高效的微调策略,使预训练的几何变换器适应多模态RGB-热成像输入,显著提升了3D重建和姿态估计性能,尤其在低光照和浓烟等挑战条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29098 2026-08-06 cs.CV 版本更新 74%

Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals

透视箱子:基于雷达信号的非视距三维重建

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

机构 * École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑校区)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 提出统一视距与非视距神经几何重建框架GeRaF 2.0,利用外部视距几何约束引导射频信号传播,实现稳定训练和物理一致的重建,在射频几何重建中达到新最优。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05066 2026-08-06 cs.CV 新提交 57%

Beyond Reprojection Error: Camera Calibration with 3D Targets

超越重投影误差:基于3D靶标的相机标定

Dennis Ruppel, Hasan Kutlu, Kai A. Neumann, Martin Knuth, Pedro Santos, Andreas Weinmann, Arjan Kuijper

机构 * Fraunhofer Institute for Computer Graphics Research(弗劳恩霍夫计算机图形研究所) Technical University of Applied Sciences Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学) Technical University Darmstadt(达姆施塔特工业大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本研究针对三维重建提出基于场景射线预测的相机标定框架,采用重建与相交误差等指标,设计二十面体标定靶标,提升了标定精度,发现重投影误差可能误导三维精度评估。

Comments 16 pages, 7 figures, 2 tables. To appear in the proceedings of Computer Graphics International (CGI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04210 2026-08-06 cs.CV 新提交 57%

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

PADFormer:基于稀疏视角图像的姿态无关异常检测

Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

机构 * Amazon(亚马逊) Simon Fraser University(西蒙菲莎大学) Northeastern University(东北大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对现有姿态无关异常检测方法依赖3D重建的缺陷,提出PADFormer模型,利用ViT结合跨视图掩码重建等机制,在PAD基准及FSAD任务上实现最优性能,兼具效率与泛化性。

Comments Accepted to ECCV 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 57%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 57%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 8 篇

2608.04701 2026-08-06 cs.CV 新提交 89%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 Gaussian Splatting :NeRF(abstract,abstract_cn);Gaussian Splatting(abstract,abstract_cn);3DGS(abstract,abstract_cn);point cloud(abstract)

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01659 2026-08-06 cs.CV 版本更新 89%

StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting

StreamSplat:流式前馈三维高斯溅射

Changhao Song, Yuxuan Wang, Qibiao Li, Youcheng Cai, Ligang Liu

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出StreamSplat流式前馈3DGS框架,通过VACC、HPDA、CGFI技术实现长输入流下的高效因果场景更新,在多数据集上的新视角合成质量优于固定视角基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04842 2026-08-06 cs.RO cs.GR 新提交 85%

RORA: Realistic Object Reconstruction with Articulation

RORA:带关节运动的真实物体重建

Hyesung Lee, Youngseon Lee, Kyutae Lee, Dongjun Lee, Yongseok Lee

机构 * Seoul National University(首尔大学) DGIST(大邱庆北科学技术院)

专题命中 Gaussian Splatting :NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.GR、cs.RO

AI总结 本研究提出RORA端到端管线,可从单个静态物体视频输入重建带精确关节运动的仿真就绪资产,在PartNet-Mobility-V0数据集和真实物体上取得良好效果,可用于机器人学习的实时灵巧手操作任务。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04560 2026-08-06 cs.CV cs.GR 新提交 84%

OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes

OutLangSplat:面向无人机室外场景的三维语言高斯溅射

Xia Yan, He Wu, Yanghui Xu, Zizhao Wu, Jiazhou Chen

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.GR

AI总结 OutLangSplat改进特征表示与聚合策略,构建首个无人机室外开放词汇3D场景理解数据集,在开放词汇语义分割与实例定位任务上优于SOTA方法。

Comments 9 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25569 2026-08-06 eess.SP cs.AI cs.CV cs.IT math.IT 版本更新 84%

CORF-GS: Real-Time Wireless Radiance Field Reconstruction via Coupled Optical-RF Gaussian Splatting

CORF-GS:通过耦合光学-射频高斯格点法进行实时无线辐射场重建

Jinya Zhang, Jiajia Guo, Chao-Kai Wen, Shi Jin

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,comments);分类 cs.CV

AI总结 提出CORF-GS实时无线辐射场重建框架,通过处理光学和射频关键帧,构建统一高斯表示,利用光学引导采样和耦合优化,实现了高射频频谱合成质量并大幅减少重建时间。

Comments A collection of paper on 3DGS for Wireless Communications can be found at https://github.com/AI4Wireless/3DGS4Wireless

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04004 2026-08-06 cs.RO 版本更新 83%

Gaussian-LIC2: LiDAR-Inertial-Camera Gaussian Splatting SLAM

Gaussian-LIC2:激光雷达-惯性-相机高斯溅射SLAM

Xiaolei Lang, Jiajun Lv, Kai Tang, Laijian Li, Jianxin Huang, Lina Liu, Yong Liu, Xingxing Zuo

机构 * Institute of Cyber-Systems and Control(控制系统研究所) Zhejiang University(浙江大学) Department of Robotics(机器人系) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈罗德·本·扎耶德人工智能大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.RO

AI总结 本文提出首个兼顾视觉质量、几何精度与实时性的激光雷达-惯性-相机高斯溅射SLAM系统,引入零样本深度补全与CUDA加速策略,构建专用数据集,可实现高质量新视角渲染及下游应用。

Comments Accepted by IJRR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04475 2026-08-06 cs.HC 新提交 82%

Super-Gaussian: Interactive Scene Editing for 3D Gaussian Splatting and NLI-Based Volume Visualization in Virtual Reality

超高斯:虚拟现实中面向三维高斯溅射与基于自然语言交互的体可视化的交互式场景编辑

Suemin Jeon, Kaiyuan Tang, Chaoli Wang, Won-Ki Jeong

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 本研究针对VR中体可视化的渲染成本与交互问题,提出Super-Gaussian框架,结合三维高斯溅射、特征感知聚类、分层选择-细化工作流与NLI,实现高效直观的体数据交互编辑与分析

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04581 2026-08-06 cs.CV 新提交 79%

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields

ACA-GS:用于紧凑动态辐射场的自适应容量锚定高斯溅射

Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko

机构 * Sungkyunkwan University(成均馆大学) Electronics and Telecommunications Research Institute(电子通信研究院) Yonsei University(延世大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 针对4D高斯溅射中运动表达与存储效率的权衡,提出自适应容量锚定高斯溅射框架,通过调整锚点的神经高斯数量和特征通道实现紧凑动态辐射场,在多数据集上显著压缩存储且不降低质量。

Comments 9 pages, 8 figures. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2606.09123 2026-08-06 cs.CV cs.AI 版本更新 79%

An Enhanced Geometric-Spectral Feature Learning Framework for Airborne Multispectral Point Cloud Classification

一种增强的几何-光谱特征学习框架用于机载多光谱点云分类

Xian Li, Yanfeng, Gu Linghua Xu, Aleksandra Pižurica

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对机载多光谱点云高维异构、样本不平衡和类间光谱相似问题,提出基于注意力的双流特征融合框架,结合残差注意力融合块和联合损失函数,实现高精度地物分类。

Comments Revised V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 70%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 点云 :3D vision(abstract);point cloud(abstract);分类 cs.RO

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03891 2026-08-06 math.ST math.AT stat.TH 版本更新 50%

Topological Clustering via Sliced Wasserstien Kernels

基于切片沃尔什斯坦核的拓扑聚类

Vikram Aithal, Ajit Kumar, Ambika Sharma

专题命中 点云 :point cloud(abstract)

AI总结 该研究针对TDA中聚类问题,提出基于各同调SW核凸组合的核k均值算法,在基准及合成数据集上表现优于基线且计算高效,权重可识别具判别性的同调。

Comments 20 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2607.12000 2026-08-06 cs.CV 版本更新 79%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20853 2026-08-06 cs.CV cs.AI cs.LG eess.IV 版本更新 57%

MODEST: Multi-Optics Depth-of-Field Stereo Dataset

MODEST:多光学深度景深立体数据集

Nisarg K. Trivedi, Vinayaka A. Belludi, Li-Yun Wang

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。

Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2608.04610 2026-08-06 cs.CV 新提交 57%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18266 2026-08-06 cs.CV 版本更新 57%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 1 篇

2604.16954 2026-08-06 cs.CV 版本更新 57%

TSM-Pose: Topology-Aware Learning with Semantic Mamba for Category-Level Object Pose Estimation

TSM-Pose: 基于语义Mamba的拓扑感知学习用于类别级物体姿态估计

Jinshuo Liu, Bingtao Ma, Junlin Su, Guanyuan Pan, Beining Wu, Cheng Yang, Jiaxuan Lu, Chenggang Yan, Shuai Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TSM-Pose框架,通过拓扑提取器和语义Mamba聚合器提升类别级物体姿态估计的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏