arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-21 至 2026-04-21 共收录 42 信号源:cs.CV, cs.GR, cs.RO

1. 点云 13 篇

2604.16546 2026-04-21 cs.CV 79%

A B-Spline Function Based 3D Point Cloud Unwrapping Scheme for 3D Fingerprint Recognition and Identification

基于B样条函数的3D点云解缠方案用于3D指纹识别与鉴定

Mohammad Mogharen Askarin, Jiankun Hu, Min Wang, Xuefei Yin, Xiuping Jia

机构 * School of Systems and Computing, UNSW Canberra(UNSW Canberra 系统与计算学院) Information Systems, University of Canberra(堪培拉大学信息系统系) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院) School of Engineering & Technology, UNSW Canberra(UNSW Canberra 工程与技术学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出基于B样条曲线拟合的3D点云解缠方法,用于3D指纹识别与鉴定,通过减少高度变化和注册限制,提升识别精度和鲁棒性。

Journal ref IEEE Open Journal of the Computer Society 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17949 2026-04-21 cs.CV 57%

ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection

ZSG-IAD:一种用于零样本 grounded 工业异常检测的多模态框架

Qiuhui Chen, Jiaxiang Song, Shuai Tan, Weimin Zhong

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出ZSG-IAD框架,通过多模态数据生成结构化异常报告和像素级掩码,采用语言引导的两跳接地模块和可执行规则GRPO提升可靠性,实现在多个工业异常基准上的强零样本性能和透明解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01032 2026-04-21 cs.CV 57%

Sub-metre Lunar DEM Generation and Validation from Chandrayaan-2 OHRC Multi-View Imagery Using an Open-Source Pipeline

基于Chandrayaan-2 OHRC多视角影像的亚米级月球数字高程模型生成与验证:一种开源流程

Aaranay Aadi, Jai Singla, Nitant Dube, Oleg Alexandrov

机构 * School of Computer Science and Engineering Manipal University(曼海姆大学计算机科学与工程学院) Space Applications Centre (SAC) Indian Space Research Organisation (ISRO)(空间应用中心(SAC)印度空间研究组织(ISRO)) Intelligent Robotics Group NASA Ames Research Center(智能机器人小组美国国家航空航天局阿姆斯研究中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文首次利用开源流程从Chandrayaan-2 OHRC多视角影像生成亚米级月球DEM,通过几何分析和三角测量生成点云并验证其精度,达到亚米级分辨率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 57%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16848 2026-04-21 cs.CV cs.AI 57%

TowerDataset: A Heterogeneous Benchmark for Transmission Corridor Segmentation with a Global-Local Fusion Framework

TowerDataset:一种异构基准,用于传输走廊分割的全局-局部融合框架

Xu Cui, Xinyan Liu, Chen Yang, Zhaobo Qi, Beichen Zang, Weigang Zhang, Antoni B. Chan

机构 * Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)) University of the Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TowerDataset异构基准,包含661个真实场景和24亿点,通过全局-局部融合框架提升传输走廊分割性能,实验验证了其在复杂场景中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16696 2026-04-21 cs.CV cs.AI eess.IV 57%

LOD-Net: Locality-Aware 3D Object Detection Using Multi-Scale Transformer Network

LOD-Net:基于多尺度变换网络的局部感知3D目标检测

Mustaqeem Khan, Aidana Nurakhmetova, Wail Gueaieb, Abdulmotaleb El Saddik

机构 * College of Information Technology-United Arab Emirates University (UAEU)(阿联酋大学信息科技学院) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出一种结合多尺度注意力机制的3DETR架构,通过上采样生成高分辨率特征图,提升小尺寸和语义相关目标的检测性能,在ScanNetv2数据集上实现mAP@25和mAP@50的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18021 2026-04-21 eess.SP 50%

Paradigm Shift from Statistical Channel Modeling to Digital Twin Prediction: An Environment-Generalizable ChannelLM for 6G AI-enabled Air Interface

从统计信道建模到数字孪生预测的范式转变:一种适用于6G AI赋能空气接口的环境通用化信道LM

Yichen Cai, Yuelong Qiu, Jianhua Zhang, Li Yu, Yuxiang Zhang, Zhen Zhang, Guangyi Liu

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种环境通用化的信道LM驱动的数字孪生架构,通过动态物体检测和多模态对齐实现高精度环境重建,结合物理可解释的特征提取和信道LM核心,实现多任务信道预测,实验表明在未见过的环境中,信道状态信息预测误差降低4.23 dB,端到端推理延迟仅70毫秒。

Comments 16 pages, 12 figures, Submitted to Nature Partner Journals Wireless Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 1 篇

2506.09885 2026-04-21 cs.CV 84%

The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge

你依赖得越少,学到的越多:从稀疏、未定位图像中合成新视角的方法,仅需最小的3D知识

Haoru Wang, Kai Ye, Minghan Qin, Yangyan Li, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) ByteDance Seed(字节跳动种子) Ant Group(蚂蚁集团) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 新视角合成 :NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 本文探讨了在数据量增加时,依赖较少3D知识的方法性能提升更快的现象,提出了一种无需显式场景结构和姿态标注的端到端NVS框架,实现了更高效的视角合成。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 空间理解 2 篇

2603.28178 2026-04-21 cs.CV 57%

ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining

ToLL: 基于非对称跨视图结构蒸馏的拓扑布局学习用于3D场景图生成预训练

Yucheng Huang, Luping Ji, Xiangwei Jiang, Wen Li, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出ToLL框架,通过拓扑几何推理和结构多视图增强,解决3D场景图生成预训练中的几何捷径问题,提升场景图生成质量。

Comments Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 57%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. SLAM与定位 2 篇

2511.16857 2026-04-21 cs.CV cs.RO 62%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 SLAM与定位 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17422 2026-04-21 cs.CV 57%

DeepDetect: Learning All-in-One Dense Keypoints

DeepDetect: 一种统一的密集关键点检测器

Shaharyar Ahmed Khan Tareen, Filza Khan Tareen, Xiaojing Yuan

机构 * University of Houston(休斯顿大学) National University of Sciences and Technology(国家 sciences and Technology大学)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV

AI总结 DeepDetect结合传统检测器与深度学习,通过融合多检测器输出生成真实标签,训练高效模型生成高密度关键点,提升在复杂场景下的性能。

Comments 8 pages, 8 figures, 3 tables, 6 equations

详情

展开后加载摘要…

URL PDF HTML 收藏