arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-17 至 2026-03-17 共收录 61 信号源:cs.CV, cs.GR, cs.RO

1. 点云 25 篇

2509.11453 2026-03-17 cs.CV cs.AI cs.RO 81%

Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking

超越帧级跟踪:一种基于轨迹的高效点云跟踪范式

BaiChen Fan, Yuanxi Cui, Jian Li, Qin Wang, Shibo Zhao, Muqing Cao, Sifan Zhou

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。

Comments Acceptted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15410 2026-03-17 cs.RO 79%

End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset

从单视角点云通过多物体场景数据集实现端到端的灵巧抓取学习

Tao Geng, Dapeng Yang, Ziwei Liu, Le Zhang, Le Qi, WangYang Li, Yi Ren, Shan Luo, Fenglei Ni

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.RO

AI总结 本文提出DGS-Net,通过多物体场景的单视角点云学习密集抓取配置,改进了现有抓取数据集的局限性,实验显示其在仿真和真实机器人平台上的抓取成功率较高,且具有较低的穿透深度。

Comments 10 pages, 6 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03726 2026-03-17 cs.CV 79%

QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment

QD-PCQA: 为点云质量评估的质量感知领域适应

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出QD-PCQA框架,通过Rank-weighted Conditional Alignment和Quality-guided Feature Augmentation策略提升点云质量评估的泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24133 2026-03-17 cs.CV 79%

FocusTrack: One-Stage Focus-and-Suppress Framework for 3D Point Cloud Object Tracking

FocusTrack: 一种用于3D点云目标跟踪的一阶段聚焦与抑制框架

Sifan Zhou, Jiahao Nie, Ziyu Zhao, Yichao Cao, Xiaobo Lu

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 FocusTrack通过IMM和Focus-and-Suppress Attention实现运动-语义联合建模,以一阶段框架在KITTI等基准上达到SOTA性能并实现105 FPS高帧率。

Comments Acceptted in ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.02543 2026-03-17 cs.CV cs.AI math.OC 79%

Unsupervised Point Cloud Pre-Training via Contrasting and Clustering

通过对比和聚类进行无监督点云预训练

Guofeng Mei, Xiaoshui Huang, Juan Liu, Jian Zhang, Qiang Wu

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出ConClu框架,结合对比和聚类方法,提升点云预训练效果,在多个下游任务中优于现有方法。

Comments ICIP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13791 2026-03-17 cs.LG 78%

Multi-Type Point Cloud Autoencoder: A Complete Equivariant Embedding for Molecule Conformation and Pose

多类型点云自编码器:分子构型和姿态的完整等价嵌入

Michael Kilgour, Mark Tuckerman, Jutta Rogal

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出Mo3ENet,一种用于多类型点云的自编码器,通过新的重构损失实现输入点云的旋转等价嵌入,适用于分子构型和姿态预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13560 2026-03-17 eess.SP cs.LG 78%

Task-Oriented Wireless Transmission of 3D Point Clouds: Geometric Versus Semantic Robustness

面向任务的无线3D点云传输:几何鲁棒性与语义鲁棒性

Vukan Ninkovic, Tamara Sobot, Vladimir Vincan, Gorana Gojic, Dragisa Miskovic, Dejan Vukobratovic

机构 * Serbian Ministry of Science, Technological Development and Innovation(塞尔维亚科学技术发展与创新部) National Key Research & Development Program of China(中国国家重点研发计划)

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出面向任务的无线3D点云传输框架,研究几何重建精度与语义鲁棒性在信道干扰下的关系,揭示任务执行无需高精度几何重建的结论。

Comments Submitted to Global 6G Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 74%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21667 2026-03-17 cs.CV 74%

Send Less, Perceive More: Masked Quantized Point Cloud Communication for Loss-Tolerant Collaborative Perception

少传多感知:基于掩码量化点云通信的容忍损失协同感知

Sheng Xu, Enshu Wang, Hongfei Xue, Jian Teng, Bingyi Liu, Yi Zhu, Pu Wang, Libing Wu, Chunming Qiao

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 本文提出QPoint2Comm框架,通过量化点云索引减少带宽消耗,提升3D信息精度,并采用掩码训练策略增强抗丢包能力,实验表明其在准确率、通信效率和抗丢包性能上均达新高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 62%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV 57%

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09783 2026-03-17 cs.RO cs.SY eess.SY 57%

Lightweight 3D LiDAR-Based UAV Tracking: An Adaptive Extended Kalman Filtering Approach

轻量级基于3D激光雷达的无人机跟踪:一种自适应扩展卡尔曼滤波方法

Nivand Khosravi, Meysam Basiri, Rodrigo Ventura

机构 * Institute for Systems and Robotics(系统与机器人研究所)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出一种轻量级基于3D激光雷达的无人机跟踪系统,采用自适应扩展卡尔曼滤波框架,解决稀疏、噪声和非均匀点云数据的跟踪问题,适用于小无人机的严格载荷约束。

Comments Presented at the 19th International Conference on Intelligent Autonomous Systems, IAS-19, Genoa, Italy, June 30 to July 4, 2025. To appear in the Springer post-proceedings of the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03285 2026-03-17 cs.CV eess.IV 57%

Deep Learning-based Event Data Coding: A Joint Spatiotemporal and Polarity Solution

基于深度学习的事件数据编码:一种联合时空和极性解决方案

Abdelrahman Seleem, André F. R. Guarda, Nuno M. M. Rodrigues, Fernando Pereira

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于深度学习的联合事件数据编码方法,通过单点云表示和自适应体素二值化策略,提升压缩性能并优化计算机视觉任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14290 2026-03-17 cs.CV 57%

RegFormer++: An Efficient Large-Scale 3D LiDAR Point Registration Network with Projection-Aware 2D Transformer

RegFormer++:一种高效的大规模3D激光雷达点云配准网络,具有投影感知的2D变换器

Jiuming Liu, Guangming Wang, Zhe Liu, Chaokang Jiang, Haoang Li, Mengmeng Liu, Tianchen Deng, Marc Pollefeys, Michael Ying Yang, Hesheng Wang

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出RegFormer++,一种高效的3D点云配准网络,通过投影感知的2D变换器提升鲁棒性,无需额外后处理,实验表明在KITTI、NuScenes和Argoverse数据集上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14189 2026-03-17 cs.CV cs.AI 57%

Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions

行走更远:基于语义的多模态步态识别在远距离条件下的应用

Zhiyang Lu, Wen Jiang, Tianren Wu, Zhichao Wang, Changwang Zhang, Siqi Shen, Ming Cheng

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出LRGait基准和EMGaitNet框架,通过语义引导融合和跨模态对齐提升远距离步态识别性能,验证了方法的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18991 2026-03-17 cs.CV cs.AI 57%

Training-Free Global Geometric Association for 4D LiDAR Panoptic Segmentation

无需训练的全局几何关联用于4D激光雷达全景分割

Gyeongrok Oh, Youngdong Jang, Jonghyun Choi, Suk-Ju Kang, Guang Lin, Sangpil Kim

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Geo-4D框架,通过全局几何关联策略实现无需训练的4D激光雷达全景分割,提升长时间视景的感知能力,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 57%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23194 2026-03-17 cs.CV 57%

Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss

无监督在线3D实例分割与合成序列及动态损失

Yifan Zhang, Wei Zhang, Chuangxin He, Zhonghua Miao, Junhui Hou

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出一种通过合成点云序列生成增强训练分布的新框架,采用灵活的采样策略和动态加权损失,提升3D实例分割的准确性和时间关联性。

Comments Accepted to TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13699 2026-03-17 eess.IV cs.RO 57%

D-Compress: Detail-Preserving LiDAR Range Image Compression for Real-Time Streaming on Resource-Constrained Robots

D-Compress:面向资源受限机器人实时流媒体的细节保留激光雷达范围图像压缩

Shengqian Wang, Chang Tu, He Chen

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出D-Compress,一种面向资源受限机器人实时流媒体的细节保留激光雷达范围图像压缩框架,通过自适应离散小波变换和新的率失真优化算法,在高压缩比下保持几何精度和下游任务性能。

Comments To appear in IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13355 2026-03-17 cs.CV 57%

Int3DNet: Scene-Motion Cross Attention Network for 3D Intention Prediction in Mixed Reality

Int3DNet:混合现实中的场景-运动交叉注意力网络用于3D意图预测

Taewook Ha, Woojin Cho, Dooyoung Kim, Woontack Woo

机构 * KAIST UVR Lab(韩国国立科学技术院(KAIST)虚拟现实实验室) KAIST KI-ITC PMRC(韩国国立科学技术院(KAIST)信息与通信技术中心PMRC) KAIST KI-ITC ARRC(韩国国立科学技术院(KAIST)信息与通信技术中心ARRC) KAIST UVR Lab and KAIST KI-ITC ARRC(韩国国立科学技术院(KAIST)虚拟现实实验室和信息与通信技术中心ARRC)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 Int3DNet通过结合稀疏运动提示和场景点云的交叉注意力融合,直接预测3D意图区域,无需显式物体级感知,在混合现实环境中实现鲁棒的人意图预测。

Comments Accepted as an IEEE TVCG paper at IEEE VR 2026 (journal track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07605 2026-03-17 cs.CV 57%

LOSC: LiDAR Open-voc Segmentation Consolidator

LOSC:激光雷达开放词汇分割整合器

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工大学,埃菲尔大学,CNRS)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了基于图像的视觉-语言模型在驾驶场景中对激光雷达扫描进行开放词汇分割的应用,通过整合标签提升空间时间一致性与图像增强鲁棒性,提出LOSC方法在nuScenes和SemanticKITTI上优于现有最佳方法。

Comments 3DV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13311 2026-03-17 cs.LG 50%

Neural Approximation and Its Applications

神经近似及其应用

Wei-Hao Wu, Ting-Zhu Huang, Xi-Le Zhao, Yisi Luo, Deyu Meng

专题命中 点云 :point cloud(abstract)

AI总结 本文提出神经近似方法,通过神经基函数分解多变量函数,提升近似能力和数据适应性,并理论证明其可任意逼近连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13254 2026-03-17 cs.LG stat.CO 50%

Introducing Feature-Based Trajectory Clustering, a clustering algorithm for longitudinal data

引入基于特征的轨迹聚类,一种用于纵向数据的聚类算法

Marie-Pierre Sylvestre, Laurence Boulanger

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种用于纵向数据的聚类算法,通过特征提取和谱聚类发现具有共同时间特征的个体群体。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 3 篇

2603.15433 2026-03-17 cs.CV 70%

Real-Time Human Frontal View Synthesis from a Single Image

从单张图像实时合成人体正面视图

Fangyu Lin, Yingdong Hu, Lunjie Zhu, Zhening Liu, Yushi Huang, Zehong Lin, Jun Zhang

机构 * HKUST(香港科技大学)

专题命中 新视角合成 :point cloud(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出PrismMirror框架,通过级联学习策略实现单图像实时正面视图合成,提升视觉真实性和结构准确性,达到24 FPS的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14241 2026-03-17 cs.CV 57%

CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control

CamLit:统一的视频扩散模型,具有显式相机和光照控制

Zhiyi Kuang, Chengan He, Egor Zakharov, Yuxuan Xue, Shunsuke Saito, Olivier Maury, Timur Bagautdinov, Youyi Zheng, Giljoo Nam

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13741 2026-03-17 cs.CV 57%

Ego-1K -- A Large-Scale Multiview Video Dataset for Egocentric Vision

Ego-1K -- 一个大规模多视角视频数据集用于第一人称视觉

Jae Yong Lee, Daniel Scharstein, Akash Bapat, Hao Hu, Andrew Fu, Haoru Zhao, Paul Sammut, Xiang Li, Stephen Jeapes, Anik Gupta, Lior David, Saketh Madhuvarasu, Jay Girish Joshi, Jason Wither

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 Ego-1K数据集通过12个同步相机采集近1000个短视频,用于推动神经3D视频合成和动态场景理解,其核心挑战在于近距离动态物体和设备自身运动导致的大视差和图像运动。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 空间理解 2 篇

2408.13024 2026-03-17 cs.CV 57%

Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding

学习2D不变的可供性知识以实现3D可供性定位

Xianqiang Gao, Pingrui Zhang, Delin Qu, Dong Wang, Zhigang Wang, Yan Ding, Bin Zhao

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。

Comments Accepted by AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 50%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. SLAM与定位 2 篇

2603.13917 2026-03-17 cs.CV 74%

Evaluation of Visual Place Recognition Methods for Image Pair Retrieval in 3D Vision and Robotics

视觉场景识别方法在3D视觉与机器人中的图像对检索评估

Dennis Haitz, Athradi Shritish Shetty, Michael Weinmann, Markus Ulrich

专题命中 SLAM与定位 :3D vision(title);分类 cs.CV

AI总结 本文评估了多种视觉场景识别方法在图像对检索中的性能,针对不同场景下的挑战,分析了各方法的优劣及适用性。

Comments Accepted at the XXV ISPRS Congress 2026; to appear in the ISPRS Annals

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14457 2026-03-17 cs.RO 57%

Towards Versatile Opti-Acoustic Sensor Fusion and Volumetric Mapping

迈向多功能光学-声学传感器融合与体积分层映射

Ivana Collado-Gonzalez, John McConnell, Brendan Englot

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.RO

AI总结 本文提出融合立体声纳与单目相机的体积分层映射框架,以应对不同能见度条件下的安全导航问题,通过解决声纳视场重叠带来的垂直模糊问题,生成可靠的3D点云。

Comments To appear at ICRA 2026 in Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏