arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-10 至 2026-03-10 共收录 56 信号源:cs.CV, cs.GR, cs.RO

1. 点云 20 篇

2512.00927 2026-03-10 cs.CV 79%

LAHNet: Local Attentive Hashing Network for Point Cloud Registration

LAHNet:用于点云配准的局部注意哈希网络

Wentao Qu, Xiaoshui Huang, Liang Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 LAHNet通过引入局部注意机制和高效窗口化策略,提升点云配准的特征区分性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07593 2026-03-10 cs.CV 79%

Fast Attention-Based Simplification of LiDAR Point Clouds for Object Detection and Classification

基于快速注意力机制的激光雷达点云简化用于目标检测与分类

Z. Rozsa, Á. Madaras, Q. Wei, X. Lu, M. Golarits, H. Yuan, T. Sziranyi, R. Hamzaoui

机构 * Institute for Computer Science and Control (SZTAKI)(计算机科学与控制研究所) School of Information Engineering(信息工程学院) Faculty of Technology, Arts, and Culture(技术、艺术与文化学院) School of Control Science and Engineering(控制科学与工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出一种基于注意力机制的高效激光雷达点云简化方法,通过特征嵌入与注意力采样模块提升目标检测与分类的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20331 2026-03-10 cs.CV 79%

AnyPcc: Compressing Any Point Cloud with a Single Universal Model

AnyPcc: 用单一通用模型压缩任意点云

Kangli Wang, Qianxi Yi, Yuqi Ye, Shihao Li, Wei Gao

机构 * SECE, Peking University(北京大学SECE学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 AnyPcc通过通用上下文模型和实例自适应微调策略,实现高效且鲁棒的点云压缩,适用于各种密度数据。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01487 2026-03-10 cs.CV 79%

PointSlice: Accurate and Efficient Slice-Based Representation for 3D Object Detection from Point Clouds

PointSlice: 用于点云3D物体检测的准确且高效的基于切片的表示方法

Liu Qifeng, Zhao Dawei, Dong Yabo, Xiao Liang, Wang Juan, Min Chen, Li Fuyang, Jiang Weizhong, Lu Dongming, Nie Yiming

机构 * Zhejiang University(浙江大学) Defense Innovation Institute(国防科技创新研究院) Tsinghua University(清华大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 PointSlice提出了一种基于切片的点云表示方法,通过引入切片交互网络提升3D物体检测的精度与效率。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08417 2026-03-10 cs.MM 78%

Scalable On-the-fly Transcoding for Adaptive Streaming of Dynamic Point Clouds

动态点云自适应流媒体的可扩展实时转码

Michael Rudolph, Matthias De Fré, Finn Schnier, Tim Wauters, Amr Rizk

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出了一种动态点云流媒体系统,通过实时转码技术降低存储需求并提升并发客户端的可扩展性。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07874 2026-03-10 cs.CV cs.LG 70%

Toward Unified Multimodal Representation Learning for Autonomous Driving

迈向自动驾驶的统一多模态表示学习

Ximeng Tao, Dimitar Filev, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(德克萨斯大学机械工程系,德克萨斯农工大学,学院站,德克萨斯,77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分布系,德克萨斯农工大学,学院站,德克萨斯,77843,美国)

专题命中 点云 :3D vision(abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出CTP框架,通过统一多模态张量对齐提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08926 2026-03-10 cs.RO cs.CV 62%

ClearDepth: Enhanced Stereo Perception of Transparent Objects for Robotic Manipulation

ClearDepth: 增强透明物体的立体视觉以辅助机器人操作

Kaixin Bai, Huajian Zeng, Lei Zhang, Yiwen Liu, Hongli Xu, Zhaopeng Chen, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学) Mohamed Bin Zayed University of Artificial Intelligence (MBUZAI)(Mohamed Bin Zayed人工智能大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 ClearDepth通过视觉Transformer和特征后融合模块,提升透明物体的深度感知,以辅助机器人操作。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06746 2026-03-10 cs.RO cs.CV 62%

M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark

M3CAD:迈向通用协作自动驾驶基准

Morui Zhu, Yongqi Zhu, Yihao Zhu, Qi Chen, Deyuan Qu, Song Fu, Qing Yang

机构 * University of North Texas(北卡罗来纳州立大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 M3CAD是一个全面的协作自动驾驶基准,提供多模态数据支持多种自动驾驶任务,并提出多级融合方法以平衡通信效率与感知精度。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06572 2026-03-10 cs.CV cs.LG 57%

SCOPE: Scene-Contextualized Incremental Few-Shot 3D Segmentation

SCOPE: 场景上下文化增量少量样本3D分割

Vishal Thengane, Zhaochong An, Tianjin Huang, Son Lam Phung, Abdesselam Bouzerdoum, Lu Yin, Na Zhao, Xiatian Zhu

机构 * University of Surrey, UK(英国萨里大学) University of Wollongong, Australia(澳大利亚沃拉彭大学) University of Copenhagen, Denmark(丹麦哥本哈根大学) University of Exeter, UK(英国埃克塞特大学) Singapore University of Technology and Design, Singapore(新加坡科技与设计大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 SCOPE通过背景引导原型丰富框架,在3D分割中实现增量少量样本学习,提升新类别和平均IoU性能,同时减少遗忘。

Comments Accepted at CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05760 2026-03-10 cs.RO cs.HC 57%

Task-Oriented Robot-Human Handovers on Legged Manipulators

面向任务的腿式机械臂人机交接

Andreea Tulbure, Carmen Scheidemann, Elias Steiner, Marco Hutter

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出AFT-Handover框架,通过结合大语言模型和纹理转移实现零样本、可泛化的面向任务的人机交接,提升交接成功率和泛化能力。

Comments Accepted to 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05698 2026-03-10 cs.CV 57%

Point-based Instance Completion with Scene Constraints

基于场景约束的点云实例补全

Wesley Khademi, Li Fuxin

机构 * Oregon State University(俄勒冈州立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于点云的实例补全模型,通过引入场景约束和交叉注意力机制,实现对场景中任意尺度和姿态的对象的稳健补全。

Comments Published in ICLR 2025. Project Page: https://wkhademi.github.io/point_based_instance_completion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13172 2026-03-10 cs.CV 57%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02808 2026-03-10 cs.RO cs.AI cs.SY eess.SY 57%

Improving the Resilience of Quadrotors in Underground Environments by Combining Learning-based and Safety Controllers

通过结合学习型控制器和安全控制器提高地下环境中四旋翼的鲁棒性

Isaac Ronald Ward, Mark Paral, Kristopher Riordan, Mykel J. Kochenderfer

机构 * Stanford Intelligent Systems Laboratory, Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本研究通过结合学习型和安全控制器,提高四旋翼在地下环境中的鲁棒性,实现任务完成与碰撞避免的平衡。

Comments Accepted and awarded best paper at the 11th International Conference on Control, Decision and Information Technologies (CoDIT 2025 - https://codit2025.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02858 2026-03-10 cs.CV 57%

Empowering Microscopic Traffic Simulators with Realistic Perception using Surrogate Sensor Models

通过使用替代传感器模型使微观交通模拟器具备现实感知能力

Tianheng Zhu, Yiheng Feng

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 MIDAR通过替代传感器模型使微观交通模拟器具备现实感知能力,提升ITS应用的仿真真实性与效率。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24327 2026-03-10 stat.ML cs.CG cs.LG 50%

Topological Spatial Graph Coarsening

拓扑空间图粗化

Anna Calissano, Etienne Lasalle

专题命中 点云 :point cloud(abstract)

AI总结 本文提出了一种基于三角形感知图过滤器的拓扑空间图粗化方法,通过合并短边实现图缩减,同时保持拓扑特征,且具有旋转、平移和缩放下的等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07591 2026-03-10 math.AT 50%

Local Laplacian: theory and models for data analysis

局部拉普拉斯:数据分析的理论与模型

Jian Liu, Hongsong Feng, Kefeng Liu

专题命中 点云 :point cloud(abstract)

AI总结 本文提出持续局部拉普拉斯方法,通过理论推导和算法设计,解决拓扑数据分析中局部结构敏感性和计算成本高的问题,实现高效并行计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03086 2026-03-10 math.NA cs.NA 50%

Pretrain Finite Element Method: A Pretraining and Warm-start Framework for PDEs via Physics-Informed Neural Operators

预训练有限元法:通过物理信息神经算子实现的PDEs预训练和热启动框架

Yizheng Wang, Zhongkai Hao, Mohammad Sadegh Eshaghi, Cosmin Anitescu, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出预训练有限元法,通过物理信息神经算子结合FEM,提升PDEs求解效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 3 篇

2603.08133 2026-03-10 cs.CV 77%

Fast Low-light Enhancement and Deblurring for 3D Dark Scenes

快速低光照增强与去模糊用于3D暗场景

Feng Zhang, Jinglong Wang, Ze Li, Yanghong Zhou, Yang Chen, Lei Chen, Xiatian Zhu

专题命中 新视角合成 :NeRF(abstract);3DGS(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 FLED-GS通过交替增强和重建循环,实现快速低光照和运动模糊图像的3D场景恢复,优于现有方法,训练和渲染速度提升显著。

Comments 5 pages, 2 figures, Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11161 2026-03-10 cs.CV cs.GR cs.MM 76%

altiro3D: Scene representation from single image and novel view synthesis

altiro3D: 从单张图像和新视角合成生成场景表示

E. Canessa, L. Tenze

机构 * The Abdus Salam International Centre for Theoretical Physics, ICTP, Trieste 34151, Italy(阿布杜斯·萨拉姆国际理论物理学中心,ICTP,特里埃斯特)

专题命中 新视角合成 :novel view synthesis(title);分类 cs.CV、cs.GR

AI总结 altiro3D通过单张图像生成多视角和视频,结合深度估计与快速算法实现逼真3D体验。

Comments In press (2023) Springer International Journal of Information Technology (IJIT) 10 pages, 3 figures

Journal ref International Journal of Information Technology 16 (2024) 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08147 2026-03-10 cs.CV 70%

MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Data

MV-Fashion: 向通过多视角配对数据实现虚拟试衣和尺寸估计迈进

Hunor Laczkó, Libang Jia, Loc-Phat Truong, Diego Hernández, Sergio Escalera, Jordi Gonzalez, Meysam Madadi

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Computer Vision Center(计算机视觉中心) Universitat de Barcelona(巴塞罗那大学)

专题命中 新视角合成 :point cloud(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 MV-Fashion通过多视角配对数据集提升虚拟试衣和服装尺寸估计任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 2 篇

2508.11952 2026-03-10 cs.CV 70%

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 3D生成 :3D generation(abstract);spatial understanding(abstract);分类 cs.CV

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18734 2026-03-10 cs.CV cs.AI 57%

Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

Yo'City:通过自批评扩展实现个性化和无边界的3D逼真城市场景生成

Keyang Lu, Sifan Zhou, Hongbin Xu, Gang Xu, Zhifei Yang, Yikai Wang, Zhen Xiao, Jieyi Long, Ming Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beihang University(北航) Southeast University(东南大学) ByteDance Seed(字节跳动种子) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Beijing Normal University(北京师范大学) Theta Labs(Theta实验室)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 Yo'City通过自批评扩展实现个性化和无边界的3D城市生成,利用大模型的推理能力提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 3 篇

2603.06985 2026-03-10 cs.CV 57%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06973 2026-03-10 cs.CV 57%

T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

T2SGrid: 视频时间定位的时空网格化

Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long

机构 * South China University of Technology(南方科技大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Bytedance Inc(字节跳动公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 T2SGrid通过将视频时间理解转化为空间理解任务,利用网格化技术提升视频时间定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV 57%

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 1 篇

2603.07937 2026-03-10 cs.CV 57%

$L^3$:Scene-agnostic Visual Localization in the Wild

$L^3$:野外场景中的无场景依赖视觉定位

Yu Zhang, Muhua Zhu, Yifei Xue, Tie Ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出$L^3$框架,通过在线3D重建和两阶段优化实现无地图的高精度视觉定位,尤其在稀疏场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏