arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-24 至 2026-03-24 共收录 51 信号源:cs.CV, cs.GR, cs.RO

1. 点云 10 篇

2603.21167 2026-03-24 cs.AR 78%

PC2IM: An Efficient In-Memory Computing Accelerator for 3D Point Cloud

PC2IM: 一种高效的内存计算加速器用于3D点云

Dengfeng Wang, Shunqin Cai, Yanan Sun

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出PC2IM加速器,通过改进的内存计算技术减少3D点云网络中的内存访问瓶颈,提升计算效率与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12339 2026-03-24 cs.RO cs.CV 76%

SPOT: Point Cloud Based Stereo Visual Place Recognition for Similar and Opposing Viewpoints

SPOT:基于点云的立体视觉位置识别用于相似和对立视角

Spencer Carmichael, Rahul Agrawal, Ram Vasudevan, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of Robotics and the Department of Mechanical Engineering, University of Michigan(机器人学系和机械工程系,密歇根大学)

专题命中 点云 :point cloud(title);分类 cs.CV、cs.RO

AI总结 本文提出SPOT技术,利用立体视觉里程计估计的结构进行对立视角视觉位置识别,通过双距离矩阵序列匹配方法提升识别精度,实验表明在不同光照条件下,SPOT在对立视角识别中达到91.7%的召回率,且存储和运行效率优于现有方法。

Comments Expanded version with added appendix. Published in ICRA 2024. Project page: https://umautobots.github.io/spot

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22229 2026-03-24 cs.CV 74%

Benchmarking Deep Learning Models for Aerial LiDAR Point Cloud Semantic Segmentation under Real Acquisition Conditions: A Case Study in Navarre

在真实采集条件下评估深度学习模型用于空中LiDAR点云语义分割:纳瓦拉案例研究

Alex Salvatierra, José Antonio Sanz, Christian Gutiérrez, Mikel Galar

机构 * Department of Statistics, Computer Science and Mathematics and Institute of Smart Cities (ISC), Public University of Navarre (UPNA)(统计、计算机科学与数学系和智能城市研究所(ISC),纳瓦拉公共大学(UPNA)) Tracasa Instrumental

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 本文评估了四种深度学习模型在真实飞行条件下大规模空中LiDAR数据集上的性能,揭示了空中数据中类别不平衡和几何变化的挑战,结果显示KPConv在多个类别上表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21195 2026-03-24 cs.RO 57%

GAPG: Geometry Aware Push-Grasping Synergy for Goal-Oriented Manipulation in Clutter

GAPG:面向目标操作的几何感知推抓取协同

Lijingze Xiao, Jinhong Du, Yang Cong, Supeng Diao, Yu Ren

机构 * College of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出GAPG框架,通过整合点云数据,利用几何关系评估抓取与推动作,提升机器人在杂乱环境中的安全性和效率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21247 2026-03-24 stat.ML cs.LG math.DG physics.data-an 50%

Accelerate Vector Diffusion Maps by Landmarks

通过地标加速向量扩散图

Sing-Yuan Yeh, Yi-An Wu, Hau-Tieng Wu, Mao-Pei Tsui

机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 50%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 点云 :point cloud(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 5 篇

2603.21695 2026-03-24 cs.CV cs.GR 88%

RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing

RefracGS:通过折射水表面进行新颖视图合成

Yiming Shao, Qiyu Dai, Chong Gao, Guanbin Li, Yeqiang Wang, He Sun, Qiong Zeng, Baoquan Chen, Wenzheng Chen

机构 * Shandong University, China(山东大学) Peking University, Beijing, China(北京大学) Sun Yat-sen University, China(中山大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

专题命中 新视角合成 :novel view synthesis(title,abstract);NeRF(abstract);Gaussian Splatting(abstract);3DGS(abstract)

AI总结 RefracGS通过3D高斯射线追踪方法,结合折射水面与底层场景的重建,实现高保真新颖视图合成,实验表明其在视觉质量和效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20428 2026-03-24 cs.CV 83%

Benchmarking Efficient & Effective Camera Pose Estimation Strategies for Novel View Synthesis

对新颖视角合成中高效且有效的相机姿态估计策略进行基准测试

Jhacson Meza, Martin R. Oswald, Torsten Sattler

机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电子工程系) Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克技术大学信息技术、机器人与自动化研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 本文提出一个基准测试,评估在新颖视角合成中高效且有效的相机姿态估计策略,通过减少特征数量和使用前馈网络结合经典SfM方法,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20448 2026-03-24 cs.CV eess.IV 79%

Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis

热总是野性:在仅热成像的新型视角合成中的特征刻画与挑战应对

M. Kerem Aydin, Vishwanath Saragadam, Emma Alexander

机构 * Northwestern University(西北大学) University of California, Riverside(加州大学河滨分校)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 本文针对热成像在新型视角合成中的难点,提出轻量预处理与溅射流程,提升动态范围并稳定光照度,实现先进性能。

Comments To be published at CVPR, 2026. 15 Pages, 29 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV 57%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 57%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 2 篇

2603.21295 2026-03-24 cs.CV 79%

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 57%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 6 篇

2603.22280 2026-03-24 cs.CV cs.RO 62%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 57%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22174 2026-03-24 cs.HC cs.RO 57%

Feasibility of Augmented Reality-Guided Robotic Ultrasound with Cone-Beam CT Integration for Spine Procedures

增强现实引导的机器人超声与锥束CT整合在脊柱手术中的可行性

Tianyu Song, Felix Pabst, Feng Li, Yordanka Velikova, Miruna-Alexandra Gafencu, Yuan Bi, Ulrich Eck, Nassir Navab

机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序系(CAMP),慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出一种基于光学透视增强现实的机器人系统,结合锥束CT与超声成像,提升脊柱手术中针具定位的准确性和效率,降低认知负荷。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22057 2026-03-24 cs.CV 57%

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

SpatialBoost: 通过语言引导的推理增强视觉表示

Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD NAVER Cloud(NAVER云)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。

Comments 35 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21051 2026-03-24 cs.RO 57%

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

皮层策略:一种双流视图变换器用于机器人操作

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。

Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 57%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 1 篇

2603.20669 2026-03-24 cs.RO cs.CV 62%

ToFormer: Towards Large-scale Scenario Depth Completion for Lightweight ToF Camera

ToFormer:面向大规模场景深度补全的轻量级ToF相机

Juncheng Chen, Tiancheng Lai, Xingpeng Wang, Bingxin Liao, Baozhe Zhang, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 1 篇

2506.09935 2026-03-24 cs.CV 79%

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏