PC2IM: An Efficient In-Memory Computing Accelerator for 3D Point Cloud
PC2IM: 一种高效的内存计算加速器用于3D点云
专题命中 点云 :point cloud(title,abstract)
AI总结 本文提出PC2IM加速器,通过改进的内存计算技术减少3D点云网络中的内存访问瓶颈,提升计算效率与能效。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
PC2IM: 一种高效的内存计算加速器用于3D点云
专题命中 点云 :point cloud(title,abstract)
AI总结 本文提出PC2IM加速器,通过改进的内存计算技术减少3D点云网络中的内存访问瓶颈,提升计算效率与能效。
SPOT:基于点云的立体视觉位置识别用于相似和对立视角
机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) ; Department of Robotics and the Department of Mechanical Engineering, University of Michigan(机器人学系和机械工程系,密歇根大学)
专题命中 点云 :point cloud(title);分类 cs.CV、cs.RO
AI总结 本文提出SPOT技术,利用立体视觉里程计估计的结构进行对立视角视觉位置识别,通过双距离矩阵序列匹配方法提升识别精度,实验表明在不同光照条件下,SPOT在对立视角识别中达到91.7%的召回率,且存储和运行效率优于现有方法。
Comments Expanded version with added appendix. Published in ICRA 2024. Project page: https://umautobots.github.io/spot
在真实采集条件下评估深度学习模型用于空中LiDAR点云语义分割:纳瓦拉案例研究
机构 * Department of Statistics, Computer Science and Mathematics and Institute of Smart Cities (ISC), Public University of Navarre (UPNA)(统计、计算机科学与数学系和智能城市研究所(ISC),纳瓦拉公共大学(UPNA)) ; Tracasa Instrumental
专题命中 点云 :point cloud(title);分类 cs.CV
AI总结 本文评估了四种深度学习模型在真实飞行条件下大规模空中LiDAR数据集上的性能,揭示了空中数据中类别不平衡和几何变化的挑战,结果显示KPConv在多个类别上表现最佳。
Comments 6 pages, 2 figures
GAPG:面向目标操作的几何感知推抓取协同
机构 * College of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院)
专题命中 点云 :point cloud(abstract);分类 cs.RO
AI总结 本文提出GAPG框架,通过整合点云数据,利用几何关系评估抓取与推动作,提升机器人在杂乱环境中的安全性和效率。
Comments Accepted to ICRA 2026
通过地标加速向量扩散图
机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) ; National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) ; Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) ; Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)
专题命中 点云 :point cloud(abstract)
AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。
基于多模态大语言模型的波束预测
专题命中 点云 :point cloud(abstract)
AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。
RefracGS:通过折射水表面进行新颖视图合成
机构 * Shandong University, China(山东大学) ; Peking University, Beijing, China(北京大学) ; Sun Yat-sen University, China(中山大学) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)
专题命中 新视角合成 :novel view synthesis(title,abstract);NeRF(abstract);Gaussian Splatting(abstract);3DGS(abstract)
AI总结 RefracGS通过3D高斯射线追踪方法,结合折射水面与底层场景的重建,实现高保真新颖视图合成,实验表明其在视觉质量和效率上优于现有方法。
对新颖视角合成中高效且有效的相机姿态估计策略进行基准测试
机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电子工程系) ; Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克技术大学信息技术、机器人与自动化研究所) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 新视角合成 :novel view synthesis(title,abstract);3DGS(abstract);分类 cs.CV
AI总结 本文提出一个基准测试,评估在新颖视角合成中高效且有效的相机姿态估计策略,通过减少特征数量和使用前馈网络结合经典SfM方法,实现效率与精度的平衡。
热总是野性:在仅热成像的新型视角合成中的特征刻画与挑战应对
机构 * Northwestern University(西北大学) ; University of California, Riverside(加州大学河滨分校)
专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV
AI总结 本文针对热成像在新型视角合成中的难点,提出轻量预处理与溅射流程,提升动态范围并稳定光照度,实现先进性能。
Comments To be published at CVPR, 2026. 15 Pages, 29 Figures
将几何基础模型重新利用于多视图扩散
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; New York University(纽约大学) ; Intel Labs(英特尔实验室)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。
Comments project website: https://cvlab-kaist.github.io/GLD/
Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑
机构 * Adobe Research(Adobe研究实验室) ; KAIST AI(韩国科学技术院人工智能研究所) ; Adobe Internship(Adobe实习) ; Project Lead(项目负责人)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。
Comments Project page: https://dohunlee1.github.io/MemoryV2V
文本-图像条件的3D生成
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) ; Huawei Inc.(华为公司) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV
AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。
Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon
Uni-Classifier: 利用视频扩散先验进行通用引导分类器
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。
Comments Accepted by ICME 2026
DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Huawei Foundation Model Department(华为基础模型部门)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO
AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。
3D-Layout-R1: 为语言指导的空间编辑进行结构化推理
机构 * NVIDIA ; UMass Amherst(马萨诸塞大学阿默斯特分校)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。
增强现实引导的机器人超声与锥束CT整合在脊柱手术中的可行性
机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序系(CAMP),慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本文提出一种基于光学透视增强现实的机器人系统,结合锥束CT与超声成像,提升脊柱手术中针具定位的准确性和效率,降低认知负荷。
Comments 8 pages, 7 figures
SpatialBoost: 通过语言引导的推理增强视觉表示
机构 * KAIST(韩国科学技术院) ; RLWRLD ; NAVER Cloud(NAVER云)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。
Comments 35 pages; 7 figures
皮层策略:一种双流视图变换器用于机器人操作
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shandong Jianzhu University(山东建筑大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。
Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included
空间中的注意:VLM头部在空间推理中的功能角色
机构 * The University of Melbourne(墨尔本大学) ; Australian National University(澳大利亚国立大学) ; Fudan University(复旦大学) ; Monash University(莫纳什大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。
ToFormer:面向大规模场景深度补全的轻量级ToF相机
机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) ; Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) ; The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))
专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV、cs.RO
AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。
Comments 17 pages, 15 figures
LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。
Comments Project page: https://leo-vl.github.io