Rethinking 3D Segmentation from Individual LiDAR Scans: Incidence-Aware Sampling on the SIP Benchmark
从单个激光雷达扫描数据重新思考三维分割:SIP基准上的入射角感知采样
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 针对单个激光雷达扫描的三维分割,本研究在SIP基准上提出入射角感知采样策略,提升了非平面构件等的分割性能,降低了对采样分辨率的敏感性。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
从单个激光雷达扫描数据重新思考三维分割:SIP基准上的入射角感知采样
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 针对单个激光雷达扫描的三维分割,本研究在SIP基准上提出入射角感知采样策略,提升了非平面构件等的分割性能,降低了对采样分辨率的敏感性。
几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪
机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) ; PinPark, Inc.(PinPark公司)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。
离线-在线分层3D全局重定位与合成LiDAR感知及描述空间检索
机构 * School of Electrical Engineering, Southwest Jiaotong University(西南交通大学电气工程学院)
专题命中 点云 :point cloud(abstract);分类 cs.RO
AI总结 本文提出一种离线-在线分层框架,通过分离搜索空间提升大规模空间中的重定位效率和精度,实测平均重定位时间3秒,精度8厘米,计算效率提升一个数量级。
人脸嵌入在不同深度神经网络模型间是否兼容?
机构 * Michigan State University(密歇根州立大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。
SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解
专题命中 点云 :3D vision(abstract);分类 cs.CV
AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。
超相对论重离子碰撞中标度不变空间涨落的拓扑分析
专题命中 点云 :point cloud(abstract)
AI总结 本文针对重离子碰撞中临界涨落信号微弱难以提取的问题,提出结合TDA与深度学习的两阶段拓扑机器学习框架,成功恢复归一化阶乘矩的幂律标度,确立了拓扑机器学习探测QCD临界点的工具价值。
Comments 16 pages, 12 figures
AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型
机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.RO
AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。
Comments Accepted to IROS 2026
适用于视图一致的2D到3D生成的视图自适应渲染器
专题命中 3D生成 :3D generation(title,abstract);NeRF(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV、cs.GR
AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。
Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026
SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆
机构 * China Agricultural University(中国农业大学)
专题命中 空间理解 :spatial understanding(title,abstract);3D reconstruction(abstract);分类 cs.RO
AI总结 针对现有农业视觉语言导航方法忽视重复指令的空间记忆潜力的局限,提出SUM模块并集成至AgriVLN构建SUM-AgriVLN,在A2A基准上将SR从0.47提至0.54,NE仅微增,达领域顶尖性能。
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
用于评估心脏介入效率、精度和深度感知潜在提升的增强型实时六自由度扩展现实导管跟踪技术
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本研究开发基于XR的实时6-DOF导管跟踪平台,经20名医学生测试,其可使心脏介入操作速度提升超5倍、导管移动距离减约5倍,还能提高精度、降低变异性,优化操作体验。
GLocFM:面向三维室内无线定位的几何感知基础模型
专题命中 SLAM与定位 :NeRF(abstract,abstract_cn);point cloud(abstract)
AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。
Comments 13 pages, single column
面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 SLAM与定位 :NeRF(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。
仅一次流:基于多假设归一化流的校准且实时雷达位姿估计
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; LMU München(慕尼黑大学) ; Helmholtz Zentrum München(慕尼黑亥姆霍兹中心)
专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV
AI总结 该研究针对雷达位姿估计的歧义问题,提出MH-NFPG方法,结合时空Transformer与归一化流,实现高效实时的校准位姿估计,性能优于扩散模型。
Comments Accepted at the Winter Conference on Applications of Computer Vision (WACV) 2027
GeoLink:一种面向跨视角地理定位更好泛化的3D-aware框架
机构 * CUHK(SZ)(香港中文大学(深圳)) ; XMU(厦门大学) ; UESTC(电子科技大学) ; Foshan University(佛山大学) ; Tongji University(同济大学)
专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV
AI总结 本文提出GeoLink框架,通过3D感知的语义一致方法提升跨视角地理定位的泛化能力,实验表明其在多个基准测试中优于现有方法,能适应未见领域和多变天气。
从对齐到合成:用于文本到CT生成的对比体 grounding
机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。
Comments Accepted at BMVC 2026