WildOcc: A Benchmark for Off-Road 3D Semantic Occupancy Prediction
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments 22 pages, 5 figures, 8 tables. Accepted by NeurIPS 2024 (Vancouver), the Thirty-Eighth Annual Conference on Neural Information Processing Systems
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments Technical report, unpublished, 16 pages
专题命中 空间理解 :novel view synthesis(abstract);分类 cs.CV、cs.GR
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO
Comments ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments Accepted by ICRA 2023
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments IEEE-RAS International Conference on Humanoid Robots (Humanoids 2022)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO
Comments CoRL 2021. Project Website: https://cliport.github.io/
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments published in 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
专题命中 空间理解 :3D reconstruction(abstract);分类 cs.CV、cs.RO
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
Comments The dataset is available http://3Dsemantics.stanford.edu/
机构 * Technical University of Munich(慕尼黑技术大学) ; University of Cambridge(剑桥大学)
专题命中 空间理解 :point cloud(abstract);分类 cs.CV;3D vision(comments)
Comments The paper accepted for 3DV 2026 (International Conference on 3D Vision 2026)
专题命中 空间理解 :3D vision(abstract,comments);分类 cs.CV
Comments 3rd Place @ ECCV 2020 Holistic Scene Structures for 3D Vision Workshop Challenges Track 1; 6 pages with 3 figures and 2 tables
具备多模态增强能力的可泛化手术室专家
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。
Comments Accepted by ACM Multimedia 2026
SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。
Comments 26 pages, 5 figures
4D-WAM:通过轨迹场将时空感知注入世界动作模型
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。
空间思维链:面向视觉语言模型的模态无关空间定位
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。
Easy3D-Labels: 通过3D伪标签监督语义占用估计用于汽车感知
机构 * Department of Electronic and Computer Engineering, University of Limerick(利默里克大学电子与计算机工程系) ; Data Driven Computer Engineering Research Centre, University of Limerick(利默里克大学数据驱动计算机工程研究中心) ; SFI CRT Foundations in Data Science, University of Limerick(爱尔兰科学基金会数据科学基础研究中心,利默里克大学)
专题命中 空间理解 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出Easy3D-Labels,利用Grounded-SAM和Metric3Dv2生成3D伪标签,提升汽车感知中语义占用估计的性能,实现mIoU和RayIoU显著提升。
Comments Accepted at IEEE OJVT
FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Michigan State University(密歇根州立大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。
Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
用于评估心脏介入效率、精度和深度感知潜在提升的增强型实时六自由度扩展现实导管跟踪技术
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本研究开发基于XR的实时6-DOF导管跟踪平台,经20名医学生测试,其可使心脏介入操作速度提升超5倍、导管移动距离减约5倍,还能提高精度、降低变异性,优化操作体验。
拥挤场景中基于深度引导的视频目标计数
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。
HiSC:用于高效3D场景理解的分层空间聚类令牌压缩
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 空间理解 :3D vision(abstract);分类 cs.CV
AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。
Comments Accepted by ACM MM 2026
YouTube-Occ:从YouTube视频学习室内3D语义占据预测
机构 * East China Normal University(华东师范大学)
专题命中 空间理解 :point cloud(abstract);分类 cs.CV
AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。
Comments Accepted by ECCV 2026
面向全身遥操作移动操作的全景感知VLA学习
机构 * Beihang University(北京航空航天大学) ; Shandong University(山东大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Delta Intelligence(delta智能公司)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。
Comments 8 pages, 4 figures