Depth-Guided Video Object Counting in Crowded Scenes
拥挤场景中基于深度引导的视频目标计数
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
拥挤场景中基于深度引导的视频目标计数
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。
超越静态预测:利用世界模型进行移动交通外推
专题命中 空间理解 :spatial understanding(abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。