VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion
VidMap:利用时序结构实现基于视频的运动恢复结构
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌) ; Microsoft(微软)
AI总结 VidMap结合SLAM序列约束与SfM全局优化,利用宽基线匹配和深度先验,在多样挑战性数据集上,较最新SLAM和SfM更鲁棒准确,可实现任意长未标定视频的度量重建。
高校专区
VidMap:利用时序结构实现基于视频的运动恢复结构
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌) ; Microsoft(微软)
AI总结 VidMap结合SLAM序列约束与SfM全局优化,利用宽基线匹配和深度先验,在多样挑战性数据集上,较最新SLAM和SfM更鲁棒准确,可实现任意长未标定视频的度量重建。
视觉还是认知?多模态大语言模型的视觉上下文敏感性
机构 * University of Copenhagen(哥本哈根大学) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Clemson University(克莱姆森大学)
AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。
DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割
机构 * ETH Zürich(苏黎世联邦理工学院) ; INSAIT, Sofia University(保加利亚索菲亚大学INSAIT研究所) ; University of Bonn(波恩大学) ; Microsoft(微软公司)
AI总结 DVPSFormer是一种统一在线架构,通过ESD和OMV机制实现高效4D场景理解,在两个DVPS基准上达SOTA,为自动驾驶提供在线机器人感知的精简方案。