LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory
LoGeR:长上下文几何重建与混合记忆
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。
Comments Project page: https://LoGeR-project.github.io/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
LoGeR:长上下文几何重建与混合记忆
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。
Comments Project page: https://LoGeR-project.github.io/
NVILA:高效的前沿视觉语言模型
机构 * NVIDIA ; MIT(麻省理工学院) ; UC Berkeley(加州大学伯克利分校) ; UC San Diego(加州大学圣地亚哥分校) ; University of Washington(华盛顿大学) ; Tsinghua University(清华大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。
Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/