Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding
学习2D不变的可供性知识以实现3D可供性定位
专题命中 空间理解 :point cloud(abstract);分类 cs.CV
AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。
Comments Accepted by AAAI 2025 (Oral)
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
学习2D不变的可供性知识以实现3D可供性定位
专题命中 空间理解 :point cloud(abstract);分类 cs.CV
AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。
Comments Accepted by AAAI 2025 (Oral)
SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准
机构 * Xiamen University, China(厦门大学,中国) ; Shopee, China(Shopee,中国) ; Tongji University, China(同济大学,中国)
专题命中 空间理解 :spatial understanding(abstract)
AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。
Comments Accepted By CVPR2026