Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos
从单目视频生成时空世界场景图
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Indian Institute of Technology Delhi(印度理工学院德里)
专题命中 多模态RAG :RAG(abstract)
AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。