SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation
SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Zhongguancun Academy(中关村学院)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。