Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation
回声驱动:一种用于交互式长视频生成的场景记忆框架
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; China University of Mining & Technology, Beijing(中国矿业大学(北京)) ; ETH Zürich(苏黎世联邦理工学院) ; City College of New York, City University of New York(纽约城市学院,纽约城市大学) ; Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)
AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。