One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。