Text-Vision Co-Instructed Image Editing
文本-视觉协同指导的图像编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。
大厂专区
文本-视觉协同指导的图像编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。
Tool-IQA: 利用简单工具增强图像质量评估
机构 * National University of Singapore(新加坡国立大学) ; OPPO Research Institute(OPPO研究院) ; Nanyang Technical University(南洋理工大学) ; Duke University(杜克大学) ; City University of Hong Kong(香港城市大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。
使用分布式GPU预训练大型语言模型:一种内存高效的分散式范式
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; OPPO Research Institute(OPPO研究院)
AI总结 提出SPES框架,通过分散式训练MoE LLM的子集专家降低内存需求,结合专家合并预热策略,在16个48GB GPU上训练2B参数模型,性能媲美集中式训练。