Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
面向细粒度图像生成的头部适应性旋转位置编码
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出HARoPE,一种面向细粒度图像生成的头部适应性旋转位置编码方法,通过动态频率分配和语义对齐提升模型性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
面向细粒度图像生成的头部适应性旋转位置编码
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出HARoPE,一种面向细粒度图像生成的头部适应性旋转位置编码方法,通过动态频率分配和语义对齐提升模型性能。
GlyphBanana: 通过代理工作流推进精确文本渲染
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc.(小红书公司) ; Hong Kong University of Science and Technology(香港科技大学) ; Southeast University(东南大学) ; South China University of Technology(华南理工大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 GlyphBanana通过代理工作流整合辅助工具,提升复杂文本和公式渲染的精度,适用于多种文本到图像模型。
Hoi3DGen:生成高质量的人-物交互的3D模型
机构 * University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息学院) ; Technische Universität Nürnberg(纽伦堡技术大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。
OrthoEraser: 基于耦合神经元的正交投影用于概念擦除
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 OrthoEraser通过稀疏自编码器实现高分辨率特征解耦,利用分析梯度正交化策略有效擦除有害内容,同时保留良性语义,实验表明其在安全性和有效性上优于现有方法。