Semantic-Aware Prefix Learning for Token-Efficient Image Generation
语义感知的前缀学习用于令牌高效图像生成
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出SMAP,一种将语义条件注入查询式1D令牌化框架的令牌高效图像生成方法,通过尾令牌丢弃策略增强语义重要性,并引入CARD生成器验证其生成能力。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
语义感知的前缀学习用于令牌高效图像生成
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出SMAP,一种将语义条件注入查询式1D令牌化框架的令牌高效图像生成方法,通过尾令牌丢弃策略增强语义重要性,并引入CARD生成器验证其生成能力。
无需语言的生成编辑:一个视觉示例
专题命中 可控生成 :diffusion(abstract);image editing(abstract)
AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。
Comments Accepted at CVPR 2026
PixelSmile:迈向细粒度面部表情编辑
机构 * Fudan University(复旦大学) ; StepFun(阶跃星辰)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。
Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; NUS(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
统一的相机位置编码用于受控视频生成
机构 * Monash University(莫纳什大学) ; Building 4.0 CRC(4.0建筑CRC) ; VAST(VAST研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。
Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE
可控制生长厘米级二维钙钛矿异质结构单晶用于高性能窄双波段光电探测器
专题命中 可控生成 :diffusion(abstract)
AI总结 本研究通过新方法合成出厘米级高纯度二维钙钛矿单晶,用于制备高性能窄双波段光电探测器,实现了可控的异质结构厚度和结深,展现出低暗电流和高开关电流比。
Journal ref ACS Nano 2019, 13, 5, 5473-5484