A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models
专题命中 可控生成 :text-to-image(abstract);generative vision(abstract)
Comments 30 pages, 4 Figures, 10 Tables
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :text-to-image(abstract);generative vision(abstract)
Comments 30 pages, 4 Figures, 10 Tables
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)
专题命中 可控生成 :diffusion(abstract);image editing(abstract)
Comments Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI-25)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM
专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract)
Comments Published in TACL
Journal ref Transactions of the Association for Computational Linguistics 12 (2024): 264-282
专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV、cs.GR
Comments 21 pages, 20 figures. To appear in The Journal of Computer Aided Geometric Design's Special Issue on Heat Diffusion Equation and Optimal Transport in Geometry Processing and Computer Graphics
MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。
Comments 14 pages, 6 figures
基于稀疏直接飞行时间传感器的密集度量深度补全
机构 * KAIST(韩国科学技术院) ; USTC(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
风格感知的光泽控制用于生成非照片实感渲染
机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。
Comments Published in Computers & Graphics journal
GCDance:基于音乐的风格控制3D全身舞蹈生成
机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) ; Department of Music and Media, University of Surrey(萨里大学音乐与媒体系) ; Department of Informatics, University of Oslo(奥斯陆大学信息学系) ; Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音与信号处理中心) ; School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出GCDance框架,通过音乐和文本条件生成风格化的3D舞蹈,利用文本控制机制和音乐基础模型提升生成质量,实验验证其优于现有方法。
Journal ref IEEE Transactions on Multimedia, 2026
用于稳健合成图像源归属的混合语义与频谱集成
机构 * Chittagong University of Engineering and Technology(吉大港工程技术大学)
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 针对文本到图像模型发展带来的合成图像源归属问题,提出融合语义深度学习与数学取证特征提取的双分支集成框架,经实验验证准确率高且计算高效,突出数学取证在实际部署中的优势。
Comments Peer-reviewed and accepted to the DLMMDD Challenge Workshop at the 35th International Conference on Artificial Neural Networks (ICANN 2026). 7 pages, 1 figures
RegHead:通过前馈配准生成非拟人头部混合形状
机构 * UCSC(加州大学圣克鲁兹分校) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAUST(阿卜杜拉国王科技大学) ; Snap Inc.(Snap公司)
专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR
AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
Token-to-Token对齐的文本嵌入用于语义融合
机构 * Tel Aviv University(特拉维夫大学) ; BRIA AI
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。
BodyReLux: 时序一致的全身人体视频重照明
机构 * Eyeline Labs(Eyeline实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出BodyReLux,一种基于视频扩散的框架,用于在时序一致的方式下重照明全身人体表演。该方法利用混合数据集训练,结合传统静态单光源捕捉和新型动态表演捕捉技术,通过引入新的光照条件表示方法和数据增强管道,实现了高质量、鲁棒且时序一致的视频重照明。
Comments Siggraph 2026 Journal Track. Project page: https://eyeline-labs.github.io/bodyrelux/
ViPS: 为自动绑定网格的视频感知姿态空间
机构 * Columbia University(哥伦比亚大学) ; University of Toronto(多伦多大学) ; Adobe Research(Adobe研究) ; University of Cambridge(剑桥大学) ; University College London(伦敦大学学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出ViPS,一种通过视频扩散模型提取运动先验来发现自动绑定网格有效姿态分布的前馈框架,实现了对多样形状变化、逆向运动学和动画的关键帧生成的支持。
Comments Project page: https://honglin-c.github.io/vips/
PIXLRelight: 通过内在条件实现可控的图像重照明
机构 * Department of Computer Science(计算机科学系) ; University of Oxford(牛津大学)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
AI总结 PIXLRelight通过内在条件将物理基础渲染与学习图像合成相结合,实现对单图像重照明的可控性,其核心方法是利用真实照片或PBR渲染得到的内在条件进行训练和推理,从而在保证图像细节的同时实现高质量的重照明效果。
Comments Project page: https://mlfarinha.github.io/pixl-relight/. Under review
具有学习密度控制的生成3D高斯
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出Density-Sampled Gaussians (DeG),通过学习概率密度函数实现3D表示的自适应密度控制,结合渲染监督优化空间密度和高斯属性,提升单图到3D生成的质量。
Comments 19 pages, 16 figures, SIGGRAPH Conference Papers '26
HairGPT: 基于发丝的语言自回归建模用于逼真3D发型合成
机构 * ShanghaiTech University(上海科技大学) ; ShanghaiTech University and Deemos Technology Co., Ltd.(上海科技大学和Deemos技术有限公司) ; Deemos Technology Co., Ltd.(Deemos技术有限公司)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 HairGPT通过发丝为中心的框架,将发型合成转化为双解耦的自回归序列建模问题,实现结构和语义的解耦,支持复杂发型合成与风格化领域适应。
Comments Accepted to SIGGRAPH 2026 (Journal Track)
TokenLight: 利用属性标记实现图像中的精确光照控制
机构 * Yale University(耶鲁大学) ; Adobe
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种图像再照明方法,通过属性标记编码多种光照属性,实现精确连续控制,并在合成和真实图像上验证了其性能。
Comments 32 pages, CVPR 2026, Project Page: https://vrroom.github.io/tokenlight/
GoT-R1:通过强化学习提升MLLM的视觉生成推理能力
机构 * HKU MMLAB(香港大学多媒体实验室) ; CUHK MMLAB(香港中文大学多媒体实验室) ; Sensetime(商汤科技) ; Beihang University(北京航空航天大学) ; SUAT(上海人工智能实验室)
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM
AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。
Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026
生成AI用于视频预告片合成:从提取启发式方法到自回归创造力
机构 * Google LLC(谷歌有限责任公司)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。
Comments 7 pages, 3 figures, accepted in WSDM 2026
LightMover:具有颜色和强度控制的生成式光移动
机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) ; Adobe Research(Adobe研究院) ; University of Hong Kong(香港大学) ; Yale University(耶鲁大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。
Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included
Sketch2Colab: 通过可控流蒸馏实现基于草图的多人体动画
机构 * IDEAS Lab, Department of Computer Science, Purdue University(普渡大学计算机科学系IDEAS实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 Sketch2Colab通过可控流蒸馏将故事板风格的2D草图转化为连贯的3D多人体运动,实现对代理、关节、时序和接触的精细控制,实验显示其在约束遵循和感知质量上优于基线方法。
Comments Accepted to CVPR 2026 Main Conference (11 pages, 8 figures)
通过零样本相机控制驯服视频模型以实现3D和4D生成
机构 * AGI Lab, Westlake University(西溪大学AGI实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。
Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/
Kimodo:可控制的人体运动生成
机构 * NVIDIA
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。
Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/
FlashMotion: 通过轨迹引导的少步可控视频生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。
Comments Accepted by CVPR2026
草图引导的风格化景观cinemagraph合成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 Sketch2Cinemagraph通过草图引导生成风格化景观cinemagraph,结合文本提示和运动草图控制,实现连续时间流动的高质量合成。
Comments 16 pages, 18 figures, accepted in Computer and Graphics
Journal ref Computers & Graphics,Volume 135,2026
通过文本到骨骼级联实现可控的复杂人类运动视频生成
机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) ; Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) ; School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) ; Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。
EchoMimicV2: 向更具冲击力、简化和半身的人体动画迈进
机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 EchoMimicV2通过简化条件和引入新的Audio-Pose动态和谐化策略,实现了具有冲击力的半身人体动画,并提出了新的评估基准。
Comments CVPR2025