Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation
多模态引导的3D人像生成双扩散模型
机构 * Beihang University(北航大学) ; KAUST(卡塔尔科技大学)
AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。
Comments 18 pages, 10 figures
高校专区
多模态引导的3D人像生成双扩散模型
机构 * Beihang University(北航大学) ; KAUST(卡塔尔科技大学)
AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。
Comments 18 pages, 10 figures
通过无监督关键点定位实现面部动画中的运动操控
机构 * BUAA(北京航空航天大学) ; KAUST(卡塔尔大学)
AI总结 本文提出MMFA方法,通过无监督关键点定位解耦身份语义与运动信息,实现可控的面部动画生成与表达操控。
Comments 19 pages, 15 figures
无偏动态剪枝用于高效基于群体的策略优化
机构 * Beihang University(北航大学) ; Zhongguancun Academy(中关村学院) ; Communication University of China(中国通信大学)
AI总结 DPPO通过动态剪枝和重要性采样修正,实现高效基于群体的策略优化,提升训练速度并提高准确率。
Comments 20 pages, 4 figures
不确定性重编码:面向鲁棒事件-RGB分割的边缘感知语义一致性
机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,SCSE与QRI,北京航空航天大学) ; School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
AI总结 本文提出边缘感知语义一致性框架,通过重编码和不确定性优化实现鲁棒的事件-RGB分割,提升极端条件下的分割性能。
Comments Accepted to NeurIPS 2025; code and datasets available at https://github.com/iCVTEAM/ESC
TIGeR: 视觉-语言模型中集成工具的几何推理
机构 * Beihang University(北洋大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)
AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。
Comments 8 pages, 6 figures
事实性至关重要:当图像生成与编辑遇见结构化视觉
机构 * CUHK MMLab(香港大学多模态实验室) ; Beihang University(北京航空航天大学) ; Krea AI(Krea人工智能) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; Hugging Face ; National University of Singapore(新加坡国立大学) ; ByteDance(字节跳动) ; The University of Hong Kong(香港大学)
AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。
Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io