Optimal Birth Control for a Size-Structured Population Model with Diffusion
专题命中 可控生成 :diffusion(title)
Comments 21 pages
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :diffusion(title)
Comments 21 pages
专题命中 可控生成 :image generation(title)
Comments 4 page, 6 figures, CHI Play
专题命中 可控生成 :diffusion(title)
专题命中 可控生成 :diffusion(title)
Comments 15 pages, 2 figures
Journal ref Phys. Rev. B 99, 245106 (2019)
专题命中 可控生成 :diffusion(title)
专题命中 可控生成 :diffusion(title)
专题命中 可控生成 :diffusion(title)
专题命中 可控生成 :diffusion(title)
Comments arXiv admin note: text overlap with arXiv:1501.01903
专题命中 可控生成 :diffusion(title)
专题命中 可控生成 :diffusion(title)
TISC:用于忠实重建的文本驱动图像语义通信系统
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。
MapRoute++:用于视觉概念遗忘的代理引导语义路由
机构 * IIIT Hyderabad(印度信息技术学院海得拉巴分校) ; TCS Research(塔塔咨询服务公司研究院) ; NIT Silchar(锡尔卡尔国家理工学院)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对Genμ 2.0挑战视觉概念遗忘任务,在MapRoute基础上引入新训练目标、概念表示及语义路由,使模型在保留相关概念的同时提升概念移除效果,在官方基准上超越SOTA基线12.1%
Comments Accepted at Unlearning and Model Editing Workshop, ECCV 2026
擦除但保留:通过优化语义锚点实现版权动画角色的可控移除
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 针对文本到图像扩散模型的动画角色版权问题,本文提出基于优化语义锚点的可控擦除方法,实现了更优的擦除效果与图像保真度,支持多目标移除与模型迁移。
Comments Accepted to ACM MM 2026
基于可观测语义-图像接口与分层生成器证据对齐的生成式语义分割
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出Semantic Prism框架,通过可观测语义-图像接口与分层生成器证据对齐实现生成式语义分割,在Cityscapes等数据集上提升了分割精度与像素误差排名性能。
Comments 15 pages, 4 figures
基于VGGT先验的几何基础密集语义匹配研究
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。
Comments ECCV 2026
ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成
专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。
GOPI:面向生成的单视图RGB-D室内场景家具插入的3D位姿推理
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era AI实验室)
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本研究针对单视图RGB-D室内场景家具插入的不确定性问题,提出两阶段框架GOPI,通过数据驱动迭代推理实现合理3D位姿估计,结合几何引导生成策略,在3D放置和图像合成任务上均优于基线方法。
UniVVT:用于高保真视频虚拟试穿的统一端到端框架
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。
Comments 17 pages,21 figures
用于空间可控多视图室内场景重光照的解耦光照先验
机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII under InnoHK(创新香港研发平台下的CPII)
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。
代理分析:作为条件编码器的视觉语言模型中的定位信号
机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) ; Google DeepMind(谷歌DeepMind)
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。
Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop
基于全局蓝图引导和布局控制的高分辨率艺术作品外绘画
机构 * Hanyang University(汉阳大学)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 研究针对高分辨率艺术作品外绘画存在的问题,提出全局蓝图引导的两阶段扩散框架,通过布局适配器生成蓝图并提取特征,并行合成局部补丁,实现高效合成与布局控制,提升视觉保真度、语义一致性并减少推理时间。
Comments Accepted at ECCV2026
Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码
机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。
Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/
BrainNormalizer:通过边缘引导控制网络从肿瘤MRI进行解剖学信息伪健康脑重建
机构 * University of Pittsburgh(匹兹堡大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cedars-Sinai Medical Center(西德萨斯医疗中心) ; Mayo Clinic Arizona(梅奥诊所亚利桑那分部)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 针对脑肿瘤致结构变形难区分肿瘤与解剖变异问题,提出BrainNormalizer框架,用两阶段训练学习解剖先验等,通过特定策略实现伪健康脑重建,实验表明其有优势。
AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配
机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。
Comments Accepted by ECCV 2026
AC3S: 面向3D感知合成数据生成的自适应条件控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。
Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/
ISAC:无需训练的实例到语义注意力控制用于多实例生成
机构 * OGQ ; Seoul National University(首尔大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。
Comments Accepted to ECCV 2026
轨迹强制:具有可控语义轨迹的结构优先生成
机构 * University of Tübingen(图宾根大学) ; ETH Zürich(苏黎世联邦理工学院) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute(ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。
Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/
Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026
AnimeAdapter: 细粒度且一致的零样本动漫人物生成
机构 * National University of Singapore, Singapore(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。
ShowFlow: 从鲁棒的单概念到无条件的多概念生成
机构 * University of Science(科学大学) ; Vietnam National University(越南国家大学) ; Monash University(墨尔本大学) ; University of Dayton(Dayton大学)
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出ShowFlow框架,通过KronA-WED适配器和语义感知注意力正则化增强单概念生成,并利用SAMA和布局一致性指导实现无额外条件的多概念生成。
FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Nuvatech
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。