An IQP Born Machine for Calorimeter Image Generation at 64 Qubits with Compiled-IQP Deployment
用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署
专题命中 可控生成 :image generation(title)
AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署
专题命中 可控生成 :image generation(title)
AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。
在均匀扰动的非光滑区域中具有诺伊曼边界条件的反应扩散方程全局吸引子的一致\(L^{\infty}\)有界性
专题命中 可控生成 :diffusion(title)
AI总结 研究一族在非光滑区域上具诺伊曼边界条件的半线性抛物方程,通过特定条件建立适定性与吸引子存在性,利用多种方法证明吸引子族\(L^\infty\)一致有界,且在区域体积收敛时关于强\(H^1\)拓扑在\(\mu = 0\)处上半连续。
Comments 27 pages
SQGen:基于潜变量调制量化张量列车的结构化量子图像生成
专题命中 可控生成 :image generation(title)
AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。
基于VGGT先验的几何基础密集语义匹配研究
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。
Comments ECCV 2026
BrainNormalizer:通过边缘引导控制网络从肿瘤MRI进行解剖学信息伪健康脑重建
机构 * University of Pittsburgh(匹兹堡大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cedars-Sinai Medical Center(西德萨斯医疗中心) ; Mayo Clinic Arizona(梅奥诊所亚利桑那分部)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 针对脑肿瘤致结构变形难区分肿瘤与解剖变异问题,提出BrainNormalizer框架,用两阶段训练学习解剖先验等,通过特定策略实现伪健康脑重建,实验表明其有优势。
ISAC:无需训练的实例到语义注意力控制用于多实例生成
机构 * OGQ ; Seoul National University(首尔大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。
Comments Accepted to ECCV 2026
AnimeAdapter: 细粒度且一致的零样本动漫人物生成
机构 * National University of Singapore, Singapore(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。
ShowFlow: 从鲁棒的单概念到无条件的多概念生成
机构 * University of Science(科学大学) ; Vietnam National University(越南国家大学) ; Monash University(墨尔本大学) ; University of Dayton(Dayton大学)
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出ShowFlow框架,通过KronA-WED适配器和语义感知注意力正则化增强单概念生成,并利用SAMA和布局一致性指导实现无额外条件的多概念生成。
潜在颜色子空间:高维混沌中的涌现秩序
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。
Comments Accepted at ICML 2026
通过文本和语义定义的分割提示灵活控制3D CT生成
机构 * Boston University School of Engineering(波士顿大学工程学院) ; Stanford University(斯坦福大学) ; University of Pittsburgh Medical Center(匹兹堡大学医学中心) ; Boston University School of Medicine(波士顿大学医学院)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。
风格感知的光泽控制用于生成非照片实感渲染
机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。
Comments Published in Computers & Graphics journal
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差
机构 * York University(约克大学) ; University of Guelph(圭尔夫大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。
Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
TASE: 用于3D场景理解与编辑的截断感知语义嵌入
机构 * Bosch Research(博世研究院) ; Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) ; University of Bonn(波恩大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。
Comments Code: https://github.com/boschresearch/TASE
SceneNAT:基于语言引导的室内场景合成的掩码生成模型
机构 * Seoul National University(首尔国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。
Comments Under review. Project page: https://scenenat.github.io
UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架
机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。
ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。
MetaView:基于尺度感知隐式几何先验的单目新视图合成
机构 * Nanyang Technological University(南洋理工大学) ; Kolors Team, Kuaishou Technology(快手科技色彩团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。
Comments accepted to ECCV 2026
视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件
机构 * Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Sun Yat-sen University(中山大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。
Comments 14 pages, 5 figures
大基础模型时代的手物交互:重建、生成与具身迁移
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。
3D场景自适应轨迹可控的人体图像动画与相机运动
机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) ; Ministry of Education(教育部) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; University of Warwick(沃林格大学) ; Zhejiang Yuexiu University(浙江越秀大学) ; University of Surrey(萨里大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)
CompoSE:通过部分感知控制进行3D形状的组合合成与编辑
机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) ; Adobe Research(Adobe研究)
专题命中 可控生成 :diffusion(abstract);分类 cs.GR
AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。
ActionParty:生成视频游戏中的多主体动作绑定
机构 * Snap Research(Snap研究院) ; University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。
Comments ECCV 2026 - Project page: https://action-party.github.io/
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/
BrainG3N:用于可控3D脑MRI生成的双用途分词器
机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) ; Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) ; Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出基于3D掩码自编码器的分词器,解耦编码器与解码器,在23项线性探测任务中21项超越SOTA,并支持条件生成和纵向预测。
前馈3D编辑从语义部分变换中学习
机构 * Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。
Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/
3D 中的疼痛:生成用于自动疼痛评估的可控合成面部
机构 * Vector Institute(向量研究所) ; KITE Research Institute(KITE研究机构) ; University Health Network(大学健康网络) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) ; Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。
OmniMotion-X:通用多模态全身运动生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。
Comments Accepted to CVPR 2026 Findings