Generating Person Images with Appearance-aware Pose Stylizer
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Appearing at IJCAI 2020. The code is available at https://github.com/siyuhuang/PoseStylizer
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Appearing at IJCAI 2020. The code is available at https://github.com/siyuhuang/PoseStylizer
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments Eurographics 2020 survey paper
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments Additional results: http://www.krematas.com/nvr/index.html
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
Comments CVPR 2020
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments 15 pages, 20 figures
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
Comments TOG 2019, http://sniklaus.com/kenburns
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Github: https://github.com/Prinsphield/GeneGAN
文本嵌入插值在连续图像操控中的不合理有效性
机构 * Reve
专题命中 可控生成 :image editing(abstract);分类 cs.CV;diffusion(comments)
AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。
Comments Project Page: https://yigitekin.github.io/diffusion-sliders
SPATIALGEN: 布局引导的3D室内场景生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Manycore Tech Inc(Manycore科技公司)
专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV
AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。
Comments 3D scene generation; diffusion model; Scene reconstruction and understanding
专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV
Comments Workshop summary paper for ICCV 2025, 9 accepted papers, 9 figures, IEEE conference format, covers topics including diffusion models, controllable generation, 3D-aware disentanglement, autonomous driving applications, and EEG analysis
SplatGuide:用于无姿态新视图合成的3D高斯几何先验
机构 * Aalto University(阿尔托大学) ; Deep Render(深度渲染公司) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Nokia Technologies(诺基亚技术公司) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。
SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成
机构 * Kuaishou Technology(快手科技)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。
Comments 9 pages, 5 figures
时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡
机构 * East China Normal University(华东师范大学) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) ; School of Statistics, East China Normal University(华东师范大学统计学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。
ES3D:将语义嵌入3D空间以实现组件感知编辑
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差
机构 * York University(约克大学) ; University of Guelph(圭尔夫大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。
Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)
学习型分频光谱金属镜用于可见光波段无遮挡广谱成像
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本研究提出学习型分频光谱金属镜,实现可见光波段无遮挡广谱成像,提升物体检测和分割精度。
Journal ref Nature Communications 2026
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
有限资源下自监督图像与视频预训练的对照研究
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
SeFaR:面向深度神经网络的语义特征感知鲁棒性测试
机构 * University of Virginia(弗吉尼亚大学) ; KBR Inc.(KBR公司) ; NASA Ames(美国国家航空航天局艾姆斯研究中心) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。
TASE: 用于3D场景理解与编辑的截断感知语义嵌入
机构 * Bosch Research(博世研究院) ; Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) ; University of Bonn(波恩大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。
Comments Code: https://github.com/boschresearch/TASE
SceneNAT:基于语言引导的室内场景合成的掩码生成模型
机构 * Seoul National University(首尔国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。
Comments Under review. Project page: https://scenenat.github.io
SynVAR:在视觉自回归模型中协同空间与语义对齐
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Western University(西安大略大学) ; JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。
Comments Accepted by ECCV 2026
NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。
Comments 21 pages, 6 figures
UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架
机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
EmoWorld:用于可控情感视频生成的解耦情感场
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。