arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2103.08399 2021-04-12 math.OC math.DS 71%

Optimal Birth Control for a Size-Structured Population Model with Diffusion

Manoj Kumar, Syed Abbas

专题命中 可控生成 :diffusion(title)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05914 2020-08-18 cs.HC 71%

crea.blender: A Neural Network-Based Image Generation Game to Assess Creativity

Janet Rafner, Arthur Hjorth, Sebastian Risi, Lotte Philipsen, Charles Dumas, Michael Mose Biskjær, Lior Noy, Kristian Tylén, Carsten Bergenholtz, Jesse Lynch, Blanka Zana, Jacob Sherson

专题命中 可控生成 :image generation(title)

Comments 4 page, 6 figures, CHI Play

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.06108 2019-07-03 math.OC 71%

Information Theoretic Model Predictive Control on Jump Diffusion Processes

Ziyi Wang, Grady Williams, Evangelos A. Theodorou

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.09996 2019-06-12 cond-mat.mes-hall 71%

Control of Spin Diffusion and Suppression of the Hanle Effect by the Coexistence of Spin and Valley Hall Effects

Xian-Peng Zhang, Chunli Huang, Miguel A. Cazalilla

专题命中 可控生成 :diffusion(title)

Comments 15 pages, 2 figures

Journal ref Phys. Rev. B 99, 245106 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.10786 2019-02-20 math.OC math.AP 71%

Phase portrait control for 1D monostable and bistable reaction-diffusion equations

Camille Pouchol, Emmanuel Trélat, Enrique Zuazua

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.06248 2017-03-21 math.AP 71%

A sufficient condition for the continuity of solutions to a logarithmic diffusion equation

Naian Liao

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.01213 2017-01-06 math.OC 71%

Risk-sensitive control of reflected diffusion processes on orthrant

Sunil Kumar Gauttam, K. Suresh Kumar, Chandan Pal

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.05870 2016-05-20 cs.SI physics.soc-ph 71%

Interests Diffusion on a Semantic Multiplex

Gregorio D'Agostino, Antonio De Nicola

专题命中 可控生成 :diffusion(title)

Comments arXiv admin note: text overlap with arXiv:1501.01903

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.01303 2016-04-07 cs.NI cs.PF 71%

C3PO: Computation Congestion Control (PrOactive) - an algorithm for dynamic diffusion of ephemeral in-network services

Liang Wang, Mario Almeida, Jeremy Blackburn, Jon Crowcroft

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1404.0207 2015-01-07 math.OC 71%

Approximate controllability for fractional diffusion equations by Dirichlet boundary control

Kenichi Fujishiro

专题命中 可控生成 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交 70%

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13478 2026-08-14 cs.CV 新提交 70%

MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

MapRoute++:用于视觉概念遗忘的代理引导语义路由

Ashok Urlana, L. D. M. S. Sai Teja, Vivek Hruday Kavuri, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad(印度信息技术学院海得拉巴分校) TCS Research(塔塔咨询服务公司研究院) NIT Silchar(锡尔卡尔国家理工学院)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对Genμ 2.0挑战视觉概念遗忘任务,在MapRoute基础上引入新训练目标、概念表示及语义路由,使模型在保留相关概念的同时提升概念移除效果,在官方基准上超越SOTA基线12.1%

Comments Accepted at Unlearning and Model Editing Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12806 2026-08-14 cs.CV cs.AI 新提交 70%

Erase but Preserve: Controllable Removal of Copyrighted Animation Characters via Optimized Semantic Anchors

擦除但保留:通过优化语义锚点实现版权动画角色的可控移除

Qiao Li, Xiaomeng Fu, Wangjia Yu, Runze He, Baisen Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型的动画角色版权问题,本文提出基于优化语义锚点的可控擦除方法,实现了更优的擦除效果与图像保真度,支持多目标移除与模型迁移。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11537 2026-08-13 cs.CV cs.AI cs.LG eess.IV 新提交 70%

Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment

基于可观测语义-图像接口与分层生成器证据对齐的生成式语义分割

Weize Cai, Yongqi Dong, Zhida Shao, Zixin Fu

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Semantic Prism框架,通过可观测语义-图像接口与分层生成器证据对齐实现生成式语义分割,在Cityscapes等数据集上提升了分割精度与像素误差排名性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21263 2026-08-12 cs.CV 版本更新 70%

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

基于VGGT先验的几何基础密集语义匹配研究

Songlin Yang, Tianyi Wei, Yushi Lan, Zeqi Xiao, Anyi Rao, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06878 2026-08-10 cs.CV 新提交 70%

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06836 2026-08-10 cs.CV 新提交 70%

GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes

GOPI:面向生成的单视图RGB-D室内场景家具插入的3D位姿推理

Ruifeng Zhai, Renjie Liu, Guangrun Wang, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对单视图RGB-D室内场景家具插入的不确定性问题,提出两阶段框架GOPI,通过数据驱动迭代推理实现合理3D位姿估计,结合几何引导生成策略,在3D放置和图像合成任务上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 70%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 70%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06162 2026-07-08 cs.CV 新提交 70%

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

基于全局蓝图引导和布局控制的高分辨率艺术作品外绘画

Junha Kim, Hyunjoon Park, Donghyeon Cho

机构 * Hanyang University(汉阳大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对高分辨率艺术作品外绘画存在的问题,提出全局蓝图引导的两阶段扩散框架,通过布局适配器生成蓝图并提取特征,并行合成局部补丁,实现高效合成与布局控制,提升视觉保真度、语义一致性并减少推理时间。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-07-07 cs.RO cs.AI cs.CV cs.LG 新提交 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12853 2026-07-07 eess.IV cs.CV 版本更新 70%

BrainNormalizer: Anatomy-Informed Pseudo-Healthy Brain Reconstruction from Tumor MRI via Edge-Guided ControlNet

BrainNormalizer:通过边缘引导控制网络从肿瘤MRI进行解剖学信息伪健康脑重建

Min Gu Kwak, Yeonju Lee, Hairong Wang, Kristin R. Swanson, Jing Li

机构 * University of Pittsburgh(匹兹堡大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Cedars-Sinai Medical Center(西德萨斯医疗中心) Mayo Clinic Arizona(梅奥诊所亚利桑那分部)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对脑肿瘤致结构变形难区分肿瘤与解剖变异问题,提出BrainNormalizer框架,用两阶段训练学习解剖先验等,通过特定策略实现伪健康脑重建,实验表明其有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交 70%

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 70%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新 70%

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22527 2026-06-23 cs.CV 新提交 70%

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

轨迹强制:具有可控语义轨迹的结构优先生成

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute(ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。

Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/

Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 70%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18493 2026-06-12 cs.CV 版本更新 70%

ShowFlow: From Robust Single Concept to Condition-Free Multi-Concept Generation

ShowFlow: 从鲁棒的单概念到无条件的多概念生成

Trong-Vu Hoang, Quang-Binh Nguyen, Thanh-Toan Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science(科学大学) Vietnam National University(越南国家大学) Monash University(墨尔本大学) University of Dayton(Dayton大学)

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出ShowFlow框架,通过KronA-WED适配器和语义感知注意力正则化增强单概念生成,并利用SAMA和布局一致性指导实现无额外条件的多概念生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12012 2026-06-11 cs.CV 新提交 70%

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Nuvatech

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏