arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2605.20209 2026-07-21 cs.GR cs.LG cs.RO 版本更新 83%

NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control

NaP-Control: 为多功能和快速字符控制导航扩散先验

Chia-Wen Chen, Yan Wu, Korrawe Karunratanakul, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出NaP-Control方法,通过强化学习操控任务无关的扩散策略先验的潜在噪声,实现快速、鲁棒且高保真的字符控制,同时通过环境交互优化任务奖励,提升成功率并适应挑战性场景。

Comments ECCV 2026. Project page: https://chiawenchen.github.io/nap-control-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04691 2026-07-07 cs.CV 新提交 83%

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation

从开环到闭环:用于参考一致图像生成的测试时迭代优化框架

Baixuan Zhao, Xinyu Zhang, Huayu Zheng, Shuaicheng Liu, Xiongkuo Min, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出测试时迭代优化框架,将参考一致图像生成转为闭环动态跟踪问题,用改进PID算法驱动传感器-控制器架构,迭代优化潜在控制信号,该方法无训练、模型无关且与现有扩散管道无缝集成。

Comments 24 pages, 15 figures. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22477 2026-06-23 cs.CV 新提交 83%

Physically-guided Image Generation for Multi-Projection Mapping

多投影映射的物理引导图像生成

Xingyun Liu, Yuqi Li, Jinhui Xiang, Pinyan Tang, Chong Wang

机构 * Ningbo University(宁波大学)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对投影映射中理想化2D生成与物理约束不匹配的问题,提出统一可控的物理引导生成框架ConPhyG,支持合作与对抗两种范式,通过注入多维物理先验或数值优化实现几何对齐、色域利用和语义保真度的显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07638 2026-06-09 cs.CV cs.AI 新提交 83%

Anchor-Conditioned Compositional Control for Landscape Image Generation

基于锚点条件的景观图像生成组合控制

Gadha Lekshmi P, Govind Arun, Rohith Syam, Ahmed Elgammal

机构 * Rutgers University–New Brunswick(罗格斯大学新布朗斯维克分校) University of Maryland–College Park(马里兰大学帕克分校) University of Technology Sydney(悉尼科技大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出锚点条件微调框架,通过解耦交叉注意力机制注入四维组合锚点向量,实现景观图像生成中的组合控制,在水平线检测和三分法对齐上取得最优性能。

Comments Accepted to the International Conference on Computational Creativity, ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27155 2026-05-28 cs.CV cs.AI 83%

Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection

通过修复进行语义鲁棒性探测:面向安全关键目标检测的交互工具

Nico Steckhan, Krutarth Prajapati, Weija Shao, Silvia Vock

机构 * Federal Institute for Occupational Safety and Health (BAuA)(联邦职业安全与健康研究所) Fraunhofer Institute for Manufacturing Engineering and Automation IPA(弗劳恩霍夫研究所(制造工程与自动化IPA))

专题命中 可控生成 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出SemProbe工具,通过扩散模型可控修复生成语义探针,支持用户自定义掩码和因素,自动评估并记录目标检测模型的鲁棒性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21611 2026-05-22 cs.CV cs.LG 83%

UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation

UniVL:统一的视觉-语言嵌入用于空间接地的上下文图像生成

Jiayun Wang, Yu Wang, Weijie Gan, Zhenting Wang, Wei Wei

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一的视觉-语言嵌入方法,通过单一的视觉输入直接将语义绑定到空间位置,从而减少计算并提高图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04746 2026-04-09 cs.CV 83%

Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning

以笔触而非像素思考:通过交错推理实现过程驱动的图像生成

Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang, Weifeng Chen, Markos Georgopoulos, Felix Juefei-Xu, Yuxiang Bao, Julian McAuley, Manling Li, Zecheng He

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of California, San Diego(加州大学圣迭戈分校) Worcester Polytechnic Institute(伍斯特理工学院) Northwestern University(西北大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出过程驱动的图像生成方法,通过交错推理轨迹分解合成过程,通过文本规划、视觉草图、文本反思和视觉细化四个阶段,使生成过程显式、可解释且可监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16483 2026-04-02 cs.CV 83%

Octree Diffusion for Semantic Scene Generation and Completion

八叉树扩散用于语义场景生成与补全

Xujia Zhang, Brendan Crowe, Christoffer Heckman

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Autonomous Robotics and Perception Group(自主机器人与感知实验室)

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出Octree Latent Semantic Diffusion框架,通过八叉树隐式表示实现跨域的3D语义场景补全、扩展和生成,结合结构扩散与语义扩散生成语义标签,无需重训练即可完成单扫描的补全与零样本泛化。

Comments Accepted to ICRA 2026. Revised version with updated paragraphs

Journal ref Proceedings of the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01949 2026-03-30 cs.CV 83%

IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout

IMAGHarmony:具有一致物体数量和布局的可控图像编辑

Fei Shen, Yutong Gao, Jian Yu, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 可控生成 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出IMAGHarmony,通过和谐感知模块和偏好引导噪声选择策略,在保持物体数量和布局一致性的前提下实现多物体场景的可控图像编辑,实验表明其在结构一致性和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25249 2026-03-27 cs.CV 83%

Semantic-Aware Prefix Learning for Token-Efficient Image Generation

语义感知的前缀学习用于令牌高效图像生成

Qingfeng Li, Haoxian Zhang, Xu He, Songlin Tang, Zhixue Fang, Xiaoqiang Liu, Pengfei Wan Guoqi Li

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SMAP,一种将语义条件注入查询式1D令牌化框架的令牌高效图像生成方法,通过尾令牌丢弃策略增强语义重要性,并引入CARD生成器验证其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23924 2026-03-26 cs.CV 83%

DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis

DepthArb: 无训练深度仲裁生成用于遮挡鲁棒图像合成

Hongjin Niu, Jiahao Wang, Xirui Hu, Weizhan Zhang, Lan Ma, Yuan Gao

机构 * School of Computer Science and Technology(计算机科学与技术学院) China Telecom(中国电信)

专题命中 可控生成 :image synthesis(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出DepthArb,通过仲裁交互对象的注意力竞争解决遮挡歧义,采用注意力仲裁调制和空间紧凑性控制机制,无需重新训练即可提升遮挡生成的准确性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10495 2026-03-24 cs.CV 83%

Training-Free Layout-to-Image Generation with Marginal Attention Constraints

无需训练的布局到图像生成与边缘注意力约束

Huancheng Chen, Jingtao Li, Weiming Zhuang, Haris Vikalo, Lingjuan Lyu

机构 * Sony AI(索尼人工智能) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MAC方法,无需额外模块或微调,通过边缘注意力约束优化潜在特征,提升布局生成的精确度和空间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19486 2026-03-23 cs.CV 83%

Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage

探索解耦和可控的人像图像合成:从端到端到分阶段

Zhengwentai Sun, Chenghong Li, Hongjie Liao, Xihe Yang, Keru Zheng, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

专题命中 可控生成 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种解耦可控的人像合成任务,通过分阶段框架提升可控性和泛化能力,优于端到端模型,适用于真实场景。

Comments A new version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15484 2026-03-18 cs.CV cs.AI 83%

RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance

RSGen: 通过多样边缘引导增强布局驱动的遥感图像生成

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

机构 * School of Future Science and Engineering, Soochow University, Suzhou, China(未来科学与工程学院,苏州大学) D-Robotics, Beijing, China(北京D-机器人) Fraunhofer Institute for Applied Information Technology, Sankt Augustin, Germany(弗劳恩霍夫应用信息技术研究所) School of Mathematical and Computing Sciences, Heriot-Watt University Malaysia, Putrajaya, Malaysia(数学与计算科学学院,赫瑞-瓦德大学马来西亚分校) Institute of Automation, Chinese Academy of Sciences, Beijing, China(自动化研究所,中国科学院北京分院)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 RSGen通过多样边缘引导提升布局驱动的遥感图像生成,增强细粒度控制并严格遵守边界框约束,实验表明其显著提升了现有L2I模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 83%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22150 2026-02-27 cs.CV 83%

CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation

CoLoGen:渐进式学习概念定位二元性以实现统一图像生成

YuXin Song, Yu Lu, Haoyuan Sun, Huanjin Yao, Fanglong Liu, Yifan Sun, Haocheng Feng, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CoLoGen通过渐进式学习概念与定位的二元性,实现统一图像生成的高效表示学习。

Comments Accepted by CVPR2026. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14377 2026-02-27 cs.CV 83%

RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers

RelaCtrl: 为扩散变换器实现相关性引导的高效控制

Ke Cao, Jing Wang, Ao Ma, Jiasong Feng, Xuanhua He, Run Ling, Haowei Liu, Jian Lu, Wei Feng, Haozhe Wang, Hongjuan Pei, Yihua Shao, Zhanjie Zhang, Jie Zhang

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 RelaCtrl通过相关性引导的方法优化扩散变换器的控制信号整合,减少参数和计算开销,提升生成效率。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21596 2026-02-26 cs.CV 83%

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

扩散变换器条件嵌入中的隐藏语义瓶颈

Trung X. Pham, Kang Zhang, Ji Woo Hong, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究揭示扩散变换器条件嵌入中的语义瓶颈,发现语义信息集中于少量维度,通过剪枝提升生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18309 2026-02-23 cs.CV 83%

Multi-Level Conditioning by Pairing Localized Text and Sketch for Fashion Image Generation

通过局部文本和草图配对实现多级条件生成时尚图像

Ziyue Liu, Davide Talon, Federico Girella, Zanxi Ruan, Mattia Mondo, Loris Bazzani, Yiming Wang, Marco Cristani

机构 * University of Verona(博洛尼亚大学) Polytechnic Institute of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Reykjavik University(雷克雅未克大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 LOTS通过结合全局草图指导与多级局部草图-文本对,提升时尚图像生成的结构准确性和局部语义指导能力。

Comments Project page: https://intelligolabs.github.io/lots/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10662 2026-02-12 cs.CV 83%

Dynamic Frequency Modulation for Controllable Text-driven Image Generation

动态频率调制用于可控的文本驱动图像生成

Tiandong Shi, Ling Zhao, Ji Qi, Jiayi Ma, Chengli Peng

机构 * School of Geosciences and Info-Physics of Central South University(中南大学地球科学与信息物理学院) School of Geography and Remote Sensing(地理科学与遥感学院) Electronic Information School(电子信息学院) School of Robotics(机器人学院)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的动态频率调制方法,通过操控噪声潜在变量实现可控的文本驱动图像生成,有效平衡结构保持与语义更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21498 2026-01-30 cs.CV cs.AI 83%

SimGraph: A Unified Framework for Scene Graph-Based Image Generation and Editing

SimGraph:基于场景图的图像生成与编辑统一框架

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南国家大学胡志明市分校) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 SimGraph通过整合基于场景图的生成与编辑,实现了对物体关系和空间布局的精准控制,提升图像生成与编辑的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14056 2026-01-21 cs.CV cs.AI 83%

POCI-Diff: Position Objects Consistently and Interactively with 3D-Layout Guided Diffusion

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21788 2026-01-21 cs.CV cs.AI 83%

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE:基于指令的低秩专家混合用于多条件图像生成

Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

机构 * ByteDance Inc.(字节跳动公司) Rutgers University(罗格斯大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 InstructMoLE通过指令引导的全局路由策略和输出空间正交损失,提升多条件图像生成任务的性能和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08623 2026-01-14 cs.CV cs.AI cs.CR cs.LG 83%

SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models

SafeRedir: 基于提示嵌入重定向的图像生成模型鲁棒去学习

Renyang Liu, Kangjie Chen, Han Qiu, Jie Zhang, Kwok-Yan Lam, Tianwei Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) CFAR and IHPC, A*STAR(CFAR和IHPC,A*STAR)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 SafeRedir通过提示嵌入重定向实现图像生成模型的鲁棒去学习,无需修改模型即可有效消除不安全内容并提升对抗性攻击抵抗力。

Comments Code at https://github.com/ryliu68/SafeRedir

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14031 2026-01-13 cs.CV 83%

FashionMAC: Deformation-Free Fashion Image Generation with Fine-Grained Model Appearance Customization

FashionMAC: 无变形的时尚图像生成与细粒度模型外观定制

Rong Zhang, Jinxiao Li, Jingnan Wang, Zhiwen Zuo, Jianfeng Dong, Wei Li, Chi Wang, Weiwei Xu, Xun Wang

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FashionMAC通过无变形的扩散框架实现高质量可控的时尚图像生成,采用RADA机制和链式掩码注入策略提升细粒度外观可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05546 2026-01-12 cs.CV 83%

MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation

MoGen:一种用于可控多对象图像生成的统一协作框架

Yanfeng Li, Yue Sun, Keren Fu, Sio-Kei Im, Xiaoming Liu, Guangtao Zhai, Xiaohong Liu, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MoGen通过区域语义锚和自适应多模态引导模块,实现了对多对象图像生成的可控性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02151 2026-01-12 cs.CV 83%

AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models

AttriCtrl: 细粒度控制扩散模型中的审美属性强度

Die Chen, Zhongjie Duan, Zhiwen Li, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 AttriCtrl通过轻量级框架实现扩散模型中审美属性的细粒度连续控制,提升生成图像的个性化与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00477 2025-12-24 cs.CV 83%

LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer

LAMIC:基于多模态扩散变换器可扩展性的布局感知多图像合成

Yuzhuo Chen, Zehua Ma, Jianhua Wang, Kai Kang, Shunyu Yao, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Onestory Team(Onestory团队) East China Normal University(华东师范大学)

专题命中 可控生成 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 LAMIC通过无训练方式实现多参考图像合成,提升布局控制与背景一致性。

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15069 2025-12-18 cs.CV cs.AI 83%

PMMD: A pose-guided multi-view multi-modal diffusion for person generation

PMMD: 一种基于姿态的多视角多模态扩散用于人物生成

Ziyu Shang, Haoran Liu, Rongchao Zhang, Zhiqian Wei, Tongtong Feng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Hong Kong, Hong Kong, China(香港城市大学) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

专题命中 可控生成 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11720 2025-12-15 cs.CV 83%

Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation

将音乐驱动的2D舞蹈姿态生成重新框架化为多通道图像生成

Yan Zhang, Han Zou, Lincong Feng, Cong Xie, Ruiqi Yu, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc(百度公司全球业务部)

专题命中 可控生成 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 将音乐驱动的2D舞蹈姿态生成重新框架化为多通道图像生成,通过时间共享索引和参考姿态条件策略提升生成质量与一致性

详情

展开后加载摘要…

URL PDF HTML 收藏