arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2604.01361 2026-04-03 cs.CV 79%

IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation

IGLOSS:面向激光雷达开放词汇语义分割的图像生成

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,用于3D汽车激光雷达数据的零样本开放词汇语义分割。通过文本生成图像创建原型,利用2D视觉基础模型提取3D网络特征,实现点云标注,方法在nuScenes和SemanticKITTI上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27115 2026-03-31 cs.CV 79%

SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation

SJD-VP:带有验证预测的推测雅可比解码

Bingqi Shan, Baoquan Zhang, Xiaochen Qi, Xutao Li, Yunming Ye, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Perceptual Intelligence, Pengcheng Laboratory, Shenzhen(鹏城实验室感知智能研究所)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出SJD-VP,通过利用token概率变化指导采样,提升验证通过率,加速自回归生成并提高图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 79%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 可控生成 :generative vision(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19227 2026-03-20 cs.CV 79%

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18001 2026-03-19 cs.CV 79%

EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding

EchoGen:基于循环一致性的统一布局-图像生成与理解学习

Kai Zou, Hongbo Liu, Dian Zheng, Jianxiong Gao, Zhiwei Zhao, Bin Liu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Tongji University(同济大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出EchoGen框架,通过统一模型联合训练布局到图像生成和图像定位任务,提升生成图像的布局准确性与文本描述一致性,同时增强图像定位的鲁棒性。

Comments 9 pages, Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(16), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16576 2026-03-18 cs.CV cs.AI cs.CR cs.LG 79%

REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models

REFORGE:多模态攻击揭示图像生成模型中的脆弱概念反向学习

Yong Zou, Haoran Li, Fanxiao Li, Shenyang Wei, Yunyun Dong, Li Tang, Wei Zhou, Renyang Liu

机构 * Yunnan University(云南大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 REFORGE通过对抗性图像提示评估图像生成模型反向学习的鲁棒性,揭示现有方法的持续漏洞,提出更高效的多模态对抗攻击策略。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14957 2026-03-17 cs.CV 79%

CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models

CyCLeGen:视觉基础模型中的循环一致布局预测与图像生成

Xiaojun Shan, Haoyu Shen, Yucheng Mao, Xiang Zhang, Abhay Anand, Bingnan Li, Haiyang Xu, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 CyCLeGen是一种统一的视觉-语言基础模型,通过单一自回归框架实现图像理解和生成,采用循环一致学习确保生成与布局之间的双向一致性,提升模型的自我反思能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14241 2026-03-17 cs.CV 79%

CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control

CamLit:统一的视频扩散模型,具有显式相机和光照控制

Zhiyi Kuang, Chengan He, Egor Zakharov, Yuxuan Xue, Shunsuke Saito, Olivier Maury, Timur Bagautdinov, Youyi Zheng, Giljoo Nam

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24980 2026-03-16 cs.CV 79%

SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation

SDPose:利用扩散先验进行跨域和鲁棒姿态估计

Shuang Liang, Jing He, Chuanmeizhi Wang, Lejun Liao, Guo Zhang, Yingcong Chen, Yuan Yuan

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 SDPose通过分析不同上采样层次的潜在特征,提取鲁棒的U-Net特征并融合轻量级模块,结合关键点热图监督和辅助潜变量重建损失,实现跨域姿态估计的鲁棒性和泛化能力。

Comments 22 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13702 2026-03-12 cs.CV cs.AI 79%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02182 2026-03-12 q-bio.NC cs.CV cs.LG 79%

Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion

通过互信息引导的扩散模型揭示高级视觉皮层潜在群体的语义选择性

Yule Wang, Joseph Yu, Chengrui Li, Weihan Li, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MIG-Vis通过互信息引导的扩散模型揭示高级视觉皮层中神经潜在群体的语义选择性,提供结构化语义表示的直接证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21363 2026-03-10 cs.CV 79%

Efficient Diffusion-Based 3D Human Pose Estimation with Hierarchical Temporal Pruning

高效扩散模型基于层次时间剪枝的3D人体姿态估计

Yuquan Bi, Hongsong Wang, Xinli Shi, Zhipeng Gui, Jie Gui, Yuan Yan Tang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Computer Science and Engineering, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院、新一代人工智能技术及其交叉应用国家重点实验室) National Center for Applied Mathematics, Southeast University(东南大学应用数学国家中心) Purple Mountain Laboratories, Nanjing(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学)) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Faculty of Science and Technology, UOW College Hong Kong(香港大学学院科技学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种高效扩散模型基于层次时间剪枝的3D人体姿态估计方法,通过分阶段剪枝策略显著降低计算成本并提升推理效率。

Comments Accepted by IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHOLOGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01153 2026-03-06 cs.CV cs.AI cs.LG 79%

DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling

DPAC:分布保持对抗控制用于扩散采样

Han-Jin Lee, Han-Ju Lee, Jin-Seong Kim, Seok-Hwan Choi

机构 * Yonsei University(延世大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 DPAC通过在切空间上投影对抗梯度,保持分布并提升扩散采样质量,理论和实验均验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08344 2026-03-06 cs.CV cs.AI cs.HC 79%

SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition

SASG-DA:基于稀疏性的语义引导扩散增强用于肌电信号手势识别

Chen Liu, Can Han, Weishi Xu, Yaqi Wang, Dahong Qian

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(电子设计自动化技术创新中心,杭州电子科技大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 SASG-DA通过稀疏感知语义引导扩散增强方法,提升sEMG手势识别的样本忠实性和多样性,从而提高模型泛化能力。

Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI 79%

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 79%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 79%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08725 2026-02-10 cs.CV 79%

FusionEdit: Semantic Fusion and Attention Modulation for Training-Free Image Editing

FusionEdit: 基于语义融合与注意力调节的无训练图像编辑

Yongwen Lai, Chaoqun Wang, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image editing(title,abstract);分类 cs.CV

AI总结 FusionEdit通过语义融合与注意力调节实现无训练图像编辑,提升编辑精度与可控性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01758 2026-02-06 cs.CV 79%

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

许多对许多:统一多个视频和图像生成与操控任务的训练

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * ByteDance(字节跳动) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出many-for-many框架,通过统一训练多个视频和图像生成与操控任务,提升视频生成性能并引入深度图条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15259 2026-02-06 cs.CV cs.AI 79%

Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation

从扩散模型中引入多样性以实现语义引导的面部资产生成

Yunxuan Cai, Sitao Xiang, Zongjian Li, Haiwei Chen, Yajie Zhao

机构 * University of Southern California, USC Institute for Creative Technologies(美国南加州大学,USC创意技术研究所) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种语义可控的生成网络,通过扩散模型生成高质量3D面部数据库,并开发了高效的GAN基生成器,用于创建和编辑高质量面部资产。

Comments Accepted Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03126 2026-02-04 cs.CV 79%

Flexible Geometric Guidance for Probabilistic Human Pose Estimation with Diffusion Models

基于扩散模型的灵活几何引导用于概率人体姿态估计

Francis Snelgar, Ming Xu, Stephen Gould, Liang Zheng, Akshay Asthana

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院) Seeing Machines

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的灵活几何引导方法,用于概率人体姿态估计,通过引导框架实现从2D图像中生成一致的3D姿态,无需配对数据训练,展示了在多个数据集上的高性能和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22838 2026-02-02 cs.CV 79%

Neural Clothing Tryer: Customized Virtual Try-On via Semantic Enhancement and Controlling Diffusion Model

神经服装试穿器:通过语义增强和控制扩散模型实现定制虚拟试穿

Zhijing Yang, Weiwei Zhang, Mingliang Yang, Siyuan Peng, Yukai Shi, Junpeng Tan, Tianshui Chen, Liruo Zhong

机构 * Guangdong University of Technology, Guangzhou 510006, China Guangdong Provincial Key Laboratory of Intellectual Property \& Big Data, Guangzhou 510006, China South China University of Technology, Guangzhou 510006, China Genstoraige Technology (Beijing) Co., Ltd, Beijing 100000, China

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NCT框架,通过语义增强和控制扩散模型实现定制虚拟试穿,提升虚拟试穿体验的灵活性和参与度。

Comments Accepted by Expert Systems with Applications. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21633 2026-01-30 cs.CV 79%

A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion

倾斜的锯齿:重新审视自动编码器在可控扩散中的权衡

Pu Cao, Yiyang Ma, Feng Zhou, Xuedan Yin, Qing Song, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了自动编码器在可控扩散中的权衡问题,发现gFID指标在可控性评估中表现不佳,而重建导向的指标更能反映可控性,提出了更可靠的评估方法。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13245 2026-01-21 cs.CV 79%

CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation

CymbaDiff:基于结构化的空间扩散用于基于草图的3D语义城市场景生成

Li Liang, Bo Miao, Xinyu Wang, Naveed Akhtar, Jordan Vice, Ajmal Mian

机构 * The University of Western Australia(西澳大学) AIML, The University of Adelaide(阿德莱德大学) The University of Melbourne(墨尔本大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CymbaDiff通过结构化空间扩散提升基于草图的3D语义城市场景生成的语义一致性与空间真实性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05124 2026-01-09 cs.CV 79%

Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

Re-Align:基于结构化推理的对齐方法用于上下文图像生成与编辑

Runze He, Yiji Cheng, Tiankai Hang, Zhimin Li, Yu Xu, Zijin Yin, Shiyi Zhang, Wenxun Dai, Penghui Du, Ao Ma, Chunyu Wang, Qinglin Lu, Jizhong Han, Jiao Dai

机构 * Hunyuan, Tencent(腾讯文库) IIE, CAS(中国科学院信息工程研究所) UCAS Project Page(中国科学技术大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 Re-Align通过结构化推理引导的对齐方法,提升上下文图像生成与编辑任务的性能。

Comments 13 pages, 9 figures, project page: https://github.com/hrz2000/realign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03955 2026-01-08 cs.CV 79%

ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation

ResTok: 在1D视觉分词器中学习层次化残差以实现自回归图像生成

Xu Zhang, Cheng Da, Huan Yang, Kun Gai, Ming Lu, Zhan Ma

机构 * Vision Lab, Nanjing University(南京大学视觉实验室) Kolors Team, Kuaishou Technology(快手技术Kolors团队)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ResTok通过引入层次化残差机制提升自回归图像生成效果,实现更高效的潜在分布建模与生成过程。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01535 2026-01-06 cs.CV 79%

Improving Flexible Image Tokenizers for Autoregressive Image Generation

改进灵活的图像标记器以用于自回归图像生成

Zixuan Fu, Lanqing Guo, Chong Wang, Binbin Song, Ding Liu, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Harbin Institute of Technology(哈尔滨工业大学) Meta AI

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ReToK通过冗余标记填充和层次语义正则化改进灵活图像标记器,提升自回归图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05710 2026-01-01 cs.CV 79%

EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal Model

EmotiCrafter:基于愉悦-唤醒模型的文本到情感图像生成

Shengqi Dang, Yi He, Long Ling, Ziqing Qian, Nanxuan Zhao, Nan Cao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Adobe Research(Adobe研究院)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 EmotiCrafter基于Valence-Arousal模型,通过文本提示和情感值生成情感丰富的图像,提升情感表达的准确性和可控性。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21268 2025-12-25 cs.CV 79%

ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision

ACD: 通过注意力监督实现视频扩散模型的直接条件控制

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Yonsei University(延世大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏