arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2605.09425 2026-05-12 cs.CV cs.AI 79%

AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation

AtteConDA:基于注意力的多条件扩散模型与合成数据增强中的冲突抑制

Shogo Noguchi

机构 * Gunma University(群马大学)

专题命中 可控生成 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本文提出AtteConDA方法,通过多条件生成模型处理图像生成中的条件冲突,提升结构保持能力,并建立驾驶任务的生成框架和评估协议,缓解高阶自动驾驶任务的数据稀缺问题。

Comments 44 pages, 20 figures. Code and project page available at: https://github.com/ShogoNoguchi/AtteConDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09024 2026-05-12 cs.CV cs.GR cs.MM eess.IV 67%

Relightable Gaussian Splatting for Virtual Production Using Image-Based Illumination

可重照明高斯点散布用于虚拟制作的基于图像的照明

Adrian Azzarelli, Nantheera Anantrasirichai, James Pollock, David R. Bull

机构 * University of Bristol, UK(英国布里斯托大学) Lux Aeterna, Bristol, UK(卢克斯艾特纳,布里斯托,英国)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出一种针对虚拟制作的3D重建与重照明框架,利用高斯点散布技术,通过已知背景图像条件重照明过程,避免使用环境映射,提高3D重建质量和可控性,方法高效且支持多种输出变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08824 2026-05-12 cs.GR cs.CV 62%

HairGPT: Strand-as-Language Autoregressive Modeling for Realistic 3D Hairstyle Synthesis

HairGPT: 基于发丝的语言自回归建模用于逼真3D发型合成

Haimin Luo, Min Ouyang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) ShanghaiTech University and Deemos Technology Co., Ltd.(上海科技大学和Deemos技术有限公司) Deemos Technology Co., Ltd.(Deemos技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 HairGPT通过发丝为中心的框架,将发型合成转化为双解耦的自回归序列建模问题,实现结构和语义的解耦,支持复杂发型合成与风格化领域适应。

Comments Accepted to SIGGRAPH 2026 (Journal Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV 57%

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 57%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 57%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02169 2026-05-12 cs.CV cs.DC cs.LG 57%

Heterogeneous Model Fusion for Privacy-Aware Multi-Camera Surveillance via Synthetic Domain Adaptation

异构模型融合用于隐私保护多摄像头监控的合成领域适应

Peggy Joy Lu, Wei-Yu Chen, Yao-Tsung Huang, Vincent Shin-Mu Tseng

机构 * Department of Computer Science and Information Engineering, National Chung Cheng University(资讯工程系,国立 Chung Cheng 大学) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国立阳明交通大学) National Center for High-Performance Computing(国家高速计算中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HeroCrystal框架,通过合成领域适应解决多摄像头目标检测中的隐私、类别不平衡和异构架构问题,提升定位精度并实现模型融合,实验表明其在多类别隐私保护设置下优于现有方法,mAP提升2.1%达33.4%。

Comments 42 pages, 13 figures. Published in Information Fusion (Elsevier). DOI: 10.1016/j.inffus.2026.104413

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14479 2026-05-12 physics.flu-dyn math.CV 50%

Metric Geometry Governs Optimal Control in Driven Stokes Flows: Magnetic Driving and Beyond

度量几何支配驱动斯托克斯流中的最优控制:磁驱动及其他

Kyle McKee

专题命中 可控生成 :diffusion(abstract)

AI总结 研究揭示在斯托克斯流中,洛伦兹力诱导的可调环流可通过度量几何确定最优控制路径,展现各向异性扩散特性,方法适用于通用驱动斯托克斯流。

Journal ref Phys. Rev. Lett. 136, 184001 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08928 2026-05-12 math.OC stat.ML 50%

Learning Generative Dynamics with Soft Law Constraints: A McKean-Vlasov FBSDE Approach

通过软法律约束学习生成动力学:一种 McKean-Vlasov FBSDE 方法

Samer El Boustany, Samy Mekkaoui, Yadh Hafsi, Alexandre Alouadi, Huyên Pham

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出通过 McKean-Vlasov 控制问题学习随机动力学,利用软能量约束强制终端和时间边际分布,通过 FBSDE 生成耦合的随机路径,验证了在低维和高维数据中生成符合观测分布的轨迹效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08906 2026-05-12 physics.flu-dyn 50%

Viscoelastic control of acoustic particle migration and trapping in microchannels

粘弹性控制微通道中声学粒子迁移与捕获

T. Sujith, A. K. Sen

专题命中 可控生成 :diffusion(abstract)

AI总结 研究粘弹性流体中声学辐射力与流体诱导拖曳的竞争作用,揭示粘弹性对粒子动态的调控机制,提出通过德布罗意数和粘性扩散数控制粒子迁移与捕获的新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏