arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2312.04461 2023-12-08 cs.CV cs.AI cs.LG cs.MM 79%

PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding

Zhen Li, Mingdeng Cao, Xintao Wang, Zhongang Qi, Ming-Ming Cheng, Ying Shan

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);personalized generation(abstract);分类 cs.CV、cs.MM

Comments Tech report; Project page: https://photo-maker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03048 2023-10-05 cs.CV cs.AI cs.CL cs.LG cs.MM 79%

Personalize Segment Anything Model with One Shot

Renrui Zhang, Zhengkai Jiang, Ziyu Guo, Shilin Yan, Junting Pan, Xianzheng Ma, Hao Dong, Peng Gao, Hongsheng Li

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments Code is available at https://github.com/ZrrSkywalker/Personalize-SAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08446 2026-08-11 cs.AI 新提交 78%

TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation

TRACE-Memory:用于个性化生成的公共条件检索与效用感知证据接纳

Jing Wang, Zhu Wang, Yifan Guo, Yulong Yang, Yunji Liang

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 该研究针对个性化生成系统中记忆使用的效用问题,提出TRACE-Memory两阶段框架,经多阶段训练后在三类数据集的4500个任务上表现优于多种记忆使用方法,支持选择性个性化。

Comments 9 pages, 4 figures, and 6 tables. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04140 2026-08-06 eess.AS cs.CL 版本更新 78%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25750 2026-07-29 cs.LG cs.CY 新提交 78%

Detecting CSAM Text-to-Image LoRAs From Weights

从权重中检测用于生成儿童性虐待材料的文本到图像的LoRA

David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly Mai

专题命中 个性化与一致性 :text-to-image(title);image generation(abstract)

AI总结 研究如何从权重中检测用于生成CSAM的文本到图像的LoRA,利用LoRA更新的左上角奇异向量形成的指纹$u_1$,以人类主体年龄为代理,发现其能识别训练内容、跨模型泛化且对良性内容不判断,可直接从权重筛选有害LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07533 2026-07-09 cs.RO 新提交 78%

Generating Personalized Lower-Limb Kinematics Across Walking Speeds Using Subject-Conditioned Diffusion

使用受主体条件约束的扩散生成跨步行速度的个性化下肢运动学

Diya Dinesh, Adrian Krieger, Changseob Song, Dongho Park, Aaron J. Young, Inseung Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 研究针对个性化外骨骼辅助需特定用户步态数据收集难的问题,提出受主体条件约束的残差扩散框架,能从单一已知速度步态序列生成未知速度下的个性化下肢运动学,减少数据收集负担,提升跨速度步态合成精度。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24197 2026-07-07 cs.CL cs.AI 版本更新 78%

Seeing Is No Longer Believing: Frontier Image Generation Models, Synthetic Visual Evidence, and Real-World Risk

看到不再等于相信:前沿图像生成模型、合成视觉证据与现实世界风险

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 个性化与一致性 :image generation(title,abstract)

AI总结 本文探讨前沿图像生成模型带来的合成视觉证据风险,分析其对社会信任的影响,并提出多层面的控制措施以降低现实世界中的潜在危害。

Comments Technical report. 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24119 2026-06-24 cs.LG cs.CL 新提交 78%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30312 2026-05-29 cs.CR 78%

DP-SAPF: Saliency-Aware Parameter Fine-tuning of Public Models for Differentially Private Image Synthesis

DP-SAPF: 面向差分隐私图像合成的公共模型显著性感知参数微调

Chen Gong, Kecen Li, Zinan Lin, Tianhao Wang

专题命中 个性化与一致性 :image synthesis(title,abstract)

AI总结 提出DP-SAPF方法,通过显著性感知策略选择公共模型中最关键的参数进行低秩适应(LoRA)微调,在差分隐私图像合成中减少噪声积累并提升合成图像的效用和保真度。

Comments Accepted at Usenix Security 2026; code available at https://github.com/2019ChenGong/DP-SAPF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29716 2026-05-29 cs.AI 78%

NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs

NaRA: 面向扩散大语言模型参数高效微调的噪声感知LoRA

Shuaidi Wang, Zhan Zhuang, Ruping Huang, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系,香港,中国) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港理工大学计算机科学与工程系,香港,中国)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对扩散大语言模型,提出噪声感知低秩适配(NaRA),通过噪声条件超网络生成低秩核心矩阵,实现沿去噪轨迹连续变化的更新矩阵,在常识推理、数学推理和代码生成基准上优于噪声无关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16219 2026-03-18 cs.CL 78%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21219 2026-02-26 cs.CL cs.AI 78%

Reasoning-Based Personalized Generation for Users with Sparse Data

基于推理的稀疏数据用户个性化生成

Bo Ni, Branislav Kveton, Samyadeep Basu, Subhojyoti Mukherjee, Leyao Wang, Franck Dernoncourt, Sungchul Kim, Seunghyun Yoon, Zichao Wang, Ruiyi Zhang, Puneet Mathur, Jihyung Kil, Jiuxiang Gu, Nedim Lipka, Yu Wang, Ryan A. Rossi, Tyler Derr

机构 * Vanderbilt University(范德比尔特大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07713 2026-01-27 cs.CL 78%

MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation

MemWeaver: 一种从文本交互行为构建的分层记忆用于个性化生成

Shuo Yu, Mingyue Cheng, Daoyu Wang, Qi Liu, Zirui Liu, Ze Guo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 MemWeaver通过构建分层记忆模型,利用文本交互行为捕捉用户兴趣的时间演变和语义关系,实现深度个性化内容生成。

Comments Accepted by The Web Conference 2026 (WWW'26) 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17569 2026-01-27 cs.CL cs.AI cs.CR cs.IR 78%

Improving User Privacy in Personalized Generation: Client-Side Retrieval-Augmented Modification of Server-Side Generated Speculations

提升个性化生成中的用户隐私:客户端侧的检索增强修改服务器侧生成的推测

Alireza Salemi, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 P³通过客户端侧检索增强修改服务器侧生成的推测,实现高质量个性化生成并提升隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13846 2026-01-21 cs.AI cs.CY cs.LG 78%

Virtual Urbanism: An AI-Driven Framework for Quantifying Urban Identity. A Tokyo-Based Pilot Study Using Diffusion-Generated Synthetic Environments

虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境

Glinskaya Maria

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23924 2025-09-30 cs.CL cs.AI 78%

Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step

Jingyi Yang, Guanxu Chen, Xuhao Hu, Jing Shao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(title,abstract)

Comments 10 pages, 4 figures, 7 tables. Code: https://github.com/yjyddq/EOSER-ASS-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15242 2025-06-23 cs.HC 78%

Agonistic Image Generation: Unsettling the Hegemony of Intention

Andrew Shaw, Andre Ye, Ranjay Krishna, Amy X. Zhang

专题命中 个性化与一致性 :image generation(title,abstract)

Comments Accepted to ACM Fairness, Accountability, Transparency 2025 -- Athens, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02614 2025-06-03 cs.IR 78%

Personalized Generation In Large Model Era: A Survey

Yiyan Xu, Jinghao Zhang, Alireza Salemi, Xinting Hu, Wenjie Wang, Fuli Feng, Hamed Zamani, Xiangnan He, Tat-Seng Chua

专题命中 个性化与一致性 :personalized generation(title,abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07463 2025-03-11 cs.HC 78%

GenAIReading: Augmenting Human Cognition with Interactive Digital Textbooks Using Large Language Models and Image Generation Models

Ryugo Morita, Ko Watanabe, Jinjia Zhou, Andreas Dengel, Shoya Ishimaru

专题命中 个性化与一致性 :image generation(title,abstract)

Comments Accepted at AHs2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02352 2024-12-04 cs.LG 78%

LoRA Diffusion: Zero-Shot LoRA Synthesis for Diffusion Model Personalization

Ethan Smith, Rami Seid, Alberto Hojel, Paramita Mishra, Jianbo Wu

专题命中 个性化与一致性 :diffusion(title);text-to-image(abstract)

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14739 2024-08-29 cs.SD eess.AS 78%

VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech

Heeseung Kim, Sang-gil Lee, Jiheum Yeom, Che Hyun Lee, Sungwon Kim, Sungroh Yoon

专题命中 个性化与一致性 :diffusion(title,abstract)

Comments INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02668 2024-06-06 quant-ph 78%

Latent Style-based Quantum GAN for high-quality Image Generation

Su Yeon Chang, Supanut Thanasilp, Bertrand Le Saux, Sofia Vallecorsa, Michele Grossi

专题命中 个性化与一致性 :image generation(title,abstract)

Comments 28 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17436 2023-10-10 eess.AS 78%

Creating Personalized Synthetic Voices from Post-Glossectomy Speech with Guided Diffusion Models

Yusheng Tian, Guangyan Zhang, Tan Lee

专题命中 个性化与一致性 :diffusion(title,abstract)

Comments submitted to INTERSPEECH 2023

Journal ref INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04301 2023-07-12 cs.SD eess.AS 78%

Interpretable Style Transfer for Text-to-Speech with ControlVAE and Diffusion Bridge

Wenhao Guan, Tao Li, Yishuang Li, Hukai Huang, Qingyang Hong, Lin Li

专题命中 个性化与一致性 :diffusion(title,abstract)

Comments Accepted at Interspeech2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10830 2023-05-19 cs.AI 78%

Constructing a personalized AI assistant for shear wall layout using Stable Diffusion

Lufeng Wang, Jiepeng Liu, Guozhong Cheng, En Liu, Wei Chen

专题命中 个性化与一致性 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08460 2026-08-11 cs.CV 新提交 77%

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

InstructionCrafter:生成一致且高保真的视觉指令

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

机构 * University of Tsukuba(筑波大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03410 2026-06-05 cs.CV 77%

UnHype: CLIP-Guided Hypernetworks for Dynamic LoRA Unlearning

UnHype: 基于CLIP的超网络用于动态LoRA反学习

Piotr Wójcik, Maksym Petrenko, Wojciech Gromski, Przemysław Spurek, Maciej Zieba

机构 * Institute of Computer Science, University of Warsaw(华沙大学计算机科学研究所)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出UnHype框架,通过将超网络引入单概念和多概念LoRA训练,解决传统LoRA方法在概念语义适应性差、难以平衡删除相关概念与保持泛化能力以及多概念同时删除时的可扩展性问题,展示了在物体擦除、名人擦除和色情内容删除等任务中的有效性。

Comments 23 pages, 11 figures. Accepted at ICML 2026. Code: https://github.com/gmum/UnHype/ Project Page: https://gmum.github.io/UnHype/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03792 2026-06-03 cs.CV cs.LG 77%

Training-Free Multi-Concept LoRA Composition with Prompt-Aware Weighting

免训练的多概念LoRA组合与提示感知加权

Georgios Tsoumplekas, Stella Bounareli, Vasileios Argyriou

机构 * Department of Networks and Digital Media, Kingston University London, UK(网络与数字媒体系,金史密斯大学伦敦分校)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种免训练的提示感知加权策略,通过优化组合多个LoRA模块的输出实现多概念定制,提升图像质量和概念保真度。

Comments Accepted at IEEE FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09460 2026-05-12 cs.CV cs.AI 77%

When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation

几步即可:无需训练的身份保持生成加速

Dongqi Zheng

机构 * FLUX Diffusion Transformer(FLUX扩散变换器) InfuseNet

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出无需训练的轻量化策略,通过替换扩散模型骨干网络和禁用分类器自由引导,显著提升身份保持生成的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18537 2026-04-21 cs.CV 77%

MetaCloak-JPEG: JPEG-Robust Adversarial Perturbation for Preventing Unauthorized DreamBooth-Based Deepfake Generation

MetaCloak-JPEG:用于防止未经授权的基于DreamBooth的深度伪造生成的JPEG鲁棒对抗扰动

Tanjim Rahaman Fardin, S M Zunaid Alam, Mahadi Hasan Fahim, Md Faysal Mahfuz

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对DreamBooth驱动的文本到图像合成,提出MetaCloak-JPEG,通过在JPEG压缩管道中引入可微JPEG层,提升对抗扰动效果,实现高PSNR和高JPEG生存率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏