arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2606.10620 2026-06-10 cs.CV cs.AI 新提交 57%

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准

Xinrui Wu, Lichen Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08780 2026-06-09 cs.CV 新提交 57%

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

超越一致性:在零样本视频编辑中保留时间结构

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

机构 * Anhui University(安徽大学) University of Surrey(萨里大学) University of Warwick(华威大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种零样本视频编辑方法,通过自适应分割视频片段、选取锚帧和令牌合并策略,首次显式保留源视频的时间结构,平衡编辑保真度与计算效率。

Journal ref Pattern Recognition, Vol. 180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07185 2026-06-08 cs.CV 新提交 57%

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

AdaTok: 具有质量保持动态令牌的自预算图像令牌化

Xiaocheng Lu, Yuxi Chen, Jie Zhang, Jian Liu, Jingcai Guo, Fangqi Zhu, Tao Han, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出AdaTok,一种自预算离散一维令牌化器,通过表示-分配协同设计(优先表示学习和自适应令牌分配)实现图像自适应令牌数量,在保持重建质量的同时减少平均令牌数。

Comments Preprint; 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15287 2026-06-08 cs.CV 版本更新 57%

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04881 2026-06-04 cs.CV cs.AI 57%

DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance

DiverAge: 基于跨年龄身份关系引导的可靠多元人脸老化

Yueying Zou, Peipei Li, Qianrui Teng, Dianyan Xu, Zekun Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) School of Computer Science, University of California, Santa Barbara(计算机科学学院,加州大学圣芭芭拉分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散自编码的分层多元人脸老化框架DiverAge,通过随机扩散解码和年龄条件语义调制保持外观多样性,并引入跨年龄身份关系调节器(CARR)在推理时引导去噪,以提升序列级有序可靠性。

Comments 11 pages,10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04797 2026-06-04 cs.CV cs.LG 57%

Crafting Your Evolving Dreams: Concept-Incremental Versatile Customization

打造你不断演变的梦想:概念增量式多功能定制

Jiahua Dong, Wenqi Liang, Hongliu Li, Yang Cong, Duzhen Zhang, Hanbin Zhao, Henghui Ding, Yulun Zhang, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) University of Trento(特伦托大学) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程系) South China University of Technology(华南理工大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出持续可定制扩散模型(CCDM),通过属性解耦LoRA模块和相关性引导聚合策略解决灾难性遗忘,并结合可控区域上下文合成策略处理概念忽视,实现概念增量式多功能定制。

Comments Accepted to Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03420 2026-06-03 cs.CV 57%

PHAF-Personalized Hand Avatars in a Flash

PHAF-瞬间个性化手部化身

Meghana Shankar, Akanxit Upadhyay, Anmol Namdev, Green Rosh KS, Pawan Prasad BH

机构 * Samsung R&D Institue(三星研发机构)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 提出PHAF方法,从两张图像(手背和手掌)快速生成个性化逼真手部化身,通过语义引导网格对齐和密集纹理提取,结合视图修复网络,实现高质量多视角渲染,纹理生成速度比现有方法快30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV 57%

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02042 2026-06-02 cs.CV 57%

Normality-Preserving Continual Industrial Anomaly Detection via Orthogonal LoRA Banks

通过正交LoRA库保持正态性的持续工业异常检测

Weibai Fang, Haijun Che, Feiyang Ren, Qiancheng Lao

机构 * Yisu University(Yorkshire University)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于历史冻结正交LoRA库和分层新颖性自适应库增长模块的框架,解决扩散模型在持续工业异常检测中的历史正态先验漂移和灾难性遗忘问题。

Comments 33 pages,6 figures,Submitted to Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01079 2026-06-02 cs.CV 57%

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

Chameleon: 面向跨域对象合成的风格-内容解耦框架

Sukhun Ko, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang大学CMLab) Adobe Research(Adobe研究)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于大规模数据集ChameleonDataset的两阶段训练框架Chameleon,通过联合硬对比学习和时空注意力门控实现跨域对象合成的风格-内容解耦与自适应风格化。

Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/Chameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00673 2026-06-02 cs.CV 57%

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

T-CLIP:面向对比语言-图像预训练的热感知

Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee, Brejesh Lall

机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) NVIDIA AI Technology Center, India(NVIDIA AI技术中心) Jawaharlal Nehru University, India(贾瓦哈拉尔·尼赫鲁大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对CLIP无法对齐热图像与文本描述的问题,提出物理感知的热描述数据集IR-Cap和解耦双LoRA框架T-CLIP,实现场景级和对象级热理解,在跨模态检索任务上超越所有基线。

Comments 34pages (including references and appendix), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 57%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10362 2026-06-02 cs.LG cs.CV 57%

OP-LoRA: The Blessing of Dimensionality

OP-LoRA:维度的祝福

Piotr Teterwak, Kate Saenko, Bryan A. Plummer, Ser-Nam Lim

机构 * Boston University(波士顿大学) University of Central Florida(中央佛罗里达大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出OP-LoRA方法,通过额外MLP预测LoRA适配器权重以改善优化,训练后丢弃MLP,在零额外推理成本下提升性能并降低对学习率的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31033 2026-06-01 cs.CV 57%

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation

SlotMemory: 面向流式长视频生成的以对象为中心的KV记忆

Weijia Dou, Hui Li, Jiahao Cui, Lei Zhou, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Meta Superintelligence Labs(Meta超智能实验室) Baidu(百度)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SlotMemory,一种以对象为中心的键值记忆机制,通过将变换器的键值流形分解为离散语义槽,实现实体级持久性和提示感知检索,在60秒交互叙事中动态一致性相对提升22.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25778 2026-05-26 cs.CV 57%

OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance

OMGTex: 无需几何引导的一阶段多风格面部纹理重建

Zitong Xiao, Yuda Qiu, Zisheng Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能化重点实验室) FNii-Shenzhen(FNii-深圳)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出OMGTex,一种端到端的扩散框架,无需3D几何先验,直接从多风格面部图像重建高质量、可编辑的UV纹理,通过梯度引导推理和语义感知训练实现鲁棒重建与编辑。

Comments CVPR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00443 2026-05-26 cs.SD cs.MM eess.AS 57%

RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

RVCBench:现代音频生成模型中语音克隆鲁棒性的基准测试

Ruinan Jin, Xinting Liao, Hanlin Yu, Deval Pandya, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 提出RVCBench数据集和基准,通过18项鲁棒性评估、225个说话人和14370个话语,系统评估语音克隆模型在噪声、多语言、长文本、后处理和对抗扰动等现实场景下的鲁棒性。

Comments 65 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22996 2026-05-25 cs.CV 57%

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

CoMoGen: 基于掩码引导的视频生成的可控运动动力学与交互

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

机构 * Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMoGen框架,通过轻量级MaskAdapter将二进制掩码序列编码为潜在残差信号注入MMDiT模型,并利用LoRA微调运动层,实现从单张图像和掩码序列生成逼真的交互运动,在运动保真度和感知真实性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV 57%

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16406 2026-05-19 cs.CV 57%

Contrastive-SDXL: Annotation-Preserving Night-Time Augmentation for Pedestrian Detection

对比-SDXL:保留标注的夜间增强用于行人检测

Franky George, Muhammad Khalid, Adil Khan

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Contrastive-SDXL框架,利用SDXL-Turbo和LoRA微调,通过语义对比损失和对象一致性损失生成逼真夜间图像,提升行人检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15309 2026-05-18 cs.CV 57%

One Pass Is Not Enough: Recursive Latent Refinement for Generative Models

一次不够:生成模型的递归潜在细化

Mehdi Esmaeilzadeh, Alexia Jolicoeur-Martineau, Chirag Vashist, Ke Li

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出RTM方法,通过递归细化提升生成模型的多样性和覆盖范围,改进了FID指标下的精度和召回率,适用于多个数据集和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-05-15 cs.CV 57%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12138 2026-05-13 cs.CV cs.CL cs.IR 57%

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

专题命中 个性化与一致性 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12002 2026-05-13 cs.CV 57%

EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization

EDGER: 基于热图细化的边缘引导图像伪造定位

Minh-Khoa Le-Phan, Minh-Hoang Le, Minh-Triet Tran, Trong-Le Do

机构 * University of Science - VNU-HCM(越南国家大学-胡志明市大学) Vietnam National University(越南国家大学)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 EDGER通过边缘引导分割和合成热图分支,实现任意分辨率图像中伪造区域的精准定位,具备跨域泛化能力。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11927 2026-05-13 cs.CV 57%

RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation

RealDiffusion:用于多角色故事书生成的物理信息注意力

Qi Zhao, Jun Chen, Ivor Tsang, Guang Dai

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang Normal University(浙江师范大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RealDiffusion通过引入物理信息注意力机制,解决多角色故事生成中叙事动态与角色一致性之间的平衡问题,提升角色连贯性并保持叙事活力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07402 2026-05-11 cs.CV 57%

InsHuman: Towards Natural and Identity-Preserving Human Insertion

InsHuman: 向自然且身份保持的人体插入迈进

Jie Li, Shulian Zhang, Yangyang Gao, Wenbo Li, Yulun Zhang, Yong Guo, Jian Chen

机构 * South China University of Technology(南方科技大学) Chinese University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Max Planck Institute for Informatics(马克斯·普朗克研究所)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 本文提出InsHuman,通过HBAF、FFIP和BDP方法实现自然且身份保持的人体插入,提升生成图像的合理性与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 57%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24842 2026-04-29 cs.AI cs.MA cs.MM 57%

Co-Director: Agentic Generative Video Storytelling

Co-Director: 基于代理的生成视频叙事

Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine Leon, Khanh G. LeViet, Zack Chomyn, Joe Timmons, Brett Slatkin, Scott Penberthy, Tomas Pfister

机构 * Google(谷歌)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 本文提出Co-Director框架,通过分层多代理方法解决视频生成的语义一致性问题,引入分层参数化和多模态自优化循环,实现叙事策略探索与有效配置的平衡,通过GenAD-Bench验证其在个性化广告中的优越性。

Comments Project Page: https://co-director-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23584 2026-04-28 cs.CV cs.IR 57%

Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

多模态检索增强生成中视觉证据的身份解耦匿名化

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science University of Oxford, UK

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出身份解耦MRAG框架,通过在检索与生成之间插入生成匿名化模块,解耦人脸身份与属性,利用生成对抗网络和拒绝采样器实现隐私保护。

Comments ACM International Conference on Multimedia Retrieval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02316 2026-04-28 cs.CV cs.AI 57%

ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation

ConsDreamer:推进多视图一致性以实现零样本文本到3D生成

Yuan Zhou, Shilong Jin, Litao Hua, Wanjun Lv, Haoran Duan, Jungong Han

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Lenovo(联想)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 ConsDreamer通过消除视图偏差和几何一致性约束,解决多面Janus问题,提升零样本文本到3D生成的多视图一致性。

Comments Accepted by IEEE Transactions on Image Processing, Code is available at: https://github.com/GAInuist/ConsDreamer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00296 2026-04-21 cs.CV 57%

TimeColor: Flexible Reference Colorization via Temporal Concatenation

TimeColor:通过时间拼接实现灵活的参考着色

Bryan Constantine Sadihin, Yihao Meng, Michael Hua Wang, Matteo Jiahao Chen, Hang Su

机构 * Computer Science and Technology(计算机科学与技术) Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 TimeColor通过时间拼接技术实现灵活的参考着色,利用显式每参考区域分配支持异构、可变数量的参考,提高颜色保真度、身份一致性和时间稳定性。

Comments Our project page is available at https://bconstantine.github.io/TimeColor/

详情

展开后加载摘要…

URL PDF HTML 收藏