arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2604.16958 2026-04-21 cs.CV 57%

Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation

具有自我推理代理机制的叙事产品网格-拼贴生成框架

Minyan Luo, Yuxin Zhang, Yifei Li, Xincan Wang, Fuzhang Wu, Tong-Yee Lee, Oliver Deussen, Weiming Dong

机构 * MAIS,Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所马克思主义学院) Tsinghua University(清华大学) Shanghai Theatre Academy(上海戏剧学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Cheng Kung University(国立成功大学) University of Konstanz(康斯坦茨大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种自我推理代理框架,用于生成叙事产品网格拼贴,通过构建产品叙事框架和约束-aware提示,提升视觉一致性和叙事丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16114 2026-04-20 cs.CV 57%

Towards In-Context Tone Style Transfer with A Large-Scale Triplet Dataset

面向大规模三元数据集的上下文内调色风格迁移

Yuhai Deng, Huimin She, Wei Shen, Meng Li, Ruoxi Wu, Lunxi Yuan, Xiang Li

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) OPPO AI Center, OPPO Inc.(OPPO AI中心,OPPO公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ICTone框架,通过上下文内联合条件生成实现调色风格迁移,利用生成模型语义先验提升风格一致性和视觉质量。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16108 2026-04-20 cs.CV 57%

Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation

Polyglot:多语言风格保留的语音驱动面部动画

Federico Nocentini, Kwanggyoon Seo, Qingju Liu, Claudio Ferrari, Stefano Berretti, David Ferman, Hyeongwoo Kim, Pablo Garrido, Akin Caliskan

机构 * University of Florence(佛罗伦萨大学) Flawless AI Imperial College London(伦敦帝国学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Polyglot,一种统一的扩散架构,用于多语言语音驱动面部动画,通过结合语言和风格信息,提升动画的真实性和一致性。

Comments The project website is available at https://fedenoce.github.io/polyglot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12281 2026-04-15 cs.CV cs.AI 57%

MAST: Mask-Guided Attention Mass Allocation for Training-Free Multi-Style Transfer

MAST:基于掩码的注意力质量分配用于无训练多风格迁移

Dongkyung Kang, Jaeyeon Hwang, Junseo Park, Minji Kang, Yeryeong Lee, Beomseok Ko, Hanyoung Roh, Jeongmin Shin, Hyeryung Jang

机构 * Division of Computer Science and Artificial Intelligence, Dongguk University(计算机科学与人工智能系,东国大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MAST提出一种无训练框架,通过布局保留查询锚定、注意力质量分配、温度缩放和细节注入模块,实现多风格迁移中无边界伪影和结构一致性的保持。

Comments 16 pages, 16 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22736 2026-04-14 eess.IV cs.AI cs.CV cs.LG physics.med-ph stat.ML 57%

PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems

PnP-CM:一致性模型作为逆问题的即插即用先验

Merve Gülle, Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PnP-CM,将一致性模型视为先验的近端算子,用于解决多种逆问题,通过改进的ADMM框架和噪声扰动,在低NFE情况下实现高质量重建。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09989 2026-04-14 cs.CV cs.AI 57%

FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation

FlowPalm: 基于光流的非刚性变形生成几何多样性指纹

Yuchen Zou, Huikai Shao, Lihuang Fang, Zhipeng Xiong, Dexing Zhong

机构 * Xi’an Jiaotong University(西安交通大学) Sichuan Digital Economy Industry Development Research Institute(四川数字经济发展研究院) Southern University of Science and Technology(南方科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FlowPalm通过光流驱动生成几何多样性的指纹,结合统计变形模式与渐进采样过程,提升指纹识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08828 2026-04-13 cs.LG cs.CV 57%

Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning

通过联合流分布学习提升一致性模型的后验指导

Chia-Hong Hsu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出JFDL方法,通过预训练一致性模型实现后验指导,无需扩散模型教师,有效降低FID并提升生成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08760 2026-04-13 cs.CV 57%

SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation

SIC3D:基于风格图像的文本到3D高斯点云生成

Ming He, Zhixiang Chen, Steve Maddock

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SIC3D通过引入变分风格化分数蒸馏损失,提升文本到3D生成的可控性和纹理精度,实验表明其在几何真实性和风格一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05296 2026-04-08 cs.CV 57%

From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removal

从测量到缓解:量化并减少图像表示编码器中的身份泄露

Daniel George, Charles Yeh, Daniel Lee, Yifei Zhang

机构 * Persona Identities

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种针对图像表示编码器中身份泄露的评估基准和缓解方法,通过线性子空间移除技术在保持实用性的前提下提升隐私保护。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05039 2026-04-08 cs.CV cs.AI 57%

ID-Sim: An Identity-Focused Similarity Metric

ID-Sim:一种以身份为中心的相似性度量

Julia Chae, Nicholas Kolkin, Jui-Hsien Wang, Richard Zhang, Sara Beery, Cusuh Ham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Adobe Research(Adobe研究院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出ID-Sim,一种以身份为中心的相似性度量,通过高质量图像数据集和生成合成数据,提升身份识别和生成任务的评估能力。

Comments SB and CH equal advising; Project page https://juliachae.github.io/id_sim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07951 2026-04-06 cs.CV 57%

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG 57%

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00293 2026-04-02 cs.CV cs.CR cs.LG 57%

MOLM: Mixture of LoRA Markers

MOLM:LoRA标记的混合

Samar Fares, Nurbek Tastan, Noor Hussein, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MOLM,一种基于路由的LoRA标记方法,通过轻量级LoRA适配器在残差和注意力块中实现参数扰动,提升水印的鲁棒性和隐蔽性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04485 2026-04-02 cs.CV 57%

Not All Birds Look The Same: Identity-Preserving Generation For Birds

并非所有鸟都看起来一样:用于鸟类的身份保持生成

Aaron Sun, Oindrila Saha, Subhransu Maji

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出NABirds Look-Alikes数据集,用于评估鸟类身份保持生成,显示基于物种、年龄和性别的训练提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29587 2026-04-01 cs.GR 57%

Style-Instructed Mask-Free Virtual Try On

风格指导的无掩膜虚拟试穿

Mengqi Zhang, Qi Li, Mehmet Saygin Seyfioglu, Karim Bouyarmane

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.GR

AI总结 本文提出一种无需掩膜的虚拟试穿框架,通过注意力引导机制和指令提示提升试穿准确性与交互灵活性,实验表明其在多个数据集上均优于现有方法。

Comments Project page: https://smf-vto.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV 57%

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12766 2026-04-01 cs.CV 57%

Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation

Catalyst4D: 通过动态传播实现高保真的3D到4D场景编辑

Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhejiang Industrial Big Data and Robot Intelligent System Key Laboratory, Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院浙江省工业大数据与机器人智能系统重点实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Catalyst4D框架,通过动态传播实现高保真的4D场景编辑,保持时空一致性,优于现有方法。

Comments https://junliao2025.github.io/Catalyst4D-ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV 57%

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16649 2026-03-31 cs.CV 57%

Mixture of Style Experts for Diverse Image Stylization

风格专家混合模型用于多样化图像风格化

Shihao Zhu, Ziheng Ouyang, Yijia Kang, Qilong Wang, Mi Zhou, Bo Li, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机学院视觉与图像处理实验室) NKIARI, Shenzhen Futian(深圳福田南开大学新一代人工智能研究院) Tianjin University(天津大学) vivo BlueImage Lab(vivo蓝心影像实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出StyleExpert框架,基于MoE模型实现语义感知的图像风格化,通过统一编码器和动态门控机制处理多层级语义风格,实验表明其在保持语义和材质细节方面优于现有方法。

Comments 24 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09472 2026-03-30 cs.CV 57%

Zero-Shot Personalized Camera Motion Control for Image-to-Video Synthesis

零样本个性化摄像机运动控制用于图像到视频合成

Pooja Guhan, Divya Kothandaraman, Geonsun Lee, Tsung-Wei Huang, Guan-Ming Su, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Dolby Laboratories(杜比实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出零样本扩散框架,实现从单参考视频向静态图像转移电影级运动,提升非专家创作者的创意表达与视频制作可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22172 2026-03-26 cs.CV 57%

CA-LoRA: Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

CA-LoRA:面向领域对齐的分割数据集生成的概念感知LoRA

Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi

机构 * KAIST(韩国科学技术院) Qualcomm AI Research(高通AI研究) Kyung Hee University(庆熙大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CA-LoRA方法,通过文本到图像生成模型生成分割数据集,解决数据稀缺问题。该方法通过选择性更新与领域对齐相关的概念权重,提升生成样本的多样性和信息量,在城市场景分割中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23462 2026-03-25 cs.CV 57%

RealMaster: Lifting Rendered Scenes into Photorealistic Video

RealMaster: 将渲染场景提升为逼真视频

Dana Cohen-Bar, Ido Sobol, Raphael Bensadoun, Shelly Sheynin, Oran Gafni, Or Patashnik, Daniel Cohen-Or, Amit Zohar

机构 * Tel Aviv University(特拉维夫大学) Reality Labs, Meta(Meta现实实验室) Technion Israel(技术学院以色列)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RealMaster通过视频扩散模型将渲染视频提升为逼真视频,保持与3D引擎输出的精确对齐,同时通过IC-LoRA训练实现高质量输出和泛化能力。

Comments Project page: https://danacohen95.github.io/RealMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23265 2026-03-25 cs.CL cs.CV 57%

PaperBanana: Automating Academic Illustration for AI Scientists

PaperBanana:为AI科学家自动化学术插图

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon

机构 * Peking University(北京大学) Google Cloud AI Research(谷歌云AI研究)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 PaperBanana通过整合先进视觉语言模型和图像生成模型,自动化生成出版级学术插图,提升了科研流程中插图制作的效率与质量。

Comments Add Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05905 2026-03-24 cs.CV 57%

SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

SCAIL:通过上下文学习3D一致姿态表示实现工作室级角色动画

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SCAIL通过创新的3D姿态表示和全上下文姿态注入机制,提升角色动画的结构保真度和时间一致性,实现工作室级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19766 2026-03-23 cs.CV 57%

Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

适应预训练的单细胞基础模型以从组织学图像生成空间基因表达

Donghai Fang, Yongheng Li, Zhen Wang, Yuansong Zeng, Wenwen Min

机构 * Sun Yat-sen University(中山大学) Yunnan University(云南大学) Chongqing University(重庆大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HINGE模型,通过引入SoftAdaLN和扩散目标,将预训练的单细胞基础模型适配为条件表达生成器,提升了组织学图像生成空间基因表达的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 57%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15679 2026-03-18 cs.CR cs.AI cs.CV 57%

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

IdentityGuard: 基于上下文的限制与溯源的个性化合成

Lingyun Zhang, Yu Xie, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Purple Mountain Laboratories(紫金山实验室)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。

Comments 5 pages, 3 figures, Accepted to ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15415 2026-03-17 cs.CV 57%

AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation

AnyCrowd:实例隔离的身份-姿态绑定用于任意多角色动画

Zhenyu Xie, Ji Xia, Michael Kampffmeyer, Panwen Hu, Zehua Ma, Yujian Zheng, Jing Wang, Zheng Chong, Xujie Zhang, Xianhang Cheng, Xiaodan Liang, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) University of Tromsø (UiT) – The Arctic University of Norway, Norway(特罗姆瑟大学(UiT)——挪威北极大学,挪威) Shenzhen campus of Sun Yet-sen University, China(孙中山大学深圳校区,中国)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AnyCrowd框架,通过实例隔离潜在表示和三阶段解耦注意力机制,解决多角色动画中身份与姿态绑定不一致的问题,提升生成视频的可控性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13984 2026-03-17 cs.CV cs.AI 57%

CSD-VAR: Content-Style Decomposition in Visual Autoregressive Models

CSD-VAR:视觉自回归模型中的内容-风格分解

Quang-Binh Nguyen, Minh Luu, Quang Nguyen, Anh Tran, Khoi Nguyen

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CSD-VAR方法,通过视觉自回归模型的逐尺度生成过程提升内容-风格分离,引入三种创新:尺度感知交替优化策略、基于SVD的校正方法和增强键值记忆以提升内容保真度。

Comments Accepted to ICCV 2025; Project page: https://nqbinhcs.github.io/csd-var-page/

详情

展开后加载摘要…

URL PDF HTML 收藏