arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2603.12873 2026-03-16 cs.CV 57%

TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking

TRACE:面向结构的字符编码用于鲁棒且可泛化的文档水印

Jiale Meng, Jie Zhang, Runyi Hu, Zhe-Ming Lu, Tianwei Zhang, Yiming Li

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 TRACE通过扩散模型实现结构感知的局部字符编码,提升文档水印的鲁棒性和泛化能力,实验显示其在PSNR和提取精度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12513 2026-03-16 cs.CV 57%

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

MemRoPE:通过演化记忆标记实现无训练的无限视频生成

Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MemRoPE通过演化记忆标记和在线RoPE索引机制,解决长视频生成中的时间一致性、视觉保真度和主体一致性问题,实现无训练的无限视频生成。

Comments 9 pages main, 3 pages references, 6 pages appendix. Project page: https://memrope.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12257 2026-03-13 cs.CV 57%

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10354 2026-03-13 cs.CV 57%

StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References

StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移

Boyu He, Yunfan Ye, Chang Liu, Weishang Wu, Fang Liu, Zhiping Cai

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。

Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03964 2026-03-13 cs.CV cs.AI 57%

BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft

BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline

Hengquan Guo

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19708 2026-03-11 cs.CV 57%

ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets

ChimeraLoRA:多头LoRA引导的合成数据集

Hoyoung Kim, Minwoo Jang, Jabin Koo, Sangdoo Yun, Jungseul Ok

机构 * Graduate School of AI, POSTECH(POSTECH人工智能研究生院) Dept. of CSE, POSTECH(POSTECH计算机科学与工程系) NAVER AI Lab(NAVER人工智能实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ChimeraLoRA通过结合类别共享LoRA和图像特定LoRA,生成多样且细节丰富的合成数据集,提升下游分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08445 2026-03-10 cs.CV 57%

Alfa: Attentive Low-Rank Filter Adaptation for Structure-Aware Cross-Domain Personalized Gaze Estimation

Alfa: 用于结构感知跨域个性化眼动估计的注意力低秩滤波适应

He-Yen Hsieh, Wei-Te Mark Ting, H. T. Kung

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Alfa通过重新加权预训练滤波器中的语义模式,实现结构感知的跨域个性化眼动估计,有效提升模型性能。

Comments 21 pages, 16 figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20989 2026-03-10 cs.CV 57%

Cycle-Consistent Tuning for Layered Image Decomposition

循环一致性调谐用于分层图像分解

Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Shenzhen University(深圳大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于循环一致性调谐的图像分解框架,通过轻量级LoRA适应和双向监督提升分层分离的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://vcc.tech/research/2026/ImgDecom

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03769 2026-03-06 cs.CV cs.AI cs.LG 57%

DMD-augmented Unpaired Neural Schrödinger Bridge for Ultra-Low Field MRI Enhancement

DMD增强的无配对神经施罗德桥用于超低场MRI增强

Youngmin Kim, Jaeyun Shin, Jeongchan Kim, Taehoon Lee, Jaemin Kim, Peter Hsu, Jelle Veraart, Jong Chul Ye

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) NYU Langone Health(纽约大学朗格one健康)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于DMD增强的无配对神经施罗德桥方法,用于提升超低场MRI图像质量,通过结合分布匹配与解剖结构保持正则化器,实现现实感与结构保真的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02893 2026-03-04 cs.CV 57%

Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting

内在几何-外观一致性优化用于稀疏视角高斯点绘制

Kaiqiang Xiong, Rui Peng, Jiahao Wu, Zhanke Wang, Jie Liang, Xiaoyun Zheng, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,深圳大学,北京大学) Peng Cheng Laboratory(鹏城实验室) Migu Culture Technology Co., Ltd(咪咕文化技术有限公司) Alibaba Group(阿里巴巴集团) School of Arts, Peking University(北京大学艺术学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MVD-HuGaS通过多视角扩散模型实现从单张图像生成自由视角3D人体,结合几何-外观一致性优化提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26127 2026-03-04 cs.CV 57%

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

EchoGen: 通过前馈主体驱动自回归模型在任意场景中生成视觉回声

Ruixiao Dong, Zhendong Wang, Keli Liu, Li Li, Ying Chen, Kai Li, Daowen Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 EchoGen通过前馈主体驱动自回归模型在任意场景中生成高质量视觉回声,实现高效生成与高保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23203 2026-02-27 cs.CV cs.AI 57%

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22819 2026-02-27 cs.CV 57%

Face Time Traveller : Travel Through Ages Without Losing Identity

面容时间旅行者:无需丢失身份即可穿越年龄

Purbayan Kar, Ayush Ghadiya, Vishal Chudasama, Pankaj Wasnik, C. V. Jawahar

机构 * Sony Research India(索尼印度研究实验室) IIIT Hyderabad(Hyderabad 研究学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FaceTT通过基于扩散的框架实现高保真身份一致的年龄变换,引入了Face-Attribute-Aware Prompt Refinement策略、无调优的Angular Inversion方法和自适应注意力控制机制,提升了年龄变换的精度和稳定性。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22430 2026-02-27 cs.GR cs.LG 57%

TopoEdit: Fast Post-Optimization Editing of Topology Optimized Structures

TopoEdit: 快速拓扑优化结构的后期优化编辑

Hongrui Chen, Josephine V. Carstensen, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.GR

AI总结 TopoEdit通过利用预训练拓扑基础模型的潜在嵌入,实现快速的拓扑优化结构后期编辑,提升机械性能并避免灾难性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20664 2026-02-25 cs.CV 57%

AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?

AnimeAgent: 多智能体 via 图像到视频模型是否是一个好的迪士尼故事创作艺术家?

Hailong Yan, Shice Liu, Tao Wang, Xiangtao Zhang, Yijie Zhong, Jinwei Chen, Le Zhang, Bo Li

机构 * UESTC vivo Mobile Communication Co. Ltd(vivo移动通信有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 AnimeAgent通过基于图像到视频的多智能体框架,提升自定义分镜生成的 consistency、prompt fidelity 和 stylization,首次解决静态扩散模型的动态表现力不足问题。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09126 2026-02-25 cs.CV 57%

DreamBarbie: Text to Barbie-Style 3D Avatars

DreamBarbie: 通过文本生成Barbie风格的3D人像

Xiaokun Sun, Zhenyu Zhang, Ying Tai, Hao Tang, Zili Yi, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 DreamBarbie通过文本生成Barbie风格的3D人像,结合表达性3D表示和专门优化模型,实现高保真度的可动画和模拟人像生成。

Comments Accepted by TVCG 2026; Project page: https://xiaokunsun.github.io/DreamBarbie.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17863 2026-02-19 cs.CV cs.AI 57%

A Survey: Spatiotemporal Consistency in Video Generation

综述:视频生成中的时空一致性

Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15539 2026-02-18 cs.CV cs.AI cs.SC 57%

Dynamic Training-Free Fusion of Subject and Style LoRAs

动态免训练 主体与风格LoRA融合

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(技术东院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种动态免训练的LoRA融合框架,通过特征级选择和度量引导的潜在调整实现主体与风格的动态合成,无需重新训练即可提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06562 2026-02-13 cs.CV cs.AI 57%

SUGAR: A Sweeter Spot for Generative Unlearning of Many Identities

SUGAR: 为多重身份生成性去学习的更甜位置

Dung Thuy Nguyen, Quang Nguyen, Preston K. Robinette, Eli Jiang, Taylor T. Johnson, Kevin Leach

机构 * Vanderbilt University(范德比大学) Rutgers University(罗格斯大学)

专题命中 个性化与一致性 :image synthesis(abstract);分类 cs.CV

AI总结 SUGAR通过学习个性化替代潜在表示,实现高效移除多个身份的生成性去学习,提升模型保留效用达700%。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10113 2026-02-11 cs.CV 57%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08775 2026-02-10 cs.CV cs.CG 57%

VedicTHG: Symbolic Vedic Computation for Low-Resource Talking-Head Generation in Educational Avatars

VedicTHG: 用于教育拟人化角色中低资源语音生成的符号吠陀计算

Vineet Kumar Rakesh, Ahana Bhattacharjee, Soumya Mazumdar, Tapas Samanta, Hemendra Kumar Pandey, Amitabha Das, Sarbajit Pal

机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴哈瓦国家研究所培训学校复杂区) Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能回旋加速器中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 VedicTHG通过符号吠陀计算在CPU上实现低资源谈话头生成,减少计算负载和延迟,提升教育拟人化角色的实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07564 2026-02-10 cs.CV 57%

SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

SIGMA: 带多属性标记的选择性交错生成

Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song

机构 * Creatly AI University of Michigan(密歇根大学) Lovart AI National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SIGMA通过引入多属性标记实现多条件生成,提升可控性、一致性和视觉质量,优于Bagel在组合任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07498 2026-02-10 cs.CV 57%

IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation

IM-Animation: 一种隐式运动表示用于身份解耦的角色动画

Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Cardiff University(卡迪夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 IM-Animation通过隐式运动表示和时间一致的遮罩令牌重定向模块,实现身份解耦的角色动画生成,提升动画质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04994 2026-02-06 cs.CV cs.LG 57%

SIDeR: Semantic Identity Decoupling for Unrestricted Face Privacy

SIDeR:语义身份解耦用于无限制面部隐私保护

Zhuosen Bao, Xia Du, Zheng Lin, Jizhe Zhou, Zihan Fang, Jiening Wu, Yuxin Zhang, Zhe Chen, Chi-man Pun, Wei Ni, Jun Luo

机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机科学学院,机器学习与工业智能工程研究中心) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) College of Artificial Intelligence, Southwest University(西南大学人工智能学院) School of Computer Science, Fudan University(复旦大学计算机科学学院) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) Data61, CSIRO(CSIRO Data61) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SIDeR通过语义解耦驱动框架实现面部隐私保护,生成视觉匿名的对抗性样本并保持身份一致性,实验显示其在攻击成功率和恢复质量上均优于现有方法。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03039 2026-02-06 cs.CV 57%

HP-GAN: Harnessing pretrained networks for GAN improvement with FakeTwins and discriminator consistency

HP-GAN: 利用预训练网络提升GAN性能的FakeTwins与判别器一致性方法

Geonhui Son, Jeong Ryong Lee, Dosik Hwang

机构 * School of Electrical and Electronic Engineering, Yonsei University, Seoul, Republic of Korea(电气电子工程学院,延世大学,首尔,大韩民国) Robotics Institute, Korea Institute of Science and Technology, Seoul, Republic of Korea(机器人研究所,韩国科学技术院,首尔,大韩民国) Department of Oral and Maxillofacial Radiology, Yonsei University College of Dentistry, Seoul, Republic of Korea(口腔和颌面放射科,延世大学牙科学院,首尔,大韩民国)

专题命中 个性化与一致性 :image synthesis(abstract);分类 cs.CV

AI总结 HP-GAN通过FakeTwins和判别器一致性技术提升GAN性能,有效增强图像多样性和质量。

Comments Accepted manuscript. This is the accepted version of the article published in Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00729 2026-02-03 cs.CV 57%

Supervised makeup transfer with a curated dataset: Decoupling identity and makeup features for enhanced transformation

带 curated 数据集的监督化妆转移:解耦身份和化妆特征以增强转换

Qihe Pan, Yiming Wu, Xing Zhao, Liang Xie, Guodao Sun, Ronghua Liang

机构 * School of Computer Science and Technology, Zhejiang University of Technology, Zhejiang, China(浙江工业大学计算机科学与技术学院) The University of Hong Kong(香港大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于 curated 数据集的监督化妆转移方法,通过解耦身份和化妆特征,提升化妆转换的保真度和可控性。

Comments This paper has been accepted for publication in the proceedings of 2026 IEEE ICASSP Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22501 2026-02-02 cs.CV cs.SD 57%

MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control

MIRRORTALK: 通过解耦的风格和分层运动控制生成个性化虚拟形象

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Jianzong Wang, Shangfei Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MirrorTalk通过解耦风格与运动控制生成个性化虚拟形象,提升嘴唇同步准确性和个性化表达。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15681 2026-01-23 cs.CV 57%

Consistency-Regularized GAN for Few-Shot SAR Target Recognition

一致性正则化的GAN用于少样本SAR目标识别

Yikui Zhai, Shikuang Liu, Wenlve Zhou, Hongsheng Zhang, Zhiheng Zhou, Xiaolin Tian, C. L. Philip Chen

机构 * College of Electronics and Information Engineering, Wuyi University(威夷大学电子与信息工程学院) College of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Department of Geography, The University of Hong Kong(香港大学地理系) Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院) Faculty of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Cr-GAN通过引入双分支判别器和双域循环一致性机制,在数据稀缺条件下提升少样本SAR目标识别性能,实现71.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12895 2026-01-21 cs.CV cs.LG 57%

TwoHead-SwinFPN: A Unified DL Architecture for Synthetic Manipulation, Detection and Localization in Identity Documents

TwoHead-SwinFPN:一种统一的深度学习架构,用于身份文档中的合成操纵、检测和定位

Chan Naseeb, Adeel Ashraf Cheema, Hassan Sami, Tayyab Afzal, Muhammad Omair, Usman Habib

机构 * IBM Germany(IBM德国分公司) FAST NUCES(FAST努赛斯大学) Askolay Pakistan(Askolay巴基斯坦)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 TwoHead-SwinFPN通过双头架构和Swin Transformer结合FPN与Unet解码器,实现身份文档中合成操纵的高效检测与定位,具有高精度和计算效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13861 2026-01-21 cs.CV 57%

PositionIC: Unified Position and Identity Consistency for Image Customization

PositionIC: 统一的位置和身份一致性用于图像定制

Junjie Hu, Tianyang Han, Kai Ma, Jialin Gao, Song Yang, Xianhua He, Junfeng Luo, Xiaoming Wei, Wenqiang Zhang

机构 * MeiGen AI Team, Meituan(美团MeiGen AI团队) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 PositionIC通过统一框架实现高保真、空间可控的多主体图像定制,引入BMPDS数据合成和可视化感知注意力机制,提升空间精度与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏