arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2601.11635 2026-01-21 cs.CV 57%

Now You See Me, Now You Don't: A Unified Framework for Expression Consistent Anonymization in Talking Head Videos

现在你看见了,现在你又看不见:一种用于说话头视频中表达一致匿名化的统一框架

Anil Egin, Andrea Tangherloni, Antitza Dantcheva

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Anon-NET通过基于扩散的生成模型和视频驱动动画,实现说话头视频中表达一致的匿名化,同时保留视觉真实性和时间一致性。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, IEEE/CVF, Oct 2025, Hawaii-Honolulu, United States. pp.5925-5934

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10103 2026-01-16 cs.CV cs.AI 57%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08516 2026-01-16 cs.CV 57%

High-Quality 3D Head Reconstruction from Any Single Portrait Image

从任意单张肖像图像中高质量重建3D头像

Jianfu Zhang, Yujie Gao, Jiahui Zhan, Wentao Wang, Yiyi Zhang, Haohua Zhao, Liqing Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出一种从单张肖像图像生成高质量3D头像的方法,通过整合身份和表情信息提升重建精度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09169 2026-01-15 cs.CV cs.CY 57%

Architecture inside the mirage: evaluating generative image models on architectural style, elements, and typologies

镜中架构:在幻象中评估生成图像模型对建筑风格、元素和类型学的再现能力

Jamie Magrill, Leah Gornstein, Sandra Seekins, Barry Magrill

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 评估生成图像模型在建筑风格、元素和类型学上的准确性,发现常见提示生成的图像更准确,但整体准确性有限,需加强标注和教育使用。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06965 2026-01-13 cs.CV 57%

Unified Personalized Understanding, Generating and Editing

统一的个性化理解、生成与编辑

Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 OmniPersona是首个统一LMMs的端到端个性化框架,通过结构解耦的概念标记和显式知识重播机制,实现个性化理解、生成和图像编辑的一致可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05241 2026-01-09 cs.CV cs.AI cs.RO 57%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI 57%

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19413 2025-12-30 cs.CV 57%

Multi-scale Latent Point Consistency Models for 3D Shape Generation

多尺度潜在点一致性模型用于3D形状生成

Bi'an Du, Wei Hu, Renjie Liao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 多尺度潜在点一致性模型通过多尺度潜在整合和3D空间注意力,提升3D形状生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21174 2025-12-25 cs.CV 57%

A Turn Toward Better Alignment: Few-Shot Generative Adaptation with Equivariant Feature Rotation

迈向更好的对齐:基于等变特征旋转的少样本生成适应

Chenghao Xu, Qi Liu, Jiexi Yan, Muli Yang, Cheng Deng

机构 * Hohai university(河海大学) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出等变特征旋转(EFR)方法,通过自旋转代理特征空间实现源域与目标域的双层面对齐,有效提升少样本生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18741 2025-12-24 cs.CV 57%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16954 2025-12-22 cs.CV cs.AI 57%

Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories

灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事

Chayan Jain, Rishant Sharma, Archit Garg, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14542 2025-12-17 cs.CV 57%

HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion

HiFi-Portrait: 零样本身份保留肖像生成的高保真多脸融合

Yifang Xu, Benxiang Zhai, Yunzhuo Sun, Ming Li, Yang Li, Sidan Du

机构 * Nanjing University(南京大学) Dalian University of Technology(大连理工大学) Nanjing University of Information Science and Technology(南京信息科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 HiFi-Portrait通过高保真多脸融合技术实现零样本身份保留肖像生成,提升了面部相似性和可控性,同时兼容SDXL工作。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13665 2025-12-16 cs.CV 57%

Grab-3D: Detecting AI-Generated Videos from 3D Geometric Temporal Consistency

Grab-3D: 通过3D几何时间一致性检测AI生成视频

Wenhan Chen, Sezer Karaoglu, Theo Gevers

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Grab-3D通过3D几何时间一致性检测AI生成视频,利用几何感知Transformer框架提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03738 2025-12-16 cs.CV 57%

FACM: Flow-Anchored Consistency Models

FACM:基于流的一致性模型

Yansong Peng, Kai Zhu, Yu Liu, Pingyu Wu, Hebei Li, Xiaoyan Sun, Feng Wu

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 FACM通过流锚定方法解决连续时间一致性模型的训练不稳定性问题,实现高效生成和稳定训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09617 2025-12-11 cs.CV 57%

FROMAT: Multiview Material Appearance Transfer via Few-Shot Self-Attention Adaptation

FROMAT: 通过少样本自注意力适应实现多视图材料外观迁移

Hubert Kompanowski, Varun Jampani, Aaryaman Vasishta, Binh-Son Hua

机构 * Trinity College Dublin(都柏林三一学院) Arcade AI AMD

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FROMAT通过少样本自注意力适应实现多视图材料外观迁移,提供了一种简单有效的生成方法,提升多视图内容创作的外观多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10826 2025-12-09 cs.SD cs.MM eess.AS 57%

SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing

SteerMusic: 增强零射文本引导和个性化音乐编辑的音乐一致性

Xinlei Niu, Kin Wai Cheuk, Jing Zhang, Naoki Murata, Chieh-Hsin Lai, Michele Mancusi, Woosung Choi, Giorgio Fabbro, Wei-Hsiang Liao, Charles Patrick Martin, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 SteerMusic通过delta去噪分数和概念令牌实现零射文本引导和个性化音乐编辑,提升音乐一致性与编辑保真度。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05081 2025-12-05 cs.CV 57%

Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression

深度强制:免训练 长视频生成与深度Sink和参与性压缩

Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 深度强制通过深度Sink和参与性压缩机制,在无需微调的情况下实现长视频生成,提升生成质量与动态效果。

Comments Project Page: https://cvlab-kaist.github.io/DeepForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16667 2025-12-05 q-bio.NC cs.CV eess.IV 57%

BrainPath: A Biologically-Informed AI Framework for Individualized Aging Brain Generation

BrainPath: 一种基于生物信息的AI框架,用于个性化衰老脑生成

Yifan Li, Javad Sohankar, Ji Luo, Jing Li, Yi Su

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 BrainPath通过引入三种架构创新,实现了个性化衰老脑生成,提高了生成准确性和解剖学忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03964 2025-12-04 cs.CV 57%

Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization

面向身份与可控性的训练:一种无需调优的面部个性化统一方法

Lianyu Pang, Ji Zhou, Qiping Wang, Baoquan Zhao, Zhenguo Yang, Qing Li, Xudong Mao

机构 * Sun Yat-sen University(中山大学) East China Normal University(华东师范大学) Guangdong University of Technology(广东工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 UniID提出了一种无需调优的面部个性化统一方法,通过整合文本嵌入和适配器方法,实现高保真身份和灵活文本可控性。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10786 2025-12-03 eess.IV cs.CV cs.LG 57%

ContourDiff: Unpaired Medical Image Translation with Structural Consistency

ContourDiff: 无配对医学图像翻译与结构一致性

Yuwen Chen, Nicholas Konz, Hanxue Gu, Haoyu Dong, Yaqian Chen, Lin Li, Jisoo Lee, Maciej A. Mazurowski

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Radiology, Duke University(杜克大学放射学系) Department of Computer Science, Duke University(杜克大学计算机科学系)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ContourDiff通过空间一致的引导扩散框架,实现了无配对医学图像翻译,保持解剖结构一致性,优于其他方法。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:031

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01895 2025-12-02 cs.CV 57%

StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data

StyleYourSmile: 跨域人脸重定向无需配对多风格数据

Avirup Dey, Vinay Namboodiri

机构 * University of Bath(巴斯大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 StyleYourSmile通过双编码器框架和高效数据增强策略,实现无需多风格配对数据的跨域人脸重定向,提升身份保持与重定向保真度。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15258 2025-12-01 cs.CV 57%

SplitFlux: Learning to Decouple Content and Style from a Single Image

SplitFlux: 从单张图像中学习解耦内容与风格

Yitong Yang, Yinglin Wang, Changshuo Wang, Yongjun Zhang, Ziyang Chen, Shuting He

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) University College London, University of London(伦敦大学大学学院) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 SplitFlux通过LoRA微调单流块,实现内容与风格的解耦,提升图像生成的质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16915 2025-12-01 cs.CV 57%

DreamO: A Unified Framework for Image Customization

DreamO:图像定制的统一框架

Chong Mou, Yanze Wu, Wenxu Wu, Zinan Guo, Pengze Zhang, Yufeng Cheng, Yiming Luo, Fei Ding, Shiwen Zhang, Xinghui Li, Mengtian Li, Mingcong Liu, Yi Zhang, Shaojin Wu, Songtao Zhao, Jian Zhang, Qian He, Xinglong Wu

机构 * Peking University(北京大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 DreamO提出了一种统一的图像定制框架,通过扩散变压器和渐进式训练策略,实现多种条件的无缝集成与高质量定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV 57%

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV 57%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23951 2025-11-25 cs.CV 57%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18307 2025-11-25 cs.CV cs.AI cs.LG 57%

ScriptViT: Vision Transformer-Based Personalized Handwriting Generation

ScriptViT: 基于视觉变换器的个性化手写生成

Sajjan Acharya, Rajendra Baskota

机构 * Independent Researcher(独立研究者)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ScriptViT通过基于视觉变换器的风格编码器和交叉注意力机制,实现更准确且风格一致的个性化手写生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV 57%

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04482 2025-11-24 cs.CV 57%

A Training-Free Style-Personalization via SVD-Based Feature Decomposition

基于SVD特征分解的无训练风格个性化生成

Kyoungmin Lee, Jihun Park, Jongmin Gim, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Sunghoon Im

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于SVD特征分解的无训练风格个性化图像生成方法,通过主特征混合和结构注意力校正模块实现风格调控和结构一致性,提升生成效果与部署效率。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20084 2025-11-19 cs.CV 57%

UniVST: A Unified Framework for Training-free Localized Video Style Transfer

Quanjian Song, Mingbao Lin, Wengyi Zhan, Shuicheng Yan, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) Rakuten Asia Pte. Ltd. School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted by TPAMI 2025; Project Page: https://quanjiansong.github.io/projects/UniVST

详情

展开后加载摘要…

URL PDF HTML 收藏