arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2508.11203 2025-08-18 cs.GR cs.AI cs.CV cs.MM 67%

StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation

Seungmi Lee, Kwan Yun, Junyong Noh

机构 * KAIST, Visual Media Lab(韩国科学技术院,视觉媒体实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Pacific graphics 2025, CGF, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19836 2025-07-29 cs.GR cs.AI cs.CV cs.MM cs.SD 67%

ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments 10 pages, 5 figures, accepted by the 33rd ACM International Conference on Multimedia (ACM MM 2025), demo page: https://choreomuse.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11925 2025-07-17 cs.SD eess.AS 67%

Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement

Shuichiro Nishigori, Koichi Saito, Naoki Murata, Masato Hirano, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05566 2025-07-09 cs.AI 67%

SingLoRA: Low Rank Adaptation Using a Single Matrix

David Bensaïd, Noam Rotstein, Roy Velich, Daniel Bensaïd, Ron Kimmel

机构 * Technion - IIT Haifa(技术学院-理工学院海法分校) University Paris Dauphine(巴黎-达芬奇大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12601 2025-07-03 cs.CV cs.GR cs.MM 67%

DreamCinema: Cinematic Transfer with Free Camera and 3D Character

Weiliang Chen, Fangfu Liu, Diankun Wu, Haowen Sun, Jiwen Lu, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Project page: https://liuff19.github.io/DreamCinema

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21272 2025-06-30 cs.GR cs.CV cs.MM 67%

FairyGen: Storied Cartoon Video from a Single Child-Drawn Character

Jiayi Zheng, Xiaodong Cun

机构 * GVC Lab, Great Bay University(Great Bay大学GVC实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14396 2025-05-27 cs.LG 67%

Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape

Tao Li, Zhengbao He, Yujun Li, Yasheng Wang, Lifeng Shang, Xiaolin Huang

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10453 2025-05-06 cs.CV cs.GR cs.MM 67%

Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation

Liu He, Yizhi Song, Hejun Huang, Pinxin Liu, Yunlong Tang, Daniel Aliaga, Xin Zhou

机构 * Purdue University(普渡大学) Baidu USA(百度美国公司) University of Rochester(罗切斯特大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted by CVPR 2025 AI4CC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15231 2025-04-16 cs.LG cs.AI 67%

IterIS: Iterative Inference-Solving Alignment for LoRA Merging

Hongxu Chen, Runshi Li, Bowei Zhu, Zhen Wang, Long Chen

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13500 2025-04-08 cs.LG cs.AI 67%

Long-horizon Visual Instruction Generation with Logic and Attribute Self-reflection

Yucheng Suo, Fan Ma, Kaixin Shen, Linchao Zhu, Yi Yang

专题命中 个性化与一致性 :text-to-image(abstract);image editing(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09130 2025-03-13 cs.GR cs.CV cs.MM 67%

InteractEdit: Zero-Shot Editing of Human-Object Interactions in Images

Jiun Tian Hoe, Weipeng Hu, Wei Zhou, Chao Xie, Ziwei Wang, Chee Seng Chan, Xudong Jiang, Yap-Peng Tan

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Website: https://jiuntian.github.io/interactedit

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18139 2024-12-25 cs.CL 67%

Ensuring Consistency for In-Image Translation

Chengpeng Fu, Xiaocheng Feng, Yichong Huang, Wenshuai Huo, Baohang Li, Zhirui Zhang, Yunfei Lu, Dandan Tu, Duyu Tang, Hui Wang, Bing Qin, Ting Liu

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02347 2024-06-06 cs.LG cs.NA math.NA math.OC 67%

Riemannian Preconditioned LoRA for Fine-Tuning Foundation Models

Fangzhao Zhang, Mert Pilanci

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08677 2024-04-16 cs.IR cs.AI cs.CL 67%

PMG : Personalized Multimodal Generation with Large Language Models

Xiaoteng Shen, Rui Zhang, Xiaoyan Zhao, Jieming Zhu, Xi Xiao

专题命中 个性化与一致性 :diffusion(abstract);personalized generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16984 2024-03-18 cs.LG 67%

Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning

Zihan Ding, Chi Jin

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

Comments published as a paper in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09883 2024-02-16 cs.CV cs.AI cs.GR cs.MM 67%

Lester: rotoscope animation through video object segmentation and tracking

Ruben Tous

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03678 2023-06-07 cs.CL 67%

On the Difference of BERT-style and CLIP-style Text Encoders

Zhihong Chen, Guiming Hardy Chen, Shizhe Diao, Xiang Wan, Benyou Wang

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

Comments Natural Language Processing. 10 pages, 1 figure. Findings of ACL-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23094 2026-08-11 cs.CV cs.GR cs.LG 版本更新 62%

FusionRelight: Relighting Portraits in Real Time via Hybrid Domain Knowledge Fusion

面向真实场景中人像重照明的混合领域知识融合

Qian Huang, Mayoore Selvarasa Jaiswal, Zhen Zhong, Rochelle Pereira, Jianyuan Min

机构 * NVIDIA

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出混合领域知识融合方法,通过融合合成、单光源和真实数据集的优势,提升人像重照明的实用性与效率,实现6至240倍的推理加速且保持SOTA视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10370 2026-07-14 cs.CV cs.GR 新提交 62%

Neural Motion Blending Across Arbitrary Character Topologies

跨任意角色拓扑的神经运动混合

Luca Cazzola, Giulia Martinelli, Nicola Conci

机构 * University of Trento(特伦托大学) CNIT(意大利国家信息与电信研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究针对角色动画运动混合,提出跨异构骨架的新框架,结合语义编码器与基于扩散的解码器,通过插值潜在表示实现混合运动,在Truebones Zoo数据集上训练评估,能在多样场景中实现平滑合理的运动混合。

Comments To appear in the proceedings of Computer Graphics International (CGI 2026). For references, please cite the official proceedings version. Paper website: https://mmlab-cv.github.io/neural_motion_blending/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03506 2026-06-03 cs.CV cs.GR 62%

AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization

AvatarMix: 保持身份特征的跨化身组合用于服装个性化

Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo

机构 * University of Tsukuba(茨口大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出AvatarMix方法,通过直接组合两个高保真高斯化身实现服装迁移,并采用SeamFix和FullbodyFix两级细化策略解决接缝伪影和身体重塑后的外观保真问题。

Comments CVPR 2026 Findings. 16 pages, including supplementary material

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 425-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13333 2026-05-14 cs.CV cs.AI cs.GR cs.LG 62%

Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation

通过超网络驱动的低秩适应生成风格化文本到动作生成

Junhyuk Jeon, Seokhyeon Hong, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国庆熙大学视觉媒体实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出轻量级风格条件框架,通过超网络生成LoRA参数动态调节预训练扩散模型,实现高效且通用的风格化动作生成。

Comments Accepted to SIGGRAPH 2026. Project page: https://junhyukjeon.github.io/projects/style-salad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07823 2026-04-16 cs.CV cs.AI cs.MM 62%

LPM 1.0: Video-based Character Performance Model

LPM 1.0:基于视频的角色表现模型

Ailing Zeng, Casper Yang, Chauncey Ge, Eddie Zhang, Garvey Xu, Gavin Lin, Gilbert Gu, Jeremy Pi, Leo Li, Mingyi Shi, Shawn Wang, Sheng Bi, Steven Tang, Thorn Hang, Tobey Guo, Vincent Li, Xin Tong, Yikang Li, Yuchen Sun, Yue Zhao, Yuhan Lu, Yuwei Li, Zane Zhang, Zeshi Yang, Zi Ye

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出LPM 1.0模型,通过构建多模态数据集和训练扩散变换器,实现高可控性和身份一致性的角色表现生成,支持实时交互和无限长度生成。

Comments 43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22854 2026-03-27 cs.CV cs.GR cs.LG 62%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19900 2026-03-26 cs.CV cs.GR 62%

ExpPortrait: Expressive Portrait Generation via Personalized Representation

ExpPortrait:通过个性化表示生成表现力强的肖像

Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种高保真个性化头部表示,用于生成具有高表现力的肖像视频,通过引入表达转移模块实现不同身份间的头部姿态和表情细节转移,实验表明在身份保持、表情准确性和时间稳定性方面优于现有方法。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/ExpPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD 62%

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10256 2026-03-12 cs.SD cs.CV cs.GR 62%

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

ID-LoRA:基于身份的音频视频个性化与上下文LoRA

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 ID-LoRA通过联合生成音频和视频实现身份驱动的个性化,利用上下文LoRA技术在单次生成过程中提升语音与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18752 2026-02-24 cs.CV cs.GR 62%

Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

多模态大模型中ID一致性优化:通过对齐、纠缠与解纠缠进行面部修复

Yuran Dong, Hang Dai, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 EditedID通过引入对齐、解纠缠和纠缠机制,提升多模态大模型中面部身份一致性的修复能力。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23222 2025-12-30 cs.CV cs.MM 62%

Bridging Your Imagination with Audio-Video Generation via a Unified Director

通过统一导演模型实现想象力与音频视频生成的连接

Jiaxu Zhang, Tianshu Hu, Yuan Zhang, Zenan Li, Linjie Luo, Guosheng Lin, Xin Chen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 UniMAGE通过统一导演模型整合脚本起草与关键帧生成,提升非专业人士制作多镜头电影的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03013 2025-12-03 cs.CV cs.AI cs.GR 62%

In-Context Sync-LoRA for Portrait Video Editing

上下文同步LoRA用于肖像视频编辑

Sagi Polaczek, Or Patashnik, Ali Mahdavi-Amiri, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(Simon Fraser大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sync-LoRA通过上下文LoRA实现肖像视频编辑,保持帧同步和身份一致性,支持多样化的修改如外观变化和物体添加。

Comments Project page: https://sagipolaczek.github.io/Sync-LoRA/

详情

展开后加载摘要…

URL PDF HTML 收藏