arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2607.21027 2026-07-24 cs.CV 新提交 57%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19947 2026-07-23 cs.CV 新提交 57%

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

ETPDesigner:用于交互式多模态电子剧院节目的多智能体编排

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University(武汉大学数学与人工智能研究院武汉人工智能学院)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对电子剧院节目设计难题,提出ETPDesigner多智能体框架,能从戏剧脚本合成高质量ETP,通过全局风格锚定机制保证一致性,还实现交互功能,经ETP-Pro基准测试验证了方法在多方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17279 2026-07-21 cs.CR cs.AI cs.MM 新提交 57%

Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models

在安全边界之间:利用时间一致性破解文本到视频生成模型

Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.MM

AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17120 2026-07-21 cs.CV 新提交 57%

The generator is the tracker: Multi-object tracking by painting persistent identity colours

生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪

Haiyu Yang, Miel Hostens

机构 * Cornell University(康奈尔大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22098 2026-07-17 cs.CV 版本更新 57%

WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation

WorldWander:在视频生成中连接自我中心和外中心世界

Quanjian Song, Yiren Song, Kelly Peng, Yuan Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究聚焦视频生成中自我中心与外中心世界转换,提出WorldWander框架,基于视频扩散变换器,整合上下文视角对齐与协作位置编码,精心策划数据集,实验证明该框架在视角同步、角色一致性和泛化能力上表现卓越,设定了新基准。

Comments Accepted by ECCV 2026; Code: https://github.com/showlab/WorldWander

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12882 2026-07-15 cs.MM cs.IR 新提交 57%

What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval

你会点击什么?基于偏好感知高光检索的个性化视频缩略图生成

Zhiyu He, Zecheng Zhao, Tong Chen, Zi Huang, Yiqun Liu, Min Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 研究针对视频平台个性化视频缩略图生成问题,提出两阶段框架,先通过偏好感知检索选取视觉锚点,再经VLM引导的扩散管道生成缩略图,实验和用户研究证明该方法性能优且能提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12592 2026-07-15 cs.CV 新提交 57%

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction

WanToFight:用于多人战斗交互的实时生成游戏引擎

Li Hu, Guangyuan Wang, Peng Zhang, Bang Zhang

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 WanToFight是用于多人战斗交互的实时生成游戏引擎,基于Wan-1.3B视频扩散变换器构建三个组件,解决了先前引擎未共同处理的问题,能结合多种玩法,在特定配置下维持30FPS,是首个此类集成系统。

Comments Project Page: https://humanaigc.github.io/wantofight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 57%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06280 2026-07-14 cs.CV 版本更新 57%

Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency

欧拉运动引导:基于双向几何一致性的鲁棒图像动画

Thong Nguyen, Khoi M. Le, Cong-Duy Nguyen, Luu Anh Tuan, See-Kiong Ng, Chunyan Miao

机构 * National University of Singapore(新加坡国立大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心) Nanyang Technological University(南洋理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出使用相邻帧欧拉运动场引导生成,并通过双向几何一致性机制解决遮挡问题,实现加速训练、保持时间连贯性和减少动态伪影。

Comments Accepted by ACM MM 2026. Code is available at https://github.com/nguyentthong/eulerian_motion_guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04677 2026-07-07 cs.CV 新提交 57%

AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer

AnyStyle:单个LoRA足以实现图像引导的风格迁移

Yongwen Lai, Chaoqun Wang

机构 * School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究图像引导风格迁移,指出基于扩散方法存在内容与风格解缠难题。提出AnyStyle框架,采用统一单适配器范式,结合无训练结构引导,提升可控性与稳定性,实验显示性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02957 2026-07-07 cs.CV 新提交 57%

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal

ReLo-IRR:用于图像反射去除的反射引导LoRA框架

Chaoqun Wang, Yuehuan Wei, Haoxiang Cao, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(南方科技大学人工智能学院) University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像反射去除问题,提出基于整流流模型的ReLo-IRR框架。设计轻量级估计器预测反射强度描述符,引入时间条件机制,联合建模反射强度和去噪动态,有效抑制不同反射条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09030 2026-07-07 cs.CV cs.LG 版本更新 57%

When Style Similarity Scores Fail: Diagnosing Raw CSD Cosine in Artist-Style Evaluation

当风格相似性评分失效时:诊断原始CSD余弦在艺术家风格评估中的问题

Jörg Frochte

机构 * Bochum University of Applied Sciences(博湖应用科学大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种诊断方法,用于检验对比风格描述符(CSD)的原始余弦是否能作为绝对风格保真度评分。通过实验发现,CSD+方法在不同模型上均能有效减少负差距,提升评估准确性。

Comments 24 pages, 7 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08572 2026-07-07 cs.CV 版本更新 57%

ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction

增强多智能体轨迹预测的一致性模型

Alen Mrdovic, Qingze, Liu, Danrui Li, Mathew Schwartz, Kaidong Hu, Sejong Yoon, Mubbasir Kapadia, Vladimir Pavlovic

机构 * Rutgers University - New Brunswick(罗格斯大学-新不伦瑞克分校) New Jersey Institute of Technology(新泽西理工学院) The College of New Jersey(新泽西学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ECTraj,通过改进训练和条件生成方法,提升多智能体轨迹预测的一致性模型性能,实现更快推理和更准确预测,建立新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02208 2026-07-07 eess.IV cs.CV cs.LG 版本更新 57%

MACS: Measurement-Aware Consistency Sampling for Inverse Problems

MACS:用于逆问题的测量感知一致性采样

Amirreza Tanevardi, Pooria Abbas Rad Moghadam, Seyed Mohammad Eshtehardian, Sajjad Amini, Babak Khalaj

机构 * Department of Electrical Engineering(电气工程系) Sharif University of Technology(谢里夫大学) Electronics Research Institute(电子研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对逆成像问题,改进一致性采样框架,利用测量一致性机制调控采样随机性,兼顾数据保真与计算效率,实验表明该方法在多指标上有提升,少量采样步就能实现有竞争力或更优的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14746 2026-07-03 cs.CV 新提交 57%

Style-CCL: Content-Preserving Style Transfer via Curriculum Continual Learning

Style-CCL:通过课程持续学习实现内容保持的风格迁移

Shiwen Zhang, Haoyuan Wang, Xianghao Zang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器在风格迁移中内容与风格特征纠缠的问题,提出多阶段课程持续学习框架Style-CCL,通过从语义到纹理风格、从干净到合成数据的分阶段训练,并采用随机记忆排练防止灾难性遗忘,在风格相似性、内容一致性和美学质量上达到最优。

Comments code and models of QwenStyle are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer/ and https://github.com/Tele-AI/TeleStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28745 2026-06-30 cs.CV 57%

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 57%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27880 2026-06-29 cs.CV 新提交 57%

OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation

OrthoTryOn:面向无冲突统一时尚生成的几何正交化

Zhaotong Yang, Ying Tai, Jiahui Zhan, Yu Zheng, Jianjun Qian, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出OrthoTryOn框架,通过正交子空间投影和Fisher引导负向引导解决统一时尚生成中任务间梯度冲突,实现多任务协同优化。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22411 2026-06-25 cs.CV 版本更新 57%

StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation

StyleFusion360: 通过自适应风格调制实现视图一致的人头风格化

Furkan Guzelant, Arda Goktogan, Tarık Kaya, Aysegul Dundar

机构 * Bilkent University(比尔肯特大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出StyleFusion360,一种基于扩散的框架,通过自适应风格调制实现单风格参考图像的多视图一致、身份保持的3D人头风格化,无需逐风格训练,并支持强度控制和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 57%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23254 2026-06-23 cs.CV cs.AI 新提交 57%

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE: 具有风格和字形控制的无缝视频文本编辑

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SteerVTE框架,通过风格编码器和双粒度字形编码器控制冻结视频扩散模型,结合字形感知空间焦点损失和三阶段渐进训练,实现精确、连贯的视频文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18753 2026-06-18 cs.CV 新提交 57%

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data

SMART:一种灵活、可解释且可扩展的高分辨率成像数据时空脑图谱

John Kalkhof, Boris Gutman, Emile d'Angremont, Daniel C. Alexander, Marco Lorenzi

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) University College London(伦敦大学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SMART框架,通过解耦全局疾病动态与患者特定解剖表现,学习连续疾病时间图谱,实现高分辨率3D医学图像中时空变化的灵活、可解释和可扩展建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18156 2026-06-17 cs.CV cs.AI 新提交 57%

ReAge3D: Re-Aging 3D Faces with View Consistency

ReAge3D:具有视角一致性的3D人脸回龄

Libing Zeng, Li Ma, Mingming He, Ning Yu, Paul Debevec, Nima Khademi Kalantari

机构 * Texas A&M University(德克萨斯农工大学) Netflix Eyeline Studios

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ReAge3D框架,通过2D扩散模型DiffReaging和中心向外编辑传播策略,实现多视角一致的3D人脸回龄,保持身份和细节,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 57%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 57%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 57%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏