arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 40 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 40 篇

2606.05816 2026-06-09 cs.CV cs.AI 版本更新 90%

Emotion-Aware Image Generation from Korean Diary Text via LLM-based Prompt Translation and LoRA Fine-Tuning

基于LLM提示翻译和LoRA微调的韩语日记文本情感感知图像生成

Jihun Cho, Soo-Yeon Jeong, Sun-Young Ihm

机构 * KAIST(韩国科学技术院)

专题命中 个性化与一致性 :diffusion(summary_cn,abstract);image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种情感感知文本到图像流水线,利用Qwen3-8B识别短日记中的隐含情感,并通过LoRA微调Stable Diffusion 3.5 Medium生成儿童手绘风格图像,同时探讨情感触发词的影响及CLIP Score作为评估指标的局限性。

Comments 4 pages, 4 figures, 2 tables, MITA 2026

Journal ref Proc. Int. Conf. Multimedia, Information Technology and its Applications (MITA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29569 2026-06-09 cs.CR 版本更新 88%

LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models

LoRA-Key:面向用户的文本到图像扩散模型LoRA水印

Yaopeng Wang, Qingliang Wang, Zhibo Wang, Huiyu Xu, Jiacheng Du, Qiu Wang, Jia-Li Yin, Kui Ren

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 提出LoRA-Key框架,通过可重用的用户特定水印LoRA实现版权保护,无需重新训练或修改目标LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08090 2026-07-01 cs.CV cs.AI 版本更新 86%

DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation

DSH-Bench: 一个具有层次化主体分类的难度和场景感知基准,用于主体驱动的文本到图像生成

Zhenyu Hu, Qing Wang, Te Cao, Luo Liao, Longfei Lu, Liqun Liu, Shuang Li, Hang Chen, Mengge Xue, Yuan Chen, Chao Deng, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 个性化与一致性 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 DSH-Bench通过四个创新解决现有基准的不足,提供层次化主体分类和细粒度评估,引入SICS指标提升主体保持度评估,并通过实验证明其在模型优化中的指导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00903 2026-06-09 cs.CV 版本更新 85%

IDDM: Identity-Decoupled Personalized Diffusion Models with a Tunable Privacy-Utility Trade-off

IDDM: 一种具有可调隐私-效用权衡的去标识化个性化扩散模型

Linyan Dai, Xinwei Zhang, Haoyang Li, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出IDDM模型,通过在个性化流程中集成身份解耦,实现授权个性化的同时降低公开生成的身份可链接性,可调隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20807 2026-07-20 cs.CV 版本更新 83%

Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction

通过中间结构预测分解主体驱动的图像生成

Hanzhong Guo, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出了一种两阶段框架,通过先预测Canny图再基于源外观和预测结构生成最终图像,以解决主体驱动文本到图像生成中高频率身份细节如logo、图案和文本的保留问题,并通过自动管道构建了10万对文本感知数据集,实验结果表明中间结构预测能有效提升高保真主体驱动生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17195 2026-07-07 cs.CV 版本更新 83%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12675 2026-06-10 cs.CV cs.AI 版本更新 79%

Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling

Scone:通过统一理解-生成建模弥合主体驱动图像生成中的组合与区分

Yuran Wang, Bohan Zeng, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Academy(中关村学院) HKUST(香港科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出Scone方法,通过统一理解-生成模型结合组合与区分能力,采用两阶段训练实现主体身份保持与干扰最小化,在双基准上优于现有开源模型。

Comments CVPR 2026 Highlight. Code: https://github.com/Ryann-Ran/Scone

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04140 2026-08-06 eess.AS cs.CL 版本更新 78%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24197 2026-07-07 cs.CL cs.AI 版本更新 78%

Seeing Is No Longer Believing: Frontier Image Generation Models, Synthetic Visual Evidence, and Real-World Risk

看到不再等于相信:前沿图像生成模型、合成视觉证据与现实世界风险

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 个性化与一致性 :image generation(title,abstract)

AI总结 本文探讨前沿图像生成模型带来的合成视觉证据风险,分析其对社会信任的影响,并提出多层面的控制措施以降低现实世界中的潜在危害。

Comments Technical report. 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10293 2026-07-16 math.NA cs.NA 版本更新 71%

An improved estimate of the intermediate internal energy in the energy-consistent HLLD scheme

关于《HLL型MHD黎曼求解器中间状态的能量一致性》中HLLD型格式的数值扩散问题

Fan Zhang

专题命中 个性化与一致性 :diffusion(title)

AI总结 研究针对戴 - 伍德沃德激波管问题中HLLD-ec格式出现的密度振荡,提出对该格式的简单修改,核心方法是修改格式,主要贡献是消除了密度振荡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01973 2026-08-05 cs.CV 版本更新 70%

NearID: Identity Representation Learning via Near-identity Distractors

NearID: 通过近身份干扰实现身份表示学习

Aleksandar Cvejic, Rameen Abdal, Abdelrahman Eldesokey, Bernard Ghanem, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Snap Research(Snap研究院)

专题命中 个性化与一致性 :image editing(abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出NearID框架,通过近身份干扰消除背景影响,提升身份识别精度,改进模型在个性化生成和图像编辑任务中的表现。

Comments Accepted to ECCV 2026, Code, model, and dataset are released, visit https://github.com/Gorluxor/NearID

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26633 2026-07-23 cs.CV cs.AI 版本更新 70%

SynSur: An end-to-end generative pipeline for synthetic industrial surface defect generation and detection

SynSur:一种端到端的生成管道用于合成工业表面缺陷的生成与检测

Paul Julius Kühn, Mika Pommeranz, Arjan Kuijper, Saptarshi Neil Sinha

机构 * Fraunhofer IGD(弗劳恩霍夫工业驱动研究所)

专题命中 个性化与一致性 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出SynSur端到端生成管道,结合视觉-语言模型提示、LoRA适应扩散、掩码引导修复和样本筛选,通过合成数据缓解工业缺陷检测数据稀缺问题,并在跨领域迁移中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22679 2026-06-23 cs.LG cs.CV 版本更新 70%

Stabilizing Consistency Training: A Flow Map Analysis and Self-Distillation

稳定一致性训练:流映射分析与自蒸馏

Youngjoong Kim, Duhoe Kim, Woosung Kim, Jaesik Park

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Seoul National University(首尔国立大学) Interdisciplinary Program in Artificial Intelligence(人工智能跨学科项目)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文从流映射角度分析一致性模型的不稳定性与退化解,提出基于自蒸馏的优化策略以避免梯度爆炸,并在图像生成和扩散策略学习中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12583 2026-07-23 cs.DC 版本更新 67%

Scaling Synthetic-Image Pre-Training for Federated Fine-Tuning of Large Vision Models

扩展用于大型视觉模型联邦微调的合成图像预训练

Qianpiao Ma, Xiaozhu Song, Junlong Zhou, Yue Zeng, Jianchun Liu, Huaqing Tu

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

AI总结 研究针对联邦微调中资源限制、系统异构性和非IID数据等挑战,提出统一框架FeDiSyn。通过缩放定律、基于扩散的合成图像生成及贡献感知LoRA配置和带宽分配算法,减少训练时间和通信成本,提升训练和准确率。

Comments This paper has been accepted by International Conference on Parallel Processing (ICPP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09303 2026-06-24 cs.LG cs.NA math.NA 版本更新 67%

Stabilizing Physics-Informed Consistency Models via Structure-Preserving Training

通过保结构训练稳定物理信息一致性模型

Che-Chia Chang, Chen-Yang Dai, Te-Sheng Lin, Ming-Chih Lai, Chieh-Hsin Lai

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所) National Yang Ming Chiao Tung University(国立阳明交通大学) Department of Applied Mathematics(应用数学系) National Center for Theoretical Sciences(理论科学研究中心) National Taiwan University(国立台湾大学)

专题命中 个性化与一致性 :diffusion(abstract);inpainting(abstract)

AI总结 提出物理信息一致性建模框架,通过保结构两阶段训练策略和两步残差目标,解决物理约束下一致性训练的不稳定性,实现快速、高保真的PDE求解。

Comments Accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23094 2026-08-11 cs.CV cs.GR cs.LG 版本更新 62%

FusionRelight: Relighting Portraits in Real Time via Hybrid Domain Knowledge Fusion

面向真实场景中人像重照明的混合领域知识融合

Qian Huang, Mayoore Selvarasa Jaiswal, Zhen Zhong, Rochelle Pereira, Jianyuan Min

机构 * NVIDIA

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出混合领域知识融合方法,通过融合合成、单光源和真实数据集的优势,提升人像重照明的实用性与效率,实现6至240倍的推理加速且保持SOTA视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 57%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 57%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21138 2026-08-07 cs.CV 版本更新 57%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26976 2026-08-03 cs.CR cs.CV 版本更新 57%

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

InkShield:抵御未授权笔迹模仿的书写风格保护

Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 57%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13349 2026-07-31 cs.CV cs.AI 版本更新 57%

ID-Guard: A Universal Framework for Combating Facial Manipulation via Breaking Identification

ID-Guard:一种通过破坏身份特征来对抗面部操纵的通用框架

Zuomin Qu, Wei Lu, Xiangyang Luo, Qian Wang, Xiaochun Cao

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 本研究针对面部操纵滥用的问题,提出ID-Guard通用框架,通过身份破坏模块生成跨模型可迁移扰动,可防御多种操纵模型并集成到其他任务中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23023 2026-07-29 cs.CV 版本更新 57%

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate:用于交互式虚拟化身的开放式实时流视听生成

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 57%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22098 2026-07-17 cs.CV 版本更新 57%

WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation

WorldWander:在视频生成中连接自我中心和外中心世界

Quanjian Song, Yiren Song, Kelly Peng, Yuan Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究聚焦视频生成中自我中心与外中心世界转换,提出WorldWander框架,基于视频扩散变换器,整合上下文视角对齐与协作位置编码,精心策划数据集,实验证明该框架在视角同步、角色一致性和泛化能力上表现卓越,设定了新基准。

Comments Accepted by ECCV 2026; Code: https://github.com/showlab/WorldWander

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06280 2026-07-14 cs.CV 版本更新 57%

Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency

欧拉运动引导:基于双向几何一致性的鲁棒图像动画

Thong Nguyen, Khoi M. Le, Cong-Duy Nguyen, Luu Anh Tuan, See-Kiong Ng, Chunyan Miao

机构 * National University of Singapore(新加坡国立大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心) Nanyang Technological University(南洋理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出使用相邻帧欧拉运动场引导生成,并通过双向几何一致性机制解决遮挡问题,实现加速训练、保持时间连贯性和减少动态伪影。

Comments Accepted by ACM MM 2026. Code is available at https://github.com/nguyentthong/eulerian_motion_guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09030 2026-07-07 cs.CV cs.LG 版本更新 57%

When Style Similarity Scores Fail: Diagnosing Raw CSD Cosine in Artist-Style Evaluation

当风格相似性评分失效时:诊断原始CSD余弦在艺术家风格评估中的问题

Jörg Frochte

机构 * Bochum University of Applied Sciences(博湖应用科学大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种诊断方法,用于检验对比风格描述符(CSD)的原始余弦是否能作为绝对风格保真度评分。通过实验发现,CSD+方法在不同模型上均能有效减少负差距,提升评估准确性。

Comments 24 pages, 7 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏