arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2512.23537 2026-01-05 cs.CV cs.AI 57%

AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization

AnyMS: 从下到上注意力解耦用于布局引导和无训练多主体定制

Binhe Yu, Zhen Wang, Kexin Li, Yuqian Yuan, Wenqiao Zhang, Long Chen, Juncheng Li, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Zhejiang Tobacco Monopoly Administration(浙江烟草专卖局)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnyMS通过从下到上的双层注意力解耦机制,实现无训练的布局引导多主体定制,有效解决文本对齐、主体身份保持和布局控制的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22464 2025-12-30 cs.CV cs.RO 57%

Pose-Guided Residual Refinement for Interpretable Text-to-Motion Generation and Editing

姿态引导的残差细化用于可解释的文本到运动生成与编辑

Sukhyun Jeong, Yong-Hoon Choi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 姿态引导的残差细化(PGR$^2$M)通过结合可解释姿态代码和残差代码提升文本到运动生成与编辑的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20619 2025-12-29 cs.CV 57%

SemanticGen: Video Generation in Semantic Space

SemanticGen: 语义空间中的视频生成

Jianhong Bai, Xiaoshi Wu, Xintao Wang, Xiao Fu, Yuanxing Zhang, Qinghe Wang, Xiaoyu Shi, Menghan Xia, Zuozhu Liu, Haoji Hu, Pengfei Wan, Kun Gai

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) DLUT(大连理工大学) HUST(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticGen通过在语义空间中生成视频,提高了长视频生成的效率和质量,优于现有方法。

Comments Project page: https://jianhongbai.github.io/SemanticGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19661 2025-12-23 cs.CV 57%

Over++: Generative Video Compositing for Layer Interaction Effects

Over++:用于层交互效果的生成视频合成

Luchao Qi, Jiaye Wu, Jun Myeong Choi, Cary Phillips, Roni Sengupta, Dan B Goldman

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland(马里兰大学) Industrial Light & Magic(工业光魔)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Over++是一种生成视频合成方法,通过文本提示和输入视频层生成逼真的环境效果,同时保留原始场景,无需假设相机姿态或深度信息。

Comments Project page: https://overplusplus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20431 2025-12-23 cs.CV cs.RO 57%

BRIC: Bridging Kinematic Plans and Physical Control at Test Time

BRIC: 在测试时弥合运动计划与物理控制之间的差距

Dohun Lim, Minji Kim, Jaewoon Lim, Sungchan Kim

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BRIC通过结合测试时适应与轻量级引导机制,实现长期人体运动生成的物理合理性和一致性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13031 2025-12-23 cs.CV 57%

Towards 3D Object-Centric Feature Learning for Semantic Scene Completion

面向语义场景补全的3D物体感知特征学习

Weihua Wang, Yubo Cui, Xiangru Lin, Zhiheng Li, Zheng Fang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ocean框架,通过分解场景为独立物体实例,提升语义场景补全的精度和性能。

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 57%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17040 2025-12-22 cs.CV 57%

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14280 2025-12-22 cs.CV 57%

EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the Wild

EasyHOI: 释放大模型潜力以重建真实场景中的手-物体交互

Yumeng Liu, Xiaoxiao Long, Zemin Yang, Yuan Liu, Marc Habermann, Christian Theobalt, Yuexin Ma, Wenping Wang

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) Hong Kong University of Science and Technology(香港科学大学) Nanyang Technological University(南洋理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Texas A&M University(德克萨斯大学奥斯汀分校)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 EasyHOI利用大模型实现单视角下手-物体交互的重建,通过先验引导优化提升重建精度。

Comments Project page: https://lym29.github.io/EasyHOI-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16913 2025-12-19 cs.CV 57%

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

全景深度估计的基础模型:Depth Any Panoramas

Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi

机构 * Insta360 Research(Insta360研究院) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种全景深度估计的基础模型,通过三阶段伪标签流程和优化方法提升模型在不同场景下的鲁棒性和泛化能力。

Comments Project Page: https://insta360-research-team.github.io/DAP_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12998 2025-12-19 cs.CV 57%

PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching

PerTouch:基于VLM的个性化和语义图像润色代理

Zewei Chang, Zheng-Peng Duan, Jianxing Zhang, Chun-Le Guo, Siyu Liu, Hyungju Chun, Hyunhee Park, Zikun Liu, Chongyi Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PerTouch通过VLM驱动代理实现个性化和语义图像润色,结合语义替换与参数扰动机制,提升用户意图匹配与长期偏好捕捉能力。

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15524 2025-12-18 cs.CV 57%

DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画

Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。

Comments Projectpage: https://syx132.github.io/DeX-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15310 2025-12-18 cs.CV 57%

SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation

SynthSeg-Agents: 多智能体合成数据生成用于零样本弱监督语义分割

Wangyu Wu, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SynthSeg-Agents利用大型语言模型生成合成数据,无需现实图像即可实现零样本弱监督语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07981 2025-12-18 cs.CV cs.AI 57%

Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation

Omni-Effects: 统一且空间可控的视觉效果生成

Fangyuan Mao, Aiming Hao, Jintao Chen, Dongxia Liu, Xiaokun Feng, Jiashu Zhu, Meiqi Wu, Chubin Chen, Jiahong Wu, Xiangxiang Chu

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 Omni-Effects通过统一框架实现空间可控的多效果生成,结合LoRA-MoE和SAP技术,提升视觉效果生成的精度和多样性。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07712 2025-12-17 cs.CV 57%

UnCageNet: Tracking and Pose Estimation of Caged Animal

UnCageNet: 有笼动物的跟踪与姿态估计

Sayak Dutta, Harish Katti, Shashikant Verma, Shanmuganathan Raman

机构 * Indian Institute of Technology Gandhinagar(印度古吉拉特邦理工学院加尔各答分校) National Institutes of Health (NIH)(美国国家卫生研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 UnCageNet通过三阶段预处理流程有效解决笼子结构和遮挡对动物跟踪与姿态估计的影响,提升姿态估计和关键点检测精度。

Comments 9 pages, 2 figures, 2 tables. Accepted to the Indian Conference on Computer Vision, Graphics, and Image Processing (ICVGIP 2025), Mandi, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 57%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14162 2025-12-17 cs.CV 57%

FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation

FastDDHPose: 向统一、高效且解耦的3D人体姿态估计迈进

Qingyuan Cai, Linxin Zhang, Xuecai Hu, Saihui Hou, Yongzhen Huang

机构 * Watrix Technology Limited Company Ltd(沃特克斯技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FastDDHPose通过解耦扩散模型提升3D人体姿态估计的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2025-12-17 cs.CV 57%

Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13008 2025-12-16 cs.CV 57%

TWLR: Text-Guided Weakly-Supervised Lesion Localization and Severity Regression for Explainable Diabetic Retinopathy Grading

TWLR: 基于文本引导的弱监督病变定位与严重程度回归用于可解释性糖尿病视网膜病变分级

Xi Luo, Shixin Xu, Ying Xie, JianZhong Hu, Yuwei He, Yuhui Deng, Huaxiong Huang

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省级交叉学科研究与数据科学应用重点实验室) Department of Statistics and Data Science, Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学统计与数据科学系) Faculty of Science, Hong Kong Baptist University(香港 Baptist大学科学学院) Data Science Research Center, Duke Kunshan University(杜克-昆山大学数据科学研究中心) Shanxi Provincial People’s Hospital(山西人民医院) The Fifth Clinical Medical school of Shanxi Medical University(山西医科大学第五临床医学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心) Department of Mathematics and Statistics, York University(约克大学数学与统计学系)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 TWLR通过双阶段框架实现糖尿病视网膜病变的可解释性评估,结合视觉语言模型和弱监督分割,实现病变定位与严重程度回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 57%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12664 2025-12-16 cs.CV 57%

InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture Generation

InteracTalker: 基于提示的人-物体交互与同步手势生成

Sreehari Rajan, Kunal Bhosikar, Charu Sharma

机构 * Machine Learning Lab, IIIT Hyderabad, India(IIIT Hyderabad 机器学习实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InteracTalker通过整合基于提示的物体感知交互与同步手势生成,实现了人-物体交互的统一框架,提升了动作的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11645 2025-12-15 cs.CV 57%

FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint

FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画

Jiapeng Tang, Kai Li, Chengxiang Yin, Liuhao Ge, Fei Jiang, Jiu Xu, Matthias Nießner, Christian Häne, Timur Bagautdinov, Egor Zakharov, Peihong Guo

机构 * Meta Reality Labs(Meta现实实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。

Comments Project page: https://tangjiapeng.github.io/FactorPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09585 2025-12-15 cs.SD cs.MM 57%

Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation

视频中的音乐:语义、时间与节奏对齐用于视频到音乐生成

Xinyi Tong, Yiran Zhu, Jishang Chen, Chunru Zhan, Tianle Wang, Sirui Zhang, Nian Liu, Tiezheng Ge, Duo Xu, Xin Jin, Feng Yu, Song-Chun Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

AI总结 VeM通过语义、时间和节奏对齐,生成高质量视频到音乐,提升视听沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05029 2025-12-15 cs.CV 57%

Estimating Object Physical Properties from RGB-D Vision and Depth Robot Sensors Using Deep Learning

基于RGB-D视觉和深度机器人传感器利用深度学习估计物体物理特性

Ricardo Cardoso, Plinio Moreno

机构 * Ricardo Pedreiras Cardoso Plinio Moreno

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出结合深度图像和RGB图像的数据,利用深度学习方法估计物体质量,通过合成数据集提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 57%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 57%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08591 2025-12-12 cs.CV 57%

Joint2Human: High-quality 3D Human Generation via Compact Spherical Embedding of 3D Joints

Joint2Human: 通过紧凑的球面嵌入3D关节实现高质量3D人体生成

Muxin Zhang, Qiao Feng, Zhuo Su, Chao Wen, Zhou Xue, Kun Li

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) PICO IDL, ByteDance China(字节跳动中国PICO IDL) Li Auto(利亚德)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Joint2Human通过紧凑球面嵌入3D关节,结合2D扩散模型和多视角重绘策略,实现高质量3D人体生成,兼顾全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08534 2025-12-10 cs.CV 57%

PaintFlow: A Unified Framework for Interactive Oil Paintings Editing and Generation

PaintFlow:一种用于交互式油画创作与生成的统一框架

Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni

机构 * Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni(张立虎、陈叶、姚佳君、倪炳炳)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 PaintFlow提出了一种统一框架,通过多模态输入实现交互式油画创作与编辑,利用空间对齐、语义增强和自监督风格迁移技术,提升油画生成与编辑的风格一致性与艺术表现力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏