arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2602.15031 2026-04-02 cs.CV 57%

EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

EditCtrl: 解耦的局部和全局控制用于实时生成视频编辑

Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl Marshall, Shubham Tulsiani, Caleb Leak

机构 * Meta Reality Labs(Meta现实实验室) Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出EditCtrl,通过局部和全局控制模块实现高效视频修复,提升编辑质量和计算效率,支持多区域编辑和内容传播。

Comments Project page: https://yehonathanlitman.github.io/edit_ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG 57%

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29570 2026-04-01 cs.CV cs.AI 57%

Generating Key Postures of Bharatanatyam Adavus with Pose Estimation

通过姿态估计生成巴赫提亚姆阿达夫的关键姿态

Jagadish Kashinath Kamble, Jayanta Mukhopadhyay, Debaditya Roy, Partha Pratim Das

机构 * Indian Institute of Technology(印度理工学院) Ashoka University(阿育王大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合姿态估计模块的生成框架,通过关键点损失和姿态一致性约束,提升巴赫提亚姆阿达夫关键姿态的生成精度与文化真实性。

Comments Published in ICVGIP, 2025

Journal ref In Proceedings of the Indian Conference on Computer Vision, Graphics and Image Processing (ICVGIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG 57%

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 57%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 57%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV 57%

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27513 2026-03-31 cs.CV cs.AI 57%

Understanding Semantic Perturbations on In-Processing Generative Image Watermarks

理解生成图像水印在处理过程中的语义扰动

Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27206 2026-03-31 cs.CV 57%

Make It Up: Fake Images, Real Gains in Generalized Few-shot Semantic Segmentation

让它补上:假图像,真实增益在通用少样本语义分割中

Guohuan Xie, Xin He, Dingying Fan, Le Zhang, Ming-Ming Cheng, Yun Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Syn4Seg框架,通过生成增强方法提升通用少样本语义分割的新型类别覆盖和伪标签质量,实验显示在PASCAL-5i和COCO-20i上实现了1-shot和5-shot设置下的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV 57%

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 57%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 57%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25985 2026-03-30 cs.CV 57%

JRM: Joint Reconstruction Model for Multiple Objects without Alignment

JRM:无对齐的多物体联合重建模型

Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出JRM模型,通过将物体重建视为个性化生成任务,利用重复信号提升重建质量,无需显式对齐,增强鲁棒性并自然处理非刚性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 57%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25728 2026-03-27 cs.CV cs.AI 57%

PixelSmile: Toward Fine-Grained Facial Expression Editing

PixelSmile:迈向细粒度面部表情编辑

Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun(阶跃星辰)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。

Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25357 2026-03-27 cs.CV 57%

InstanceAnimator: Multi-Instance Sketch Video Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Kunyu Feng, Yeying Jin, Qifeng Chen, Anyi Rao, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23381 2026-03-25 cs.CV 57%

FG-Portrait: 3D Flow Guided Editable Portrait Animation

FG-Portrait: 基于3D流的可编辑肖像动画

Yating Xu, Yunqi Miao, Evangelos Ververas, Jiankang Deng, Jifei Song

机构 * National University of Singapore(新加坡国立大学) University of Warwick(沃里克大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FG-Portrait,通过3D流引导的方法实现高质量的肖像动画生成,结合3D几何信息和扩散模型,提升驱动运动与源肖像的对应精度,并支持用户对表情和头部姿态的编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV 57%

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21786 2026-03-24 cs.CV eess.IV 57%

The Universal Normal Embedding

通用正态嵌入

Chen Tasker, Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通用正态嵌入假设,通过实验验证编码器和生成模型共享的高斯潜在空间,展示其在属性预测和可控编辑中的应用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01583 2026-03-24 cs.CV 57%

3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting

3DSceneEditor: 基于高斯散射的可控3D场景编辑

Ziyang Yan, Yihua Shao, Minwen Liao, Siyu Chen, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao, Fabio Remondino, Lei Li

机构 * D Optical Metrology unit, Fondazione Bruno Kessler(3D光学测绘单元,布鲁诺·凯斯勒基金会) Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3DSceneEditor,通过高斯散射实现高效精准的3D场景编辑,整合实例分割模型与CLIP实现语义对齐,支持对象添加、重定位等操作,实验表明其在精度和效率上优于现有方法。

Comments Accepted by WACV 2026, Project Page: https://ziyangyan.github.io/3DSceneEditor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21998 2026-03-24 cs.CV cs.RO 57%

Causal World Modeling for Robot Control

机器人控制中的因果世界建模

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LingBot-VA框架,通过视频世界建模与视觉语言预训练结合,实现机器人学习的新基础。模型包含共享潜在空间、闭环回滚机制和异步推理流程,提升了长周期操作和数据效率。

Comments Project page: https://technology.robbyant.com/lingbot-va Code: https://github.com/robbyant/lingbot-va

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11474 2026-03-24 cs.CV 57%

HUG-VAS: A Hierarchical NURBS-Based Generative Model for Aortic Geometry Synthesis and Controllable Editing

HUG-VAS:一种基于层次NURBS的生成模型用于主动脉几何合成与可控编辑

Pan Du, Mingqi Xu, Xiaozhi Zhu, Jian-xun Wang

机构 * Department of Aerospace and Mechanical Engineering, University of Notre Dame(notre dame 大学航空航天与机械工程系) Sibley School of Mechanical and Aerospace Engineering, Cornell University(cornell 大学机械与航空航天工程学院) Department of Applied and Computational Mathematics and Statistics, University of Notre Dame(notre dame 大学应用与计算数学与统计学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HUG-VAS通过结合NURBS参数化与层次扩散模型,实现主动脉几何的精细合成与可控编辑,支持零样本生成与临床应用。

Comments 64 pages, 9 figures, 6 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV 57%

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19667 2026-03-23 cs.CV cs.AI 57%

Toward High-Fidelity Visual Reconstruction: From EEG-Based Conditioned Generation to Joint-Modal Guided Rebuilding

迈向高保真视觉重建:从基于EEG的条件生成到联合模态引导重建

Zhijian Gong, Tianren Yao, Wenjia Dong, Xueyuan Xu

机构 * Beijing University of Technology, Beijing(北京理工大学) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing(北京计算智能与智能系统重点实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出联合模态视觉重建框架,通过独立学习EEG和文本信息,提升EEG特征的重建能力,结合多尺度编码和图像增强,实现高保真视觉重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19547 2026-03-23 cs.CV 57%

SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification

SeeClear: 通过生成性消透明实现可靠的透明物体深度估计

Xiaoying Wang, Yumeng He, Jingkai Shi, Jiayin Lu, Yin Yang, Ying Jiang, Chenfanfu Jiang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SeeClear通过生成性消透明技术,将透明物体转换为几何一致的不透明图像,从而提升单目深度估计的稳定性与准确性。

Comments Project page: https://heyumeng.com/SeeClear-web/. 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18427 2026-03-20 cs.CV cs.AI 57%

R&D: Balancing Reliability and Diversity in Synthetic Data Augmentation for Semantic Segmentation

R&D: 在语义分割中平衡可靠性与多样性以合成数据增强

Huy Che, Dinh-Duy Phan, Duc-Khai Lam

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。

Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16098 2026-03-20 cs.CV cs.AI 57%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏