arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2605.05781 2026-05-08 cs.CV cs.AI 57%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05722 2026-05-08 cs.CV 57%

$\mathcal{B}^{3}$-Net: Controlled Posterior Bridge Learning for Multi-Task Dense Prediction

$\mathcal{B}^{3}$-Net:多任务密集预测中的受控后验桥学习

Meihua Zhou, Li Yang

机构 * Wannan Medical University(皖南医学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$\mathcal{B}^{3}$-Net,通过可靠性估计、后验桥构建和受限再分配机制,改进多任务密集预测中任务证据的显式建模,提升共享表征的可靠性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14209 2026-05-08 cs.CV cs.AI 57%

ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control

ChArtist:通过统一的空间和主题控制生成图像图表

Shishi Xiao, Tongyu Zhou, David Laidlaw, Gromit Yeuk-Yin Chan

机构 * Adobe Research(Adobe研究院) Brown University(布朗大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ChArtist通过统一的空间和主题控制生成图像图表,结合骨骼基空间控制和主题驱动控制,提升数据准确性与视觉美感。

Comments Project page: https://chartist-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00893 2026-05-05 cs.CV cs.AI cs.IR 57%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00605 2026-05-04 cs.CV 57%

Faithful Extreme Image Rescaling with Learnable Reversible Transformation and Semantic Priors

基于可学习可逆变换和语义先验的忠实极端图像放大

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FaithEIR框架,通过可学习可逆变换和语义先验提升极端图像放大的真实性与细节,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 57%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 57%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13285 2026-04-30 cs.CV 57%

SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

SkyReels-Text: 精细可控字体文本编辑用于海报设计

Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen

机构 * Skywork AI

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出SkyReels-Text,一种可精细控制字体的文本编辑框架,支持多区域文本同时编辑,保留非编辑区域的视觉效果,无需字体标签或测试时微调,实现高质量字体控制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV 57%

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06100 2026-04-29 cs.CV 57%

High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

通过深度完整性先验和细粒度补丁策略实现高精度二元图像分割

Xianjie Liu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(合成视觉基础科学国家实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PDFNet网络,结合深度完整性先验和细粒度补丁策略,通过融合RGB和伪深度特征提升二元图像分割精度,实现更高效的高精度分割效果。

Journal ref IEEE Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19019 2026-04-28 cs.CV 57%

TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery

TokenTrace: 通过水印标记令牌恢复实现多概念归因

Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani

机构 * Adobe Research(Adobe研究院) University of California, San Diego(加州大学圣地亚哥分校) DECaDE, University of Surrey(Surrey大学DECaDE实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TokenTrace框架,通过在语义域中嵌入秘密签名,实现对生成图像中多个概念的鲁棒归因,实验表明其在单概念和多概念归因任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21291 2026-04-24 cs.CV cs.AI 57%

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19129 2026-04-22 cs.CV 57%

PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment

PortraitDirector: 一种用于可控和实时面部重演的分层解耦框架

Chaonan Ji, Jinwei Qi, Sheng Xu, Peng Zhang, Bang Zhang

机构 * Tongyi Lab(通义实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PortraitDirector框架,通过分层解耦策略实现高保真可控的面部重演,采用空间层和语义层解耦面部运动,并通过优化实现20FPS的实时重演。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18267 2026-04-21 cs.CV 57%

MARCO: Navigating the Unseen Space of Semantic Correspondence

MARCO:导航语义对应未知空间

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(德累斯顿理工大学) ELIZA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MARCO通过新颖的训练框架提升语义对应泛化能力,在多个数据集上取得新突破,同时更高效且更小。

Comments CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV 57%

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17802 2026-04-21 eess.IV cs.CV 57%

Optimally Bridging Semantics and Data: Generative Semantic Communication via Schrödinger Bridge

最优地弥合语义与数据:通过施罗德桥的生成语义通信

Dahua Gao, Ruichao Liu, Minxi Yang, Shuai Ma, Youlong Wu, Guangming Shi

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Pazhou Lab(琶洲实验室) Peng Cheng Laboratory(鹏城实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于施罗德桥的生成语义通信框架,通过优化传输轨迹减少幻觉和计算成本,改进FID和SSIM并加速推理速度。

Comments 23 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16796 2026-04-21 cs.CV cs.IT eess.SP math.IT 57%

Generative Semantic Communication via Alternating Dual-Domain Posterior Sampling

通过交替双域后验采样实现生成语义通信

Shunpu Tang, Qianqian Yang

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过交替双域后验采样提升无线图像传输的感知质量,解决传统方法在数据分布保留和领域间冲突的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-04-20 cs.CV 57%

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Chunchao Guo, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments https://fenghora.github.io/LaviGen-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13581 2026-04-16 cs.CV 57%

SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Inceptio Technology(Inceptio科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16385 2026-04-16 cs.CV 57%

Adaptive Multi-Scale Channel-Spatial Attention Aggregation Framework for 3D Indoor Semantic Scene Completion Toward Assisting Visually Impaired

自适应多尺度通道-空间注意力聚合框架用于3D室内语义场景补全以协助视障人士

Qi He, XiangXiang Wang, Jingtao Zhang, Yongbin Yu, Hongxiang Chu, Manping Fan, JingYe Cai, Zhenglin Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应多尺度注意力聚合框架,解决2D到3D特征提升中的噪声扩散和多尺度融合结构不稳定问题,通过通道-空间注意力机制和分层自适应门控策略提升小物体和桌子的识别精度,实验表明在NYUv2基准上mIoU达27.88%。

Comments We need to optimize the experiment, the changes are quite significant

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13028 2026-04-15 cs.CV 57%

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

融合反演建模生成多样且能引起温度变化的城区植被模式

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga

机构 * Computer Science(计算机科学) Forestry and Natural Resources(林业与自然资源)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出融合预测正模与扩散基生成反模的反演框架,用于生成多样且符合特定温度目标的城区植被模式,解决传统方法在数据稀少时无法捕捉模糊性的不足。

Comments Accepted to the CVPR 2026 EarthVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12322 2026-04-15 cs.CV 57%

Self-Adversarial One Step Generation via Condition Shifting

通过条件位移实现自对抗一步生成

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin

机构 * Westlake University(西拉丘学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出APEX框架,通过条件位移内生提取对抗信号,实现无需外部判别器的一步生成,提升生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 57%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 可控生成 :image generation(abstract);分类 cs.MM

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11843 2026-04-15 cs.CV 57%

UniMark: Unified Adaptive Multi-bit Watermarking for Autoregressive Image Generators

UniMark: 为自回归图像生成器设计的统一自适应多比特水印方案

Yigit Yilmaz, Elena Petrova, Mehmet Kaya, Lucia Rossi, Amir Rahman

机构 * Bandırma Onyedi Eylül University(班迪马奥克西迪埃普大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniMark提出一种无需训练的统一水印框架,解决自回归图像生成中水印嵌入能力弱、安全性和通用性差的问题,通过自适应语义分组、块级多比特编码和统一令牌替换接口实现高质量图像保护和多比特信息传输。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14671 2026-04-14 cs.CV 57%

Mirai: Autoregressive Visual Generation Needs Foresight

Mirai: 自回归视觉生成需要前瞻性

Yonghao Yu, Lang Huang, Zerun Wang, Runyi Li, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) Peking University(北京大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 研究探讨前瞻性训练信号对自回归视觉生成的影响,提出Mirai框架通过注入未来信息提升生成质量与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10132 2026-04-14 cs.CV cs.AI 57%

Semantic Manipulation Localization

语义操控定位

Zhenshan Tan, Chenhan Lu, Yuxiang Huang, Ziwen He, Xiang Zhang, Yuzhe Sha, Xianyi Chen, Tianrun Chen, Zhangjie Fu

机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证教育部工程研究中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) KOKONI3D, Moxin (Hangzhou) Technology Company Ltd.(KOKONI3D,魔芯(杭州)科技有限公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出语义操控定位任务,通过TRACE框架实现对图像中微妙语义编辑的定位,优于传统IML方法,提供更完整的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10030 2026-04-14 cs.CV 57%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏