arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2603.10702 2026-03-12 cs.CV 57%

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

UniCom: 通过压缩的连续语义表示实现统一多模态建模

Yaqi Zhao, Wang Lin, Zijian Zhang, Miles Yang, Jingyuan Chen, Wentao Zhang, Zhao Zhong, Liefeng Bo

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14552 2026-03-12 cs.CV 57%

OmniVTON++: Training-Free Universal Virtual Try-On with Principal Pose Guidance

OmniVTON++: 无需训练的通用虚拟试衣系统 with 主要姿态引导

Zhaotong Yang, Yong Du, Shengfeng He, Yuhui Li, Xinzhe Li, Yangyang Xu, Junyu Dong, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 OmniVTON++是一种无需训练的通用虚拟试衣系统,通过协调结构化服装变形、主要姿态引导和连续边界缝合,实现跨数据集和服装类型的高性能虚拟试衣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 57%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07691 2026-03-10 cs.RO cs.CV 57%

RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation

RoboPCA:基于姿态的从人类示范中学习空间可及性的方法用于机器人操作

Zhanqi Xiao, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboPCA通过联合预测接触区域和姿态,提升机器人操作中从人类示范中学习空间可及性的性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11952 2026-03-10 cs.CV 57%

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06672 2026-03-10 cs.CV cs.AI 57%

Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study

语义噪声初始化能否从图像迁移到视频?一项配对诊断研究

Yixiao Jing, Chaoyu Zhang, Zixuan Zhong, Peizhou Huang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。

Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG 57%

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 57%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05898 2026-03-09 cs.CV 57%

InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

InnoAds-Composer: 电商海报生成中的高效条件组合

Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law

机构 * JD.com, Inc.(京东公司) Chongqing University of Posts and Telecommunications(重庆邮电大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05845 2026-03-09 cs.CV 57%

Cog2Gen3D: Sculpturing 3D Semantic-Geometric Cognition for 3D Generation

Cog2Gen3D: 三维语义-几何认知雕刻用于三维生成

Haonan Wang, Hanyu Zhou, Haoyue Liu, Tao Gu, Luxin Yan

机构 * School of Artificial and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Cog2Gen3D通过结合语义和绝对几何信息,提出了一种三维认知引导的扩散框架,以实现可控的三维生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV 57%

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04843 2026-03-09 cs.CV 57%

PoI: A Filter to Extract Pixel of Interest from Novel Views for Scene Coordinate Regression

PoI: 一种从新视角提取感兴趣像素的滤波器用于场景坐标回归

Feifei Li, Qi Song, Chi Zhang, Hui Shuai, Rui Huang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoI通过像素级过滤策略提升场景坐标回归的定位精度,结合扩散模型和重投影误差优化新视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04899 2026-03-06 cs.CV 57%

FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation

FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值

Ganggui Ding, Hao Chen, Xiaogang Xu

机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24290 2026-03-06 cs.CV 57%

UFO-4D: Unposed Feedforward 4D Reconstruction from Two Images

UFO-4D:从两幅图像中进行无约束前馈4D重建

Junhwa Hur, Charles Herrmann, Songyou Peng, Philipp Henzler, Zeyu Ma, Todd Zickler, Deqing Sun

机构 * Google(谷歌) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 UFO-4D通过统一的前馈框架,从两幅图像中高效重建密集4D表示,实现3D几何、运动和相机姿态的联合估计,提升4D重建精度与效率。

Comments ICLR 2026, Project page: https://ufo-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09879 2026-03-05 cs.CV 57%

TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control

TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架

Zhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Ran Lin

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02802 2026-03-04 cs.CV 57%

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

NOVA:无配对视频编辑的稀疏控制与密集合成

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) WeChat, Tencent(微信、腾讯) The University of Hong Kong(香港大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02129 2026-03-03 cs.CV cs.AI 57%

LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation

LiftAvatar:基于运动空间的表达控制3D高斯人偶动画

Hualiang Wei, Shunran Jia, Jialun Liu, Wenhui Li

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 57%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25976 2026-03-03 cs.CV cs.AI q-bio.NC 57%

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

通过脑交互变换器从fMRI中进行图像重建

Roman Beliy, Amit Zalcher, Jonathan Kogman, Navve Wasserman, Michal Irani

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Brain-IT通过脑交互变换器从fMRI中实现高保真图像重建,结合高层语义和低层结构特征,提升重建精度与效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 57%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00443 2026-03-03 cs.CV 57%

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SesaHand: 通过语义和结构对齐可控生成增强3D手重建

Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Communication University of China(中国通信大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12811 2026-03-03 cs.CV cs.AI cs.LG 57%

Next Visual Granularity Generation

下一步视觉粒度生成

Yikai Wang, Zhouxia Wang, Zhonghua Wu, Qingyi Tao, Kang Liao, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21449 2026-03-02 cs.CV 57%

Towards Generating Realistic 3D Semantic Training Data for Autonomous Driving

朝向生成逼真3D语义训练数据以实现自动驾驶

Lucas Nunes, Rodrigo Marcuzzi, Jens Behley, Cyrill Stachniss

机构 * Center for Robotics, University of Bonn, Germany(bonn大学机器人中心) RWTH Aachen, Germany(亚琛工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(lamarr机器学习与人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需投影或分离开的多分辨率模型的3D语义生成方法,生成更逼真的场景数据,提升自动驾驶训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22742 2026-02-27 cs.CV 57%

ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

ProjFlow: 基于流匹配的投影采样用于零样本精确空间运动控制

Akihisa Watanabe, Qing Yu, Edgar Simo-Serra, Kent Fujiwara

机构 * Waseda University(早稻田大学) LY Corporation(LY公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ProjFlow通过引入运动学感知度量和时间变化公式,在无需训练的情况下实现精确空间约束满足,提升运动现实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22549 2026-02-27 cs.CV cs.AI 57%

DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成

Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Ziyao Lin, Cheng Lu

机构 * XPeng Motors

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 57%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV 57%

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19430 2026-02-26 cs.CV 57%

TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation

TherA: 用于可控RGB到热红外转换的热感知视觉-语言提示

Dong-Guw Lee, Tai Hyoung Rhee, Hyunsoo Jang, Young-Sik Shin, Ukcheol Shin, Ayoung Kim

机构 * Seoul National University(首尔国立大学) Kyungpook National University(庆北国立大学) KENTECH

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 TherA通过热感知视觉-语言提示方法,实现了可控的RGB到热红外转换,提升了翻译性能和细粒度控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏