arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2602.13693 2026-03-18 cs.CV 83%

A WDLoRA-Based Multimodal Generative Framework for Clinically Guided Corneal Confocal Microscopy Image Synthesis in Diabetic Neuropathy

基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成

Xin Zhang, Liangxiu Han, Tam Sobeih, Yue Shi, Yalin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11542 2026-03-17 cs.CV 83%

Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models

无穷尽:VAR和扩散T2I模型中的组合对齐

Hossein Shahabadi, Niki Sepasian, Arash Marioriyad, Ali Sharifi-Zarchi, Mahdieh Soleymani Baghshah

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文评估了六种T2I模型在组合对齐上的表现,发现Infinity-8B在整体对齐上表现最佳,而Infinity-2B在多个类别中表现优异,揭示了高效性能的平衡。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10489 2026-03-13 cs.CV 83%

Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation

面向细粒度图像生成的头部适应性旋转位置编码

Jiaye Li, Baoyou Chen, Hui Li, Zilong Dong, Jingdong Wang, Siyu Zhu

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HARoPE,一种面向细粒度图像生成的头部适应性旋转位置编码方法,通过动态频率分配和语义对齐提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06993 2026-03-10 cs.CV 83%

AdaGen: Learning Adaptive Policy for Image Synthesis

AdaGen: 为图像合成学习自适应策略

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 AdaGen通过学习自适应策略提升图像合成性能,采用强化学习优化调度过程,实现更高效的生成效果和可控的保真度-多样性权衡。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06666 2026-03-10 cs.CV 83%

SJD-PV: Speculative Jacobi Decoding with Phrase Verification for Autoregressive Image Generation

SJD-PV: 基于短语验证的推测雅可比解码用于自回归图像生成

Zhehao Yu, Baoquan Zhang, Bingqi Shan, Xinhao Liu, Dongliang Zhou, Guotao Liang, Guangming Ye, Yunming Ye

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 SJD-PV通过短语级推测验证提升自回归图像生成的解码效率,减少函数评估次数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05681 2026-03-09 cs.CV 83%

Culture in Action: Evaluating Text-to-Image Models through Social Activities

行动中的文化:通过社交活动评估文本到图像模型

Sina Malakouti, Boqing Gong, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学) Boston University(波士顿大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CULTIVate是一个用于评估文本到图像模型在跨文化社交活动上文化忠实度的基准,通过四个指标衡量文化契合度、幻觉、夸张元素和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04687 2026-03-03 cs.CL cs.CV cs.CY cs.HC 83%

Investigating Disability Representations in Text-to-Image Models

探究文本到图像模型中的残疾表示

Yang Tian, Yu Fan, Liudmila Zavolokina, Sarah Ebling

机构 * Department of Computational Linguistics University of Zurich(计算语言学系 苏黎世大学) Center for Law & Economics ETH Zurich(法律与经济学中心 伯尔尼联邦理工学院) Department of Information Systems University of Lausanne(信息系统系 瑞士洛桑大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究了文本到图像模型中残疾表示的问题,通过分析不同提示下的图像输出,揭示了残疾表示的不平衡,并提出通过缓解策略提升包容性。

Comments 21 pages, 9 figures. References included

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00523 2026-03-03 cs.CV 83%

SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

SenseFlow: 为基于流的文本到图像蒸馏扩展分布匹配

Xingtong Ge, Xin Zhang, Tongda Xu, Yi Zhang, Xinjie Zhang, Yan Wang, Jun Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) SenseTime Research(商汤科技研究院) Vivix AI(维维克斯人工智能) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究所)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 SenseFlow通过引入隐式分布对齐和段内指导,解决大规模基于流的文本到图像模型蒸馏中的收敛问题,提升蒸馏效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22120 2026-02-26 cs.CV 83%

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

GeoDiv:文本到图像模型中地理多样性测量的框架

Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14868 2026-02-26 cs.CV 83%

Twin Co-Adaptive Dialogue for Progressive Image Generation

双适应对话用于渐进式图像生成

Jianhui Wang, Yangfan He, Yan Zhong, Xinyuan Song, Jiayi Su, Yuheng Feng, Ruoyu Wang, Hongyang He, Wenyu Zhu, Xinhang Yuan, Miao Zhang, Keqin Li, Jiaqi Chen, Tianyu Shi, Xueqian Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Peking University(北京大学) Emory University(埃默里大学) Xiamen University Malaysia(马来西亚厦门大学) Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) University of Warwick(沃里克大学) Washington University, Saint Louis(圣路易斯华盛顿大学) University of Toronto(多伦多大学) Google(谷歌)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Twin-Co通过同步对话优化图像生成,提升生成质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19578 2026-02-13 cs.CV 83%

Multiscale Vector-Quantized Variational Autoencoder for Endoscopic Image Synthesis

多尺度向量量化变分自编码器用于内窥镜图像合成

Dimitrios E. Diamantis, Dimitris K. Iakovidis

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出多尺度向量量化变分自编码器,用于生成内窥镜图像中的异常,提升临床决策支持系统的性能。

Journal ref Proc. IEEE International Conference on Imaging Systems and Techniques (IST 2025), Strasburg, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22761 2026-02-11 cs.CV cs.AI 83%

MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning

MILR:通过测试时潜在推理改进多模态图像生成

Yapeng Mi, Yanpeng Zhao, Hengli Li, Chenxi Li, Huimin Wu, Xiaojian Ma, Song-Chun Zhu, Ying Nian Wu, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 MILR通过测试时潜在推理提升多模态图像生成性能,实现跨模态推理和统一潜在空间优化。

Comments 21 pages,14 figures,9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01756 2026-02-03 cs.CV 83%

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush: 将代理认知搜索与推理整合到图像生成中

Jun He, Junyan Ye, Zilong Huang, Dongzhi Jiang, Chenjue Zhang, Leqi Zhu, Renrui Zhang, Xiang Zhang, Weijia Li

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。

Comments 36 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02295 2026-02-03 cs.CV 83%

Data-Driven Loss Functions for Inference-Time Optimization in Text-to-Image

面向文本到图像推理时间优化的数据驱动损失函数

Sapir Esther Yiflach, Yuval Atzmon, Gal Chechik

机构 * Bar-Ilan University(巴伊兰大学) NVIDIA(英伟达)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出 Learn-to-Steer 框架,通过学习数据驱动的损失函数提升文本到图像模型的空间推理能力,显著提高多个基准测试的准确性。

Comments Project page is at https://learn-to-steer-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20354 2026-01-30 cs.CV 83%

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

万物皆有其位:文本到图像模型空间智能基准测试

Zengbin Wang, Xuecai Hu, Yong Wang, Feng Xiong, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP、阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SpatialGenEval基准测试,通过信息密集的提示评估文本到图像模型的空间智能,揭示高阶空间推理的瓶颈,并构建SpatialT2I数据集提升模型性能。

Comments Accepted by ICLR 2026, URL: https://github.com/AMAP-ML/SpatialGenEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-01-27 cs.CV cs.AI 83%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Chonghan Qin, Zheng Liu, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15286 2026-01-22 cs.CV cs.AI cs.LG cs.RO 83%

Iterative Refinement Improves Compositional Image Generation

迭代细化改进组合图像生成

Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj, Zheyang Qin, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda AI

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种迭代细化策略,通过视觉-语言模型反馈提升组合图像生成质量,实验显示在多个基准上均优于并行采样方法。

Comments Project webpage: https://iterative-img-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14951 2026-01-22 cs.CV cs.AI cs.CL 83%

TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models

TempViz: 关于文本到图像模型中时间知识的评估

Carolin Holtermann, Nina Krebs, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg(汉堡大学可信人工智能实验室) University of St. Gallen(圣加尔登大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 TempViz通过首个全面评估时间知识的数据集,揭示了文本到图像模型在时间推理上的不足,并指出需进一步研究

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04339 2026-01-22 cs.CV cs.AI 83%

Unified Text-Image Generation with Weakness-Targeted Post-Training

通过弱项针对性后训练实现统一的文本图像生成

Jiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han, Yushi Hu, Emily Dinan, Amita Kamath, Michal Drozdzal, Reyhane Askari-Hemmat, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta旗下的FAIR) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11614 2026-01-21 cs.CV cs.LG q-bio.NC 83%

Multi-modal MRI-Based Alzheimer's Disease Diagnosis with Transformer-based Image Synthesis and Transfer Learning

基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习

Jason Qiu

机构 * Marvin Ridge High School(马文岭高中)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08332 2026-01-14 cs.CV cs.AI 83%

IGAN: A New Inception-based Model for Stable and High-Fidelity Image Synthesis Using Generative Adversarial Networks

IGAN:一种基于 inception 的新模型,用于使用生成对抗网络进行稳定且高保真的图像合成

Ahmed A. Hashim, Ali Al-Shuwaili, Asraa Saeed, Ali Al-Bayaty

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 IGAN通过引入更深的inception启发式卷积和扩张卷积,提升图像生成质量与训练稳定性,实现更优的FID和IS指标。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-01-08 cs.CV 83%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01441 2026-01-06 physics.app-ph cs.CV 83%

Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network

利用自旋电子深度卷积生成对抗网络进行图像合成

Saumya Gupta, Abhinandan, Venkatesh vadde, Bhaskaran Muralidharan, Abhishek Sharma

机构 * Department of Electrical Engineering, IIT Bombay(印度比哈尔理工学院电气工程系) Department of Electrical Engineering, IIT Ropar(印度罗帕尔理工学院电气工程系) School of Computing and Electrical Engineering (SCEE), IIT Mandi(印度曼迪理工学院计算与电气工程学院)

专题命中 文生图 :image synthesis(title);image generation(abstract);generative vision(abstract);分类 cs.CV

AI总结 本文提出了一种混合CMOS-自旋电子深度卷积生成对抗网络,通过自旋电子硬件实现高效图像合成,降低了能耗并提升了性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 83%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22107 2025-12-22 cs.CV cs.AI 83%

Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation

利用GFlowNets发现潜在图以实现多样化的条件图像生成

Bailey Trang, Parham Saremi, Alan Q. Wang, Fangrui Huang, Zahra TehraniNasab, Amar Kumar, Tal Arbel, Li Fei-Fei, Ehsan Adeli

机构 * Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) Dept. of Psychiatry and Behavioral Sciences, Stanford University(精神病学与行为科学系,斯坦福大学) Dept. of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学) Center for Intelligent Machines, McGill University(智能机器中心,麦吉尔大学) MILA - Quebec AI institute(魁北克人工智能研究所)

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Rainbow通过分解输入条件为多样化的潜在表示,利用GFlowNets生成多样化图像,提升条件图像生成的多样性和保真度。

Journal ref The 39th Annual Conference on Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16905 2025-12-19 cs.CV 83%

Alchemist: Unlocking Efficiency in Text-to-Image Model Training via Meta-Gradient Data Selection

Alchemist: 通过元梯度数据选择提升文本到图像模型训练效率

Kaixin Ding, Yang Zhou, Xi Chen, Miao Yang, Jiarong Ou, Rui Chen, Xin Tao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Alchemist通过元梯度数据选择提升文本到图像模型训练效率,实现高效的数据筛选和模型性能提升。

Comments project page: https://kxding.github.io/project/Alchemist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13164 2025-12-17 cs.CV cs.AI 83%

A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis

语义增强的生成基础模型提升病理图像合成

Xianchao Guan, Zhiyuan Fan, Yifeng Wang, Fuqiang Chen, Yanjiang Zhou, Zengyang Che, Hongxue Meng, Xin Li, Yaowei Wang, Hongpeng Wang, Min Zhang, Heng Tao Shen, Zheng Zhang, Yongbing Zhang

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 CRAFTS通过语义增强的生成基础模型提升病理图像合成质量,生成多样化病理图像并增强多种临床任务性能。

Comments 68 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19534 2025-12-16 cs.CV cs.LG 83%

QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain

QUOTA: 通过文本到图像模型对任意领域的对象进行量化

Wenfang Sun, Yingjun Du, Gaowen Liu, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Cisco Research(思科研究) Westlake University(西湖大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 QUOTA通过双循环元学习策略,实现无需重新训练即可在任意领域中高效量化对象数量。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09081 2025-12-11 cs.CV 83%

AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models

AgentComp: 从代理推理到文本-图像模型中的组合性 mastery

Arman Zarei, Jiacheng Pan, Matthew Gwilliam, Soheil Feizi, Zhenheng Yang

机构 * TikTok University of Maryland(马里兰大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 AgentComp通过训练模型区分组合性相似的提示和图像,提升文本-图像模型的组合性生成能力,实现更准确的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05872 2025-12-10 cs.CV 83%

Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection

领域-RAG:跨领域少样本目标检测的检索引导组合图像生成

Yu Li, Xingyu Qiu, Yuqian Fu, Jie Chen, Tianwen Qian, Xu Zheng, Danda Pani Paudel, Yanwei Fu, Xuanjing Huang, Luc Van Gool, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Fuzhou University(福州大学) East China Normal University(华东师范大学) HKUST(GZ)(香港科技大学(广州))

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Domain-RAG通过检索引导的组合图像生成方法,解决跨领域少样本目标检测中的领域对齐与背景生成问题,实现高质量样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏