arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2605.17807 2026-05-19 cs.CV cs.AI 86%

Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

课程组策略优化:适应性采样以释放文本到图像生成的潜力

Baoteng Li, Xianghao Zang, Xinran Wang, Xiangyu Na, Zhixiang He, Hao Sun, Chi Zhang, Zhongjiang He, Tianwei Cao, Kongming Liang, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种适应性课程训练框架CGPO,通过动态调整采样策略来提高文本到图像生成的训练效率,同时解决多类别数据集中的数据不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09286 2026-05-19 cs.CV 86%

CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation

CogBlender:迈向文本到图像生成中的连续认知干预

Shengqi Dang, Yi He, Jiaying Lei, Ziqing Qian, Nan Cao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 CogBlender通过两阶段方法实现对图像生成中认知属性的连续多维干预,有效控制如情感、记忆性等心理属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02667 2026-05-19 cs.CV cs.LG 86%

Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation

统一对比学习与生成目标以实现视觉理解和文本到图像生成

Chao Li, Tianhong Li, Sai Vidyaranya Nuthalapati, Hong-You Chen, Satya Narayan Shukla, Jianpeng Cheng, Yonghuan Yang, Jun Xiao, Xiangjun Fan, Aashu Singh, Dina Katabi, Shlok Kumar Mishra

机构 * MIT Computer Science \& Artificial Intelligence Laboratory(Meta AI) Meta AI

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出DREAM框架,通过Masking Warmup解决对比学习与文本到图像生成的矛盾,提升模型在多个任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17969 2026-05-19 cs.CV 83%

Generation Navigator: A State-Aware Agentic Framework for Image Generation

生成导航器:一种基于状态的图像生成代理框架

Jinming Liu, Ruoyu Feng, Yuqi Wang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) Independent(独立)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于状态的图像生成代理框架Generation Navigator,通过将图像生成问题重新表述为状态条件下的动作生成问题,解决了传统方法中在强化学习训练中因信用分配问题导致的不足,通过PRE-GRPO算法提升了生成质量与推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06163 2026-05-19 cs.CV cs.LG 70%

Forget-It-All: Multi-Concept Machine Unlearning via Concept-Aware Neuron Masking

Forget-It-All: 通过概念感知神经元掩码实现多概念机器去学习

Kaiyuan Deng, Bo Hui, Gen Li, Jie Ji, Minghai Qin, Geng Yuan, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) The University of Tulsa(塔尔萨大学) Clemson University(克莱姆森大学) Western Digital Corporation(西部数据公司) University of Georgia(佐治亚大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Forget-It-All框架,通过利用模型稀疏性,解决多概念去学习问题,有效提升去学习效果并保持生成质量。

Comments Accepted to ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02406 2026-05-19 cs.CY 50%

Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics

基于社区指导的评估文化文物AI生成图像

Nari Johnson, Deepthi Sudharsan, Hamna, Samantha Dalal, Theo Holroyd, Anja Thieme, Hoda Heidari, Daniela Massiceti, Jennifer Wortman Vaughan, Cecily Morrison

专题命中 文生图 :text-to-image(abstract)

AI总结 本文通过三个社区案例研究,探讨如何将社区经验融入AI生成图像的文化适当性评估体系,提出基于多模态LLM的自动化测量方法及挑战。

Comments Published at ACM FAccT 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏