arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-26 至 2026-05-26 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 13 篇

2503.01122 2026-05-26 cs.CV 88%

ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization

ACCORD: 通过依赖正则化缓解文本到图像扩散个性化中的概念耦合

Shizhan Liu, Hao Zheng, Hang Yu, Jianguo Li

机构 * Ant Group(蚂蚁集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV

AI总结 提出两种即插即用损失函数(去噪解耦损失和先验解耦损失)直接最小化两种依赖差异,以缓解概念耦合问题,实现文本控制与个性化保真度的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25876 2026-05-26 cs.CV 86%

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

DyCoRM: 面向文本到图像生成的动态准则感知奖励建模

Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 针对用户对文本到图像生成中动态、细粒度评价准则的需求,提出DyCoRM动态准则感知奖励模型,并构建数据集DyCoDataset-20K和基准DyCoBench-1K,通过准则感知偏好比较和DyCoPick选择方法,实现首个动态细粒度奖励建模框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24894 2026-05-26 cs.CV 83%

BFS: Back-to-Front Layered Image Synthesis via Knowledge Transfer

BFS: 通过知识转移的前后分层图像合成

Kyoungkook Kang, Gyujin Sim, Sunghyun Cho

机构 * SAMSUNG(三星) POSTECH

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出BFS框架,利用双分支扩散模型和两阶段训练,通过从非分层图像合成中转移知识,实现高质量的前景层合成与背景和谐融合。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24624 2026-05-26 cs.CV 83%

Vision-Language Binding in In-Context Image Generation

上下文图像生成中的视觉-语言绑定

Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Northeastern University(东北大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过因果干预方法揭示FLUX.2模型中文本令牌与参考图像之间的隐式跨模态绑定机制,并定位绑定发生在文本序列的填充令牌上。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18979 2026-05-26 cs.LG 78%

Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters

动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法

Zixuan Chen, Hao Lin, Ke Xu, Xinghao Jiang, Tanfeng Sun

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25574 2026-05-26 cs.CV cs.AI 70%

Mosaic: Compositional Multi-Concept Erasure via Vector Field Blending

Mosaic: 通过向量场混合的组合式多概念擦除

Junseok Ko, Jungwoo Kim, Jong-Seok Lee

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) School of Integrated Technology, Yonsei University(延世大学整合技术学院)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对流式文本到图像模型中同时擦除多个目标概念的任务,提出Mosaic框架,通过动态构建概念特定掩码并选择性混合向量场,无需额外优化即可有效移除复杂场景中的多概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08615 2026-05-26 cs.CV 70%

Inspiration Seeds: Learning Non-Literal Visual Combinations for Generative Exploration

灵感种子:学习用于生成式探索的非字面视觉组合

Kfir Goldberg, Elad Richardson, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出Inspiration Seeds框架,通过CLIP稀疏自编码器提取编辑方向并隔离概念对,实现无需文本提示的两张输入图像的视觉组合生成,支持早期创意阶段的探索性构思。

Comments Project page available at https://kfirgoldberg.github.io/InspirationSeeds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26062 2026-05-26 cs.GR cs.CV 62%

Look Both Ways Before You Cross: Lifting Cross Fields From 2D Visual Priors

过马路前左右看:从2D视觉先验中提取交叉场

Dale Decatur, Jacob Serfaty, Oded Stein, Amir Vaxman, Rana Hanocka

机构 * University of Chicago(芝加哥大学) University of Southern California(南加州大学) University of Edinburgh(爱丁堡大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出CrossLift方法,利用文本到图像先验从2D图像中提取方向信号,通过两次平滑插值将其反投影到网格表面,生成语义对齐的交叉场和四边形网格。

Comments Project page at: https://crosslift.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR 62%

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25479 2026-05-26 cs.CV 57%

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

MAIL++: 视觉语言模型的多模态双向智能体层

Kaixiang Chen, Pengfei Fang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出MAIL/MAIL++方法,通过将跨模态耦合嵌入VLM内在计算模块并引入双向桥接,实现参数高效微调,在少样本分类和跨域检索中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24687 2026-05-26 cs.CV cs.AI 57%

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

HoloFair: 统一的T2I公平性评估与Fair-GRPO去偏

Ruyi Chen, Lu Zhou, Xiaogang Xu, Chiyu Zhang, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Software Technology, Zhejiang University, Ningbo, China(浙江大学宁波校区软件学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出HoloFair基准框架,通过多属性组间偏差指数(MGBI)评估文本到图像模型的公平性,并引入基于强化学习的Fair-GRPO方法进行去偏,在SD3.5-Medium模型上显著提升多维公平性且保持图像质量。

Comments Accepted to ICML 2026. Code and dataset are available at https://github.com/1059684669/HoloFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23703 2026-05-26 cs.HC cs.AI cs.CY 50%

Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

Talking Slide Avatars: 面向教学的开源多模态通信方法

Xinxing Wu

机构 * School of Mathematics and Computer Science, Kentucky State University(肯塔基州立大学数学与计算机科学学院)

专题命中 文生图 :image synthesis(abstract)

AI总结 提出一种集成OpenVoice和Ditto-TalkingHead的开源工作流,用于创建可说话的幻灯片头像,以增强在线教学中的教师存在感和叙事连续性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏