arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2603.20828 2026-03-24 cs.CV 91%

EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis

EruDiff:在扩散模型中重构知识以实现高级文本到图像合成

Xiefan Guo, Xinzhu Ma, Haoxiang Ma, Zihao Zhou, Di Huang

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出EruDiff,通过Diffusion Knowledge Distribution Matching和Negative-Only Reinforcement Learning提升扩散模型处理隐式提示的能力,增强科学和世界知识生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 89%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20741 2026-03-24 cs.CV 89%

CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

CTCal: 通过跨时间步自校准重新思考文本到图像扩散模型

Xiefan Guo, Xinzhu Ma, Haiyu Zhang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CTCal,通过利用早期时间步的准确文本-图像对齐来校准后期时间步的表示学习,提升文本到图像生成的对齐精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21886 2026-03-24 cs.IR cs.CV 88%

ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval

ADaFuSE: 适应性扩散生成图像与文本融合用于交互式文本到图像检索

Zhuocheng Zhang, Xingwu Zhang, Kangheng Liang, Guanxuan Li, Richard Mccreadie, Zijun Long

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ADaFuSE通过引入双分支融合机制,结合自适应门控和语义感知专家混合,提升交互式文本到图像检索的性能,实现更稳健的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20880 2026-03-24 cs.CV 88%

When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

当安全碰撞时:通过自适应安全引导解决文本到图像扩散中的多类别有害冲突

Yongli Xiang, Ziming Hong, Zhaoqing Wang, Xiangyu Zhao, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) City University of Hong Kong(香港城市大学) TMLR Group, Hong Kong Baptist University(Baptist大学TMLR小组)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CASG框架,通过动态识别并应用类别对齐的安全方向,解决文本到图像扩散模型中多类别有害冲突问题,实验表明其能有效降低有害率。

Comments CVPR 2026; Code is released at CVPR_CASG" target="_blank" rel="noopener">https://github.com/tmllab/2026_CVPR_CASG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI 88%

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20201 2026-03-24 cs.MM cs.CV cs.CY 81%

FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models

FIGURA:一种用于安全过滤文本到图像模型中艺术人物摄影的模块化提示工程方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究员)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出FIGURA方法,通过模块化提示工程系统解决安全过滤文本到图像模型中艺术人物摄影的限制问题,通过200+测试验证其有效性,揭示安全过滤机制的运作原理并提供系统解决方案。

Comments 10 pages, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21213 2026-03-24 cs.CV cs.AI 79%

Positional Segmentor-Guided Counterfactual Fine-Tuning for Spatially Localized Image Synthesis

基于位置分割器的反事实微调用于空间局部化图像合成

Tian Xia, Matthew Sinclair, Andreas Schuh, Fabio De Sousa Ribeiro, Raghav Mehta, Rajat Rasal, Esther Puyol-Antón, Samuel Gerber, Kersten Petersen, Michiel Schaap, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) HeartFlow, Inc., Mountain View, CA, USA(HeartFlow 公司,美国加州山景城)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出Positional Seg-CFT,通过将每个结构细分为区域并独立测量每个区域,实现空间局部化的反事实生成,提升冠状动脉CT血管造影中疾病建模的精细空间控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 57%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12018 2026-03-24 cs.HC cs.AI cs.ET 50%

An Intent of Collaboration: On Agencies between Designers and Emerging (Intelligent) Technologies

协作的意图:设计者与新兴(智能)技术之间的机构

Pei-Ying Lin, Julie Heij, Iris Borst, Britt Joosten, Kristina Andersen, Wijnand IJsselsteijn

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究探讨设计者与智能技术协作中的权力动态,提出通过反思创作过程、理解技术特性及调整人机关系来恢复创作自主性。

Comments Accepted by IASDR Conference 2025, Taipei, Taiwan 16 pages excluding references, 8 figures

Journal ref Proceedings of IASDR 2025: Design Next

详情

展开后加载摘要…

URL PDF HTML 收藏