arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-09 至 2026-03-09 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2603.06032 2026-03-09 cs.CV 88%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23138 2026-03-09 cs.CV 86%

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

VisualPrompter: 基于视觉反馈的语义感知提示优化用于文本到图像合成

Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV

AI总结 VisualPrompter通过语义感知的提示优化机制,提升文本到图像合成的对齐性能和内容质量。

Comments ICLR2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05681 2026-03-09 cs.CV 83%

Culture in Action: Evaluating Text-to-Image Models through Social Activities

行动中的文化:通过社交活动评估文本到图像模型

Sina Malakouti, Boqing Gong, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学) Boston University(波士顿大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CULTIVate是一个用于评估文本到图像模型在跨文化社交活动上文化忠实度的基准,通过四个指标衡量文化契合度、幻觉、夸张元素和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05921 2026-03-09 cs.CV cs.AI 79%

BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

BlackMirror: 通过指令-响应偏差检测文本到图像模型的黑盒后门

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 BlackMirror通过指令-响应偏差检测文本到图像模型的黑盒后门,利用视觉模式与指令的对齐及偏差稳定性评估实现高效检测。

Comments This paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19297 2026-03-09 cs.CV 79%

Alchemist: Turning Public Text-to-Image Data into Generative Gold

炼金术:将公共文本到图像数据转化为生成黄金

Valerii Startsev, Alexander Ustyuzhanin, Alexey Kirillov, Dmitry Baranchuk, Sergey Kastryulin

机构 * Yandex Research(Yandex研究院) HSE(莫斯科大学) Yandex MSU(莫斯科大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出了一种利用预训练模型生成高质量通用SFT数据集的方法,通过Alchemist数据集提升了文本到图像模型的生成质量并公开了微调权重。

Comments Accepted to the Datasets and Benchmarks Track of the 39th Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV 57%

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏