arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 98 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 98 篇

2607.17634 2026-07-21 cs.CV 新提交 93%

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis

MixDiffusion:用于多条件图像合成的基于混合扩散的单条件文本到图像生成模型

Pengcheng Wan, Liang Han, Lin Xu, Bowen Xiao, Liqiang Nie

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract)

AI总结 研究针对现有基于扩散的文本到图像生成方法控制条件单一的问题,提出MixDiffusion框架,通过集成多个预训练单条件模型,支持多条件图像合成,具有无需训练、易部署和可扩展新模态的特点。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交 91%

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交 89%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20924 2026-06-23 cs.CV 新提交 89%

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

ELDiff: 当证据学习遇上文本到图像扩散

Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

机构 * Shandong University(山东大学) Case Western Reserve University(凯斯西储大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出ELDiff模型,利用证据学习中的不确定性度量和冲突检测,增强多目标文本到图像扩散中对象级语义一致性,解决分割图偏差和语义重叠冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08847 2026-06-09 cs.CV cs.AI cs.LG 新提交 89%

BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation

BLM-SGAN: 用于语义-空间文本到图像生成的双向语言建模

Ahmed Abdelmoneim Mazrou, Haidy Maher El-Amir, Ali Hamdi

机构 * Faculty of Computer Science, MSA University, Egypt(MSA大学计算机科学学院,埃及)

专题命中 文生图 :text-to-image(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 提出BLM-SGAN模型,利用BERT的双向注意力机制捕获长程依赖,解决GAN在文本到图像生成中的梯度消失和序列处理限制,在鸟类图像生成上达到SOTA。

Comments Published in ICACIn 2024. Appears in Advances on Intelligent Computing and Data Science II, Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, 2025

Journal ref Advances on Intelligent Computing and Data Science II (ICACIn 2024), Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 89%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 文生图 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20241 2026-06-19 cs.CV 新提交 89%

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models

BAFIS:评估现代文本到图像模型中的职业偏见与人类偏好的数据集与框架

Thomas Klassert, Adrian Ulges, Biying Fu

机构 * RheinMain University of Applied Sciences(莱茵美因应用科学大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究提出BAFIS平台和包含21,140张多语言提示生成图像的数据集,评估五种文本到图像模型在职业生成中的性别和种族偏见,结合人类偏好反馈,发现系统性偏见并强调纳入人类偏好的必要性。

Comments Accepted at the IEEE Winter Conference on Applications of Computer Vision, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24353 2026-07-28 cs.CV 新提交 88%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 88%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16307 2026-07-21 cs.CV 新提交 88%

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation

CoBind:用于无训练文本到图像生成的阶段感知组合绑定

Kaijie Chen, Ethan Caldwell, Mira Vossen, Julian Hartwell, Serena Whitlock, Adrian Bellamy

机构 * Mind Lab(思维实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散文本到图像模型处理复杂提示失败的问题,提出CoBind框架,先解析提示为组合图,利用多种约束建立布局、绑定属性,去噪时调整引导强度,无需重新训练或注释,实验证明其在多方面有改进且视觉质量有竞争力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14962 2026-07-17 cs.LG cs.AI cs.CV 新提交 88%

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

用于文本到图像生成中代表性多样性的多轴最大@K强化学习

Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像生成中样本模式覆盖不足问题,提出多轴最大@K强化学习目标,通过特定信用分配机制改善覆盖,在感知外观公平性评估中提高公平分数,且保持图像质量和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 88%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24849 2026-06-24 cs.CV cs.AI 新提交 88%

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Ant Group(蚂蚁集团) The University of Hong Kong(香港大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10492 2026-06-10 cs.CV 新提交 88%

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation

PathRelax: 并行路径松弛推测雅可比解码加速自回归文本到图像生成

Haodong Lei, Hongsong Wang, Bingxuan Dai, Pan Zhou

机构 * College of Software Engineering, Southeast University(东南大学软件工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对自回归文本到图像模型因长序列导致推理慢的问题,提出并行路径交叉松弛推测雅可比解码框架,通过多序列草稿树结构扩展搜索空间并利用跨路径语义相似性提高接受率,实现3.95-4.18倍加速。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17979 2026-06-19 cs.AI 新提交 87%

STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training

STAR: 文本到图像强化学习后训练中的时空自适应奖励分配

Jinjie Shen, Wei Deng, Xian Hu, Daiguo Zhou, Jian Luan

机构 * institutetext: STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training(机构文本:STAR:时空自适应奖励分配用于文本到图像强化学习后训练)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 针对文本到图像生成中奖励与生成轨迹粒度不匹配的问题,提出STAR方法,利用文本-图像注意力构建时空自适应分配图,对相关潜在区域施加更强策略更新,提升语义对齐和文本渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25641 2026-07-29 cs.CV cs.AI 新提交 86%

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

OmniPhys:文本到图像生成中物理常识的知识图谱驱动基准测试与集体优化

Yajing Xu, Yarong Lan, Jiaoyan Chen, Yichi Zhang, Jeff Z. Pan, Mingchen Tu, Zhizhen Liu, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) The University of Manchester(曼彻斯特大学) The University of Edinburgh(爱丁堡大学) Ant Group(蚂蚁集团)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 针对文本到图像模型常违反物理常识及现有基准测试不足等问题,引入基于物理知识图谱的OmniPhys基准测试,提出OmniPrompt迭代框架,经对12个模型评估,显著提升了物理一致性。

Comments accepted by KDD 2026 DB track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08492 2026-07-02 cs.CV cs.AI 新提交 86%

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06813 2026-06-08 cs.CV cs.AI 新提交 86%

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

打破锁定:通过表示调制实现文本到图像生成的多样化

Dahee Kwon, Haeun Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 针对文本到图像模型在固定提示下生成样本过于相似的问题,提出无训练表示级干预方法DAVE,通过选择性衰减早期生成中的零频空间平均分量来增强多样性,保持图像质量且计算开销极小。

Comments Accepted to ICML 2026. Code is available at: https://github.com/daheekwon/DAVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11002 2026-08-12 cs.CL cs.AI 新提交 86%

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14807 2026-07-17 cs.CV 新提交 85%

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis

TAMF-VTON:通过高保真图像合成实现纹理感知无掩码虚拟试穿

Jie Wang, Qian He, Gaofeng He, Xiaogang Jin, Huamin Wang

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Style3D Research China(中国凌迪科技风格实验室)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 TAMF-VTON旨在解决虚拟试穿方法局限,通过统一生成管道,含轻量级专家混合适应方案、频域监督机制和强大数据管理管道,实现无掩码、多服装组合、纹理保留及高效推理,优于现有方法,为数字时尚提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 85%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32039 2026-07-01 cs.CV 新提交 85%

GEAR: Guided End-to-End AutoRegression for Image Synthesis

GEAR: 引导式端到端自回归图像合成

Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17779 2026-07-21 cs.AI 新提交 85%

Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

动态防御剖析实现文本到图像模型的认知越狱

Dongdong Yang, Deyue Zhang, Zhao Liu, Zonghao Ying, Wenzhuo Xu, Jiankai Jin, Xiangzheng Zhang, Quanchen Zou

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03046 2026-07-07 cs.CV 新提交 84%

Text-to-Image Generation for Projector-Camera System Registration

用于投影仪-相机系统配准的文本到图像生成

Xinyu Chen, Yuqi Li, Jiabao Li, Pinyan Tang, Chong Wang, Aditi Majumder

机构 * Ningbo University(宁波大学) University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

AI总结 针对投影仪-相机系统配准中现有方法的局限,提出基于深度神经网络的方法,从文本提示生成自然图像,增强配准精度,经实验验证该方法实用有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 84%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09529 2026-08-11 cs.CV 新提交 83%

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

面向表达性与忠实性的音频到图像生成:一个统一的多模态数据集与合成框架

Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) China Telecom (TeleAI)(中国电信(电信人工智能研究院)) Northwest Polytechnical University(西北工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对音频到图像生成受限于传统数据集的问题,提出A2I-Set数据集与AudioCanvas模型,实现了更优的跨模态对齐与视觉表达性。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 83%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01780 2026-08-04 cs.CV cs.AI 新提交 83%

Investigating Social Bias in Narrative Image Generation

探究叙事图像生成中的社会偏见

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究将偏见评估框架BBG适配图像生成,对比6种T2I模型在照片、分镜、漫画生成中的偏见表现,发现叙事视觉形式中偏见更易显现,强调需用多样视觉形式评估T2I系统。

Comments Accepted to GenAI4World Workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06120 2026-07-08 cs.CV 新提交 83%

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

AEGIS:一种针对文本到图像模型中视觉同义词越狱的机制引导防御

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究所) Engineering Research Center of Cyber Security Auditing and Monitoring, Ministry of Education(教育部网络安全审计与监测工程研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像模型中视觉同义词越狱问题,提出AEGIS防御机制,通过动态追踪不安全语义生成过程,利用稀疏语义注入注意力头,在推理时仅对易受攻击头部应用相似性感知排斥,提升了模型安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00766 2026-07-03 cs.CV 新提交 83%

Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization

解耦引导:文本到图像个性化中的主体与上下文路径分离

Seongmin Kim, Kyucheol Shin, Heesun Jung, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University, South Korea(韩国汉阳大学人工智能系) Dept. of Data Science, Hanyang University, South Korea(韩国汉阳大学数据科学系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出解耦引导(DeGu)框架,通过独立引导流分别处理主体身份和场景上下文,并引入空间混合机制动态融合,以解决个性化生成中保真度与可编辑性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏