arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2606.01651 2026-06-02 cs.CV 79%

Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment

通过几何对齐恢复文本到图像蒸馏中的初始噪声敏感性

Huayang Huang, Ruoyu Wang, Jinhui Zhao, Wei Deng, Daiguo Zhou, Jian Luan, Yu Wu, Ye Zhu

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出几何感知蒸馏(GAD)框架,通过匹配雅可比-向量积来对齐教师和学生模型的局部功能行为,从而恢复文本到图像蒸馏中丢失的初始噪声敏感性,提升下游噪声驱动控制任务的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00204 2026-06-02 cs.CV 79%

APE: Agentic Prompt Enhancer for Image Generation and Editing

APE: 用于图像生成与编辑的智能提示增强器

Zijian Huang, Jay Zhangjie Wu, Zian Wang, Tianshi Cao, Jiasi Chen, Sanja Fidler, Huan Ling, Xuanchi Ren

机构 * NVIDIA University of Michigan(密歇根大学)

专题命中 文生图 :image generation(title,abstract);分类 cs.CV

AI总结 提出APE框架,通过后训练小型语言模型作为提示增强代理,以单代理或多代理方式改进文本到图像生成与编辑中的提示质量,无需修改下游视觉模型。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/ape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28137 2026-05-28 cs.CV cs.LG 79%

No Safe Dose: How Training Data Drives Unsafe Image Generation

无安全剂量:训练数据如何驱动不安全图像生成

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

机构 * Black Forest Labs(黑森林实验室) TU Darmstadt & hessian.AI(图腾达姆施塔特大学 & heessian.AI) DFKI(德意志联邦鹰嘴豆研究所) Lab1141(Lab1141实验室)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 通过控制训练数据中不安全图像的比例(0%至9.6%),发现输出不安全率随比例单调上升,且比例而非绝对数量是关键因素,同时文本编码器(如SafeCLIP)可降低基线风险,但剂量效应持续存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19855 2026-05-20 cs.CV cs.AI 79%

A Framework for Evaluating Zero-Shot Image Generation in Concept-based Explainability

基于概念的可解释性人工智能的零样本图像生成评估框架

Giacomo Astolfi, Matteo Bianchi, Riccardo Campi, Antonio De Santis, Marco Brambilla

机构 * Politecnico di Milano, DEIB(米兰理工大学,DEIB)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的可解释性人工智能的零样本图像生成评估框架,通过生成合成概念数据集来评估概念基于的XAI方法,探讨了零样本文本到图像生成模型在模型分析中的挑战和开放性问题。

Comments G. Astolfi, M. Bianchi, and R. Campi contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19111 2026-05-20 cs.CV cs.AI 79%

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

FAGER:基于事实的文本到图像模型评估与改进

Youngsun Lim, Cusuh Ham, Pin-Yu Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Adobe(Adobe公司) IBM Research(IBM研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。

Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 79%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV 79%

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 79%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16836 2026-05-12 cs.CV cs.CL 79%

ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models

ColorConceptBench:一种用于文本到图像模型中概率颜色-概念理解的基准

Chenxi Ruan, Yihan Hou, Yu Xiao, Guosheng Hu, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Academy of Art(中国美术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ColorConceptBench,通过概率颜色分布系统评估颜色-概念关联,研究文本到图像模型对隐含概念如情感和视觉状态的理解能力,发现模型在抽象语义上的敏感性不足。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06170 2026-05-08 cs.CV 79%

DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

DynT2I-Eval: 一种用于文本到图像模型的动态评估框架

Juntong Wang, Jiarui Wang, Huiyu Duan, Lewei Li, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出DynT2I-Eval框架,通过动态生成提示以提升文本到图像模型的评估鲁棒性,减少过拟合和基准污染影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06012 2026-05-08 cs.CV cs.AI 79%

T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval

T2I-VeRW: 基于部件级细粒度感知的文本到图像车辆检索

Xiao Wang, Ziwen Wang, Weizhe Kong, Wentao Wu, Yuehang Li, Aihua Zheng, Chenglong Li, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出PFCVR模型,通过部件级局部对齐和双向掩码恢复模块实现文本到图像的车辆检索,构建了新的大规模数据集T2I-VeRW,实验结果显示PFCVR在两个基准数据集上均取得优异的检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 79%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 79%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 79%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16363 2026-04-21 cs.CR cs.AI cs.CV 79%

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

CSF:通过组合语义进行文本到图像模型的黑盒指纹识别

Junhoo Lee, Mijin Koo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出CSF,一种基于组合语义的黑盒指纹识别方法,用于在不接触模型内部的情况下,通过查询访问确定文本到图像模型的版权归属。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12632 2026-04-16 eess.IV cs.CV 79%

Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET

循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET

Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang

机构 * Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国) Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国) Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国) Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国) Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出循环2.5D感知损失用于从T1加权MRI生成tau PET,通过交替优化不同切面提升体积一致性,并标准化SUVR以提高准确性。

Comments Published in Human Brain Mapping, available at https://doi.org/10.1002/hbm.70508

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 79%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06313 2026-04-14 cs.CV cs.CY 79%

Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities

文本到图像模型及其对不同民族参与活动的人的表示

Abdulkareem Alsudais

机构 * Prince Sattam bin Abdulaziz University(沙特王子萨塔姆·本·阿卜杜勒阿齐兹大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究分析了DALL-E 3和Gemini 3 Pro Preview在生成日常活动图像时对206个民族的表示,发现传统服饰在某些活动中不适用,且与地区和收入组相关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05853 2026-04-09 cs.CV 79%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

Comments Withdrawn for extensive revisions and inclusion of new experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02355 2026-04-06 cs.LG cs.CV 79%

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

从广泛探索到稳定合成:基于熵的优化用于自回归图像生成

Han Song, Yucheng Zhou, Jianbing Shen, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于熵的优化方法EG-GRPO,通过调整不确定性分配提升文本到图像生成的稳定性与质量,实验显示其在标准基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 79%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV 79%

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25819 2026-03-30 cs.CV 79%

Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis

Geo²:基于几何的跨视角地理定位与图像合成

Yancheng Zhang, Xiaohan Zhang, Guangyu Sun, Zonglin Lyu, Safwan Wshah, Chen Chen

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) University of Vermont(佛蒙特大学)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出Geo²框架,利用几何先验知识联合完成跨视角地理定位和双向图像合成,通过共享3D感知潜在空间和GeoFlow模型提升性能。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10766 2026-03-25 cs.CR cs.AI cs.CV 79%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21213 2026-03-24 cs.CV cs.AI 79%

Positional Segmentor-Guided Counterfactual Fine-Tuning for Spatially Localized Image Synthesis

基于位置分割器的反事实微调用于空间局部化图像合成

Tian Xia, Matthew Sinclair, Andreas Schuh, Fabio De Sousa Ribeiro, Raghav Mehta, Rajat Rasal, Esther Puyol-Antón, Samuel Gerber, Kersten Petersen, Michiel Schaap, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) HeartFlow, Inc., Mountain View, CA, USA(HeartFlow 公司,美国加州山景城)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出Positional Seg-CFT,通过将每个结构细分为区域并独立测量每个区域,实现空间局部化的反事实生成,提升冠状动脉CT血管造影中疾病建模的精细空间控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17637 2026-03-19 cs.LG cs.CV 79%

DSS-GAN: Directional State Space GAN with Mamba backbone for Class-Conditional Image Synthesis

DSS-GAN:基于Mamba架构的定向状态空间GAN用于类条件图像合成

Aleksander Ogonowski, Konrad Klimaszewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙技术大学) National Centre for Nuclear Research(国家核物理研究所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 DSS-GAN引入了定向潜在路由机制,通过分解潜在向量并结合类别嵌入,提升图像合成的FID、KID和精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18229 2026-03-18 cs.CV 79%

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

超越频率的无偏目标检测:基于视觉提示的图像合成

Xinhao Cai, Liulei Li, Gensheng Pei, Tao Chen, Jinshan Pan, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出基于生成的去偏框架,通过视觉提示图像合成解决目标检测中的偏见问题,改进了稀有类别的性能,提升了生成图像的布局准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11106 2026-03-12 cs.CV cs.CR 79%

Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models

针对文本到图像模型的令牌级约束边界搜索

Jiangtao Liu, Zhaoxin Wang, Handing Wang, Cong Tian, Yaochu Jin

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Trustworthy and General Artificial Intelligence Laboratory, School of Engineering, Westlake University(之江实验室可信与通用人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 TCBS攻击通过搜索决策边界附近的令牌,有效突破全链T2I模型的防御,实现高劫持成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05921 2026-03-09 cs.CV cs.AI 79%

BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

BlackMirror: 通过指令-响应偏差检测文本到图像模型的黑盒后门

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 BlackMirror通过指令-响应偏差检测文本到图像模型的黑盒后门,利用视觉模式与指令的对齐及偏差稳定性评估实现高效检测。

Comments This paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏