arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-01 至 2026-06-01 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2412.03876 2026-06-01 cs.CV 89%

Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization

通过推理时提示-噪声优化保障文本到图像生成

Jiangweizhi Peng, Zhiwei Tang, Gaowen Liu, Charles Fleming, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的推理时优化方法(PNO),通过联合优化连续提示嵌入和注入噪声轨迹,抑制不安全图像生成,达到最先进性能并抵抗对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31212 2026-06-01 cs.CV cs.AI cs.CL 83%

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education

基准测试与增强文本到图像模型以生成早期算术教育中的视觉表示

Junling Wang, Boqi Chen, Heejin Do, Mubashara Akhtar, April Yi Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ETH AI Center(ETH人工智能中心)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对早期算术教育中的方程到视觉生成任务,构建了E2V-Bench基准并评估了现有T2I模型,发现其在计数和关系结构上存在严重错误,进而探索了基准引导的增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-06-01 cs.CR 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29198 2026-06-01 cs.CV 70%

Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

引导对比令牌信用分配用于离散策略优化

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yuta Kyuragi, Aditya Grover

机构 * UCLA Panasonic AI Research(松下人工智能研究) NVIDIA(英伟达)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对组优势强化学习方法中令牌级信用分配缺失的问题,提出引导对比策略优化(GCPO),通过正负提示下的对比预测分配令牌级优势,在文本到图像生成和思维链推理任务上优于GRPO和DAPO。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31302 2026-06-01 eess.IV cs.CV eess.SP 57%

MoE-dqINR: A Unified Mixture-of-Experts Implicit Neural Representation Framework for Scan-Specific Dynamic and Quantitative MRI Reconstruction

MoE-dqINR:用于特定扫描动态和定量MRI重建的统一混合专家隐式神经表示框架

Yinzhe Wu, Fanwen Wang, Zhenxuan Zhang, Zi Wang, Chengyan Wang, Guang Yang

机构 * Department of Bioengineering and I-X, Imperial College London(生物工程系和I-X,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心脏血管研究中心,皇家布隆特医院) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,伦敦国王学院) Shanghai Pudong Hospital and Human Phenome Institute, Fudan University(上海浦东医院和人类表型研究所,复旦大学) International Human Phenome Institute (Shanghai), Shanghai, China(国际人类表型研究所(上海),上海,中国)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MoE-dqINR框架,通过共享空间专家和状态条件路由路径,实现高效、统一的特定扫描多线圈动态和定量MRI重建,优化时间约30秒。

详情

展开后加载摘要…

URL PDF HTML 收藏