arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-10 至 2026-07-10 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2607.08201 2026-07-10 cs.CV cs.AI 新提交 79%

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割

Hyeonseop Song, Seokhun Choi, Hoseok Do

机构 * LG Electronics(LG电子)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。

Comments Accepted to ECCV 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07827 2026-07-10 cs.CR 新提交 78%

Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild

开放模型,开放风险:衡量实际应用中的文本到图像模型的不安全生成

Peilin Han, Yang Liu, Yilong Yang, Jingchun Zhang, Teng Li, Jianfeng Ma, Zhuo Ma

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究实际应用中的文本到图像模型的不安全生成问题,通过越狱视角进行大规模实证研究。引入高级ASR改进指标,评估200多个模型,发现安全退化不普遍不均匀,识别出高风险模型并追溯其发布背景,向Hugging Face报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 70%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08515 2026-07-10 cs.CV 新提交 57%

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

超越轮椅和眼罩:使用INCLUDE - BENCH研究文本到图像模型中的残疾刻板印象

Sophia Lichtenberg, Albert Gatt, Judith Masthoff

机构 * Utrecht University(乌得勒支大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像模型中的残疾刻板印象,引入INCLUDE - BENCH基准,涵盖多维度偏见提示设计的大量图像,评估多个模型,揭示模型在残疾相关表现上的问题,如轮椅描绘占比高、多样性少等,并引入SCM分数反映刻板关联。

详情

展开后加载摘要…

URL PDF HTML 收藏