arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-23 至 2026-06-23 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2606.20924 2026-06-23 cs.CV 新提交 89%

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

ELDiff: 当证据学习遇上文本到图像扩散

Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

机构 * Shandong University(山东大学) Case Western Reserve University(凯斯西储大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出ELDiff模型,利用证据学习中的不确定性度量和冲突检测,增强多目标文本到图像扩散中对象级语义一致性,解决分割图偏差和语义重叠冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20991 2026-06-23 cs.ET cs.AI 新提交 82%

Text-to-Image Generative AI for Modeling and Simulation: Methods, Opportunities, and Applications

面向建模与仿真的文本到图像生成式人工智能:方法、机遇与应用

Philippe J. Giabbanelli

机构 * National Center for Collaboration in Medical Modeling & Simulation and Office of Enterprise Research & Innovation(医学建模与模拟协作国家中心和企业研究与创新办公室)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

AI总结 本教程介绍文本到图像生成技术如何支持建模与仿真的多个任务,包括概念模型沟通、仿真结果可视化、教育材料生成及多尺度仿真中的异构模型接口,并提供实用工作流。

Comments To appear at the 2026 Winter Simulation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23669 2026-06-23 cs.CV 新提交 79%

GeoFidelity-Bench: Evaluating Segment-Level Geographic Fidelity in Text-to-Image Street-View Generation

GeoFidelity-Bench:评估文本到图像街景生成中的片段级地理保真度

Kaizhen Tan, Hanzhe Hong, Siru Tao

机构 * Heinz College of Information Systems and Public Policy(信息系统与公共政策学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出GeoFidelity-Bench基准,通过参考面板排名测试文本到图像模型能否生成特定道路片段而非通用城市街景,发现添加街道和社区名称可提升检索准确率,但目标与最近邻片段间相似度差距近乎为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15967 2026-06-23 cs.CR cs.CV 版本更新 79%

When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models

TwoHamsters:文本到图像模型中多概念组合不安全性的基准测试

Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) CISPA Helmholtz Center for Information Security(信息安全研究中心) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出TwoHamsters基准,通过17500个提示测试文本到图像模型在多概念组合不安全性的表现,揭示现有模型和防御机制在处理危险组合生成时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17853 2026-06-23 cs.CV cs.AI 版本更新 79%

Detail++: Training-Free Detail Enhancer for T2I Diffusion Models

Detail++: 文本到图像扩散模型的免训练细节增强器

Lifeng Chen, Jiner Wang, Zihao Pan, Beier Zhu, Xiaofeng Yang, Chi Zhang

机构 * AGI Lab, Westlake University(AGI实验室,西lake大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 提出免训练框架Detail++,通过渐进式细节注入策略分解复杂提示词,利用自注意力布局控制与交叉注意力质心对齐损失,提升多主体复杂提示下的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21498 2026-06-23 cs.AI cs.LG 新提交 78%

Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

平衡GRPO自回归文本到图像后训练中的性能与多样性

Yuanhao Chiang, Hongbo Duan, Chunru Yang, Jiahua Pei, Yi Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00032 2026-06-23 cs.CY cs.AI cs.CV 版本更新 57%

Happy Young Women, Grumpy Old Men? Emotion-Driven Demographic Biases in Synthetic Face Generation

快乐年轻女性,暴躁老年男性?合成人脸生成中情绪驱动的人口统计偏见

Mengting Wei, Aditya Gulati, Guoying Zhao, Nuria Oliver

机构 * University of Oulu(奥卢大学) ELLIS Alicante(阿利坎特ELLIS)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究系统审计了文本到图像模型在情绪提示下生成人脸的人口统计偏见,发现模型过度代表年轻面孔和白人特征,负面情绪提示加剧了特定群体的缺失,并降低了感知吸引力。

Comments 39 pages, 16 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10705 2026-06-23 eess.IV cs.CV 版本更新 57%

3D Vessel Reconstruction from Sparse-View Dynamic DSA Images via Vessel Probability Guided Attenuation Learning

基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建

Zhentao Liu, Huangxuan Zhao, Wenhui Qin, Zhenghong Zhou, Xinggang Wang, Wenping Wang, Xiaochun Lai, Chuansheng Zheng, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China School of Electronic Information Communications, Huazhong University of Science Department of Computer Science \& Engineering, Texas A\&M University, USA

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。

Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23645 2026-06-23 math-ph math.MP 新提交 50%

Which Waveguide Network Realizes a Prescribed Transmission Profile? An Exact Forward Construction

哪个波导网络实现指定的传输轮廓?一种精确的正向构造方法

Tristan M. Lawrie

专题命中 文生图 :image synthesis(abstract)

AI总结 提出一种基于规范平移亥姆霍兹算子的周期性波导网络散射特性的可解析反演框架,通过傅里叶展开将晶格电抗映射到图架构,直接从目标传输系数确定物理结构,实现从一维角滤波到二维图像合成的精确波前构造。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏