arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-04 至 2026-06-04 共收录 1 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2606.04479 2026-06-04 cs.CV cs.AI cs.CL 57%

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏