When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs
当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.MM
AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。
Comments Accepted at DIS 2026 PWiP