GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究院)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。