Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings