GUing: A Mobile GUI Search Engine using a Vision-Language Model
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2024
专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
SceneActBench:智能体能否对其所看到的3D场景采取行动?
机构 * Tencent Hunyuan(腾讯混元) ; THU(清华大学) ; NJU(南京大学) ; HKUST(香港科技大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; PKU(北京大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。
EvoGUI:用于GUI状态转换理解的进化感知基准测试
机构 * Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。
通过场景自我探索进行视图规划
机构 * Northwestern University(西北大学) ; University of Washington(华盛顿大学) ; Microsoft(微软) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出ViewSuite基准测试揭示VLM在多步视图规划中的不足,并设计迭代框架通过自我探索和视图图蒸馏将Qwen2.5-VL-7B的交互式视图规划准确率从2.5%提升至47.8%。
通过通用关键帧提取桥接VideoQA和视频引导的智能体任务
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。
Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/
跨具身机器人操作的动作先验学习
机构 * Renmin University of China(中国人民大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Toronto(多伦多大学) ; Amazon(亚马逊)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。
MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测
机构 * SDU(山东大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。
GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Robbyant ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。
FineVision: 你只需要开放数据
机构 * Hugging Face ; Technical University of Munich(慕尼黑技术大学) ; Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出FineVision,一个包含2400万样本的高质量数据集,通过半自动化流程整合了200多个来源,通过严格的数据清洗和人工审核确保数据质量,训练基于该数据集的模型在广泛评估中表现更优,推动数据驱动的视觉语言模型研究。
对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。
Comments Submitted to NeurIPS 2026
离线语义引导用于高效视觉-语言-动作策略蒸馏
机构 * Department of Mechanical Engineering(机械工程系) ; University College London(伦敦大学学院) ; Department of Engineering Science(工程科学系) ; University of Oxford(牛津大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLA-AD框架,利用视觉-语言模型作为离线语义监督者,将大规模VLA教师模型蒸馏为轻量学生策略,通过高阶语义指导提升效率与鲁棒性。
面向长周期具身智能体的工具对齐视觉-语言-动作模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhongguancun Academy(中关村学院) ; Beihang University(北京航空航天大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLAs-as-Tools方法,通过高阶视觉语言模型与专用工具协作,提升长周期任务的成功率与调用忠实度。
拆解与构建:基于技能的视觉-语言导航代理混合
机构 * Michigan State University(密歇根州立大学) ; ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。
Comments Accepted by ACL 2026 Main Conference
BEACON: 语言条件下的遮挡区域导航可行性预测
机构 * Department of Cognitive Robotics (CoR), Delft University of Technology(认知机器人学系(CoR),代尔夫特理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 BEACON通过融合视觉语言模型与深度信息,提升遮挡区域导航可行性预测的准确性。
Comments 8 pages. Project page: https://xin-yu-gao.github.io/beacon
通过代理-Q估计和分步策略优化构建自主GUI导航
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICLR 2025
基于机载视觉语言模型的多智能体机器人控制
机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)
专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)
AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。
Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)
基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract)
AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。
ViBR:基于视频报告的自动化Bug回放
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract)
AI总结 本文提出ViBR,一种基于视觉-语言模型的自动化Bug回放方法,通过动作边界分割和区域感知的GUI状态比较,实现从GUI视频记录中自动复现Bug,实验表明其复现率达72%。
Comments accepted to FSE 2026
通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航
机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) ; General Autonomy Inc.(通用自主公司)
专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)
AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。
Comments Submitted to IEEE Conferences
从空间到动作:在空间先验基础上构建视觉-语言-动作模型
机构 * ByteDance Seed(字节跳动种子) ; NUS(新加坡国立大学) ; NTU(国立技术大学) ; THU(清华大学) ; SMU(南方大学)
专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.CV、cs.AI、cs.LG
AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。
Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/
通过视觉语言模型探索社交合规机器人导航的提示设计
机构 * Hokkaido University(北海道大学) ; The University of Tokyo(东京大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract)
AI总结 本文通过设计社交合规的提示策略,提升小型视觉语言模型在机器人导航中的行动准确性,发现与自我竞争的提示设计效果最佳。
MaP-AVR: 一种利用视觉语言模型和检索增强生成的元动作规划器
机构 * Li Auto
专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract)
AI总结 MaP-AVR通过元动作规划和检索增强生成技术,提升机器人在复杂环境中的任务规划能力。
Comments 8 pages, 10 figures, This work was completed in December 2024