Visual Language Maps for Robot Navigation
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Project page: https://vlmaps.github.io
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Project page: https://vlmaps.github.io
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NAACL 2022 Findings (18 pages)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CMU Ph.D. Thesis, March 2021. For more details see http://devendrachaplot.github.io/
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments To appear in Robotics: Science and Systems (RSS), 2018
从视觉控件到UI代码:高效的基于工具的生成
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; Concordia University(康考迪亚大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能
Comments ECCV2026 (MUCG Workshop)
面向移动端检索增强生成的轻量级分块选择
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。
Qwen-UI-Agent技术报告:面向下一代以真实世界为中心的基础图形用户界面智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究推出以真实世界为中心的基础GUI智能体Qwen-UI-Agent,结合多环境与数据飞轮等机制,在移动端基准达最优,在多类任务上表现具竞争力。
桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。
用于精神分裂症认知康复的交互式视觉语言平台
机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) ; RIIMA Laboratory(RIIMA实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。
用于视觉运动策略学习的有序动作令牌
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对动作令牌化存在的问题,提出有序动作令牌化(OAT)方法,利用带特定机制的变换器将动作块离散化,满足高压缩率等三个需求,在多种策略和任务中验证,能提升策略性能并增强推理灵活性。
HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型
机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。
Comments 20 pages with 13 figures
行动前预测:基于未来状态条件的视觉语言导航
机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。
Comments 9 pages, 1 figure, 4 tables
用于机器人动作表示的语义锚定
机构 * Peking University(北京大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。
Comments Project Page: https://xy02-05.github.io/SemanticMN
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。
生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。
Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference
TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。
Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
UI2App:可执行Web应用程序生成中视觉交互推理的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。
SWITCH:在长时程具身场景中评估和处理具象接口的基准测试
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。
Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH
WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。
Comments Rejected by ECCV 2026, Arxiv Paper
Kairos: 面向物理AI的原生世界模型栈
机构 * Kairos Team(Kairos团队)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。
Comments Kairos Technical Report
EgoGapBench:多智能体场景中自我中心动作选择的基准测试
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Sogang University(成均馆大学) ; Ministry of Science and ICT(科学技术信息通信部)
专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。
Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench
MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑
机构 * Binghamton University(宾汉姆顿大学) ; Massachusetts General Hospital(马萨诸塞综合医院) ; Harvard Medical School(哈佛医学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。
LUMOS:面向无障碍AI代理的语义操作系统层
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出LUMOS语义层,将操作系统无障碍元数据转化为机器可读蓝图,使AI代理通过结构化UI原语而非截图进行观察-行动循环,降低视觉依赖和成本。
Comments The LUMOS repository is available at https://github.com/thotayogeswarreddy/Lumos.git
ComAct: 通过COM即行动范式重构专业软件操作
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出COM即行动范式,将专业软件交互转化为确定性程序合成,解决GUI代理的脆弱性和API代理的异构性问题;构建ComCADBench基准和ComActor自校正代理,在工业CAD软件上实现SOTA性能。
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
RadarTwin:面向移动室内感知的场景特定毫米波雷达仿真与学习
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出RadarTwin框架,利用3D重建和视觉语言模型推断材料属性,通过物理射线追踪合成FMCW雷达数据,解决雷达数据稀缺问题,仿真训练模型在真实场景中识别物体准确率达95.3%。
针对原生GUI代理的CAPTCHA解决:自动化推理-行动数据生成与自我纠正训练
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ReCAP,一种能解决现代交互式CAPTCHA挑战的原生GUI代理,通过自动化数据生成和自我纠正训练提升CAPTCHA解决能力,同时保持通用GUI任务性能。
Comments Accepted to ICML 2026
CustomX: 视频世界模型中的统一角色、动作与场景定制
机构 * Fudan University(复旦大学) ; Microsoft Research(微软研究院) ; University of Waterloo(滑铁卢大学) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出CustomX,结合静态世界生成与可控实体模型,支持用户指定角色在3D场景中执行开放动作,通过条件自回归视频生成保持视觉保真度。
Comments Accepted to ECCV 2026. Project page: https://snowflakewang.github.io/CustomX_Page/