CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy Environments
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments Accepted at AAAI 2024
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments Accepted at AAAI 2024
专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments Videos, code, and an interactive Colab notebook that runs in your browser https://sites.google.com/view/lfg-nav/
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 GUI与网页智能体 :autonomous agent(title,abstract);agent(abstract)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
Comments ICLR 2019, code is available at https://github.com/chihyaoma/selfmonitoring-agent
Plover:通过以计划为中心的交互来操控图形用户界面代理
机构 * University of California, Davis(加利福尼亚大学戴维斯分校) ; Bosch Research North America(博世北美研究院)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);planning(abstract);workflow(abstract)
AI总结 研究针对现实中GUI自动化难题,提出以计划为中心的Plover系统,通过规划器-执行器架构,支持多方式监督与修正,经形成性研究和评估表明,该系统能让GUI自动化更透明、可控与可适应,利于修复故障。
忠实的移动GUI代理与引导优势估计器
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(summary_cn,abstract);分类 cs.AI
AI总结 本文提出Faithful-Agent框架,通过两阶段流程提升GUI交互的证据基础性和一致性,引入引导优势估计器GuAE,有效提升任务成功率并保持指令遵循能力。
WebFactory:自动化将基础语言智能压缩为 grounded Web agents
机构 * Fudan University(复旦大学) ; IMean AI ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学)
专题命中 GUI与网页智能体 :agent(summary_cn,abstract);分类 cs.AI
AI总结 WebFactory 提出了一种自动化闭环强化学习流程,将大语言模型的潜在知识高效压缩为可操作的 agent 行为,实现了数据效率和泛化能力的提升。
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)
面向GUI智能体的软件工程及与GUI智能体协同的软件工程
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。
小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制
机构 * Monash University(莫纳什大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Pusan National University(釜山国立大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。
InfiniteWeb: 面向GUI智能体训练的可扩展Web环境合成
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出InfiniteWeb系统,通过统一规范、任务驱动测试和多样化种子设计自动生成功能完备的Web环境,解决GUI智能体训练数据稀缺问题,在OSWorld和Online-Mind2Web上取得显著性能提升。
Comments Accepted to ACL 2026 Main
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
训练用于代理电话使用的开放模型
机构 * Tencent Hunyuan(腾讯混元) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Wuhan University(武汉大学)
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 提出PhoneBuddy训练方案,结合真实应用环境和模拟应用环境PhoneWorld,通过混合强化学习提升开放模型在电话使用任务上的成功率,在150项人类评估中达到45.33%的成功率。
Darwin移动智能体:自我进化路线图
机构 * University College London(伦敦大学学院)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出通过移动GUI环境实现智能体自我进化,利用异步并行架构解决数据瓶颈,并规划从任务课程、结果验证和记忆管理三方面去除人类先验的路线图。
Comments Technical Report
面向质量多样性的Web智能体模仿的推测性回滚修正
机构 * Beihang University(北京航空航天大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。
基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算
机构 * Nanyang Technological University(南洋理工大学) ; Singapore Institute of Technology(新加坡理工学院) ; Seatrium New Energy Laboratory(Seatrium 新能源实验室) ; Ministry of Education (MOE) Tier 1(教育部 Tier 1) ; Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。
Comments 15 pages
A11y-Compressor:通过视觉上下文重建和冗余减少提升GUI代理观察效率的框架
机构 * Hosei University(Hosei大学)
专题命中 GUI与网页智能体 :agent(title);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出A11y-Compressor框架,通过视觉上下文重建和冗余减少技术,将线性化可访问性树转换为紧凑结构化表示,实验表明其在OSWorld基准测试中将输入token减少至原22%,任务成功率提升5.1个百分点。
Comments 18 pages, 5 figures, 5 tables. Accepted to ACL SRW 2026. Project page: https://iyatomilab.github.io/a11y-compressor/
LPO:通过位置偏好优化实现更准确的GUI代理交互
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Alibaba Group(阿里巴巴集团) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University of Science and Technology(南京理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)
专题命中 GUI与网页智能体 :agent(title);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LPO方法,通过位置偏好优化提升GUI交互精度,利用信息熵预测交互位置并引入动态位置奖励函数,实验表明其在离线和在线评估中均取得最佳性能。
Comments Accepted by ACL 2026 Findings
ScienceBoard: 评估多模态自主代理在真实科学工作流中的表现
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; East China Normal University(华东师范大学) ; Yale University(耶鲁大学)
专题命中 GUI与网页智能体 :autonomous agent(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 ScienceBoard通过真实多领域环境和169个高质量任务评估多模态自主代理在科学工作流中的能力,发现现有代理在复杂任务中仅达到15%的成功率,揭示了改进设计原则的必要性。
Comments ICLR 2026 Camera Ready Version
屏幕上的图灵测试:移动GUI代理人化的一个基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出屏幕上的图灵测试基准,通过建模检测器与代理的MinMax优化问题,评估代理在人类中心生态系统中的生存能力,并提出人化基准和检测指标,展示代理在不牺牲性能的前提下实现高模仿性。
UI-Voyager:一种通过失败经验自我进化的GUI代理学习
机构 * Tencent(腾讯)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出UI-Voyager,一种两阶段自我进化的移动GUI代理,通过拒绝微调和组相对自蒸馏提升GUI任务的效率和性能,实验显示其在AndroidWorld上达到81.0%的Pass@1成功率。
Comments Code and models are available at https://github.com/ui-voyager/UI-Voyager
CowPilot:自主与人机协作的网页导航框架
机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 CowPilot通过自主与人机协作机制提升网页导航效率,实现95%的任务成功率,减少人类操作步骤至15.2%
Comments Published at NAACL System Demonstration Track, 2025
Journal ref 2025.naacl-demo.17
GUI-GENESIS: 自动合成具有可验证奖励的高效环境以实现GUI代理训练
机构 * Key Lab of HCST (PKU), MOE ; SCS, Peking University, Beijing, China ; Tencent Inc., Shenzheng, China ; Hong Kong University of Science ; Department of Computer Science, University of Texas at Dallas, Richardson, USA ; School of Computing Science, Simon Fraser University, Burnaby, BC, Canada
专题命中 GUI与网页智能体 :agent(title);planning(abstract);分类 cs.AI、cs.LG
AI总结 GUI-GENESIS通过自动合成高效GUI训练环境并提供可验证奖励,显著提升了GUI代理的训练效率和性能。
如何训练你的LLM网络代理:一种统计诊断
机构 * ServiceNow AI Research(ServiceNow人工智能研究) ; Mila-Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于统计的计算分配方法,通过结合监督微调与基于策略的强化学习,有效提升LLM网络代理性能,减少计算成本,缩小与闭源模型的差距。
结构化上下文工程用于文件原生代理系统:评估模式准确性、格式有效性及大规模多文件导航
专题命中 GUI与网页智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究评估了文件原生代理系统中结构化上下文工程的准确性、格式有效性及多文件导航,发现模型能力是影响性能的关键因素,架构选择需根据模型能力调整。
Comments 8 pages, 8 figures, 10 tables, 26 references. v2: revised scale experiment analysis
你的GUI代理有多智能?面向软件交互未来的框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑工业大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出GUI代理自主级别框架,旨在明确自主性并评估软件交互的可信赖性进展。
MobileSafetyBench: 评估移动设备控制自主代理的安全性
专题命中 GUI与网页智能体 :autonomous agent(title,abstract);分类 cs.CL、cs.LG
AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。
基于深度强化学习的混合运动规划用于移动机器人导航
机构 * Department of Computational Mathematics and Cybernetics(计算数学与自动化系) ; Lomonosov Moscow State University(罗蒙诺夫莫斯科国立大学)
专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出HMP-DRL,结合基于图的全局规划与深度强化学习,提升移动机器人在复杂环境中的导航安全性和可靠性。
Comments 22 pages, 4 figures
从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能
机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) ; SCS, Peking University(SCS,北京大学) ; Tencent Inc.(腾讯公司) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。