Towards blockchain-based robonomics: autonomous agents behavior validation
专题命中 GUI与网页智能体 :autonomous agent(title,abstract);agent(abstract);分类 cs.SE
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :autonomous agent(title,abstract);agent(abstract);分类 cs.SE
专题命中 GUI与网页智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE
Comments IJAET Vol.1, Issue 1, 2010, 95-103
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);tool use(abstract);agentic(abstract)
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
PhoneWorld: 扩展手机使用代理环境
机构 * Tencent Hunyuan(腾讯文英) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院( Gallagher 学院))
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出PhoneWorld,一个可复用的管道,将真实GUI轨迹和截图转化为可控的手机使用环境、可执行任务、自动验证器和训练回滚,从而规模化构建手机代理环境。
Comments work in progress
通过自主经验探索与事后经验利用赋能GUI智能体任务规划
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。
Comments Accepted to ACL 2026 Main
Qwen-RobotNav 技术报告:为智能体导航系统设计的可扩展导航模型
机构 * Qwen Team(通义实验室)
专题命中 GUI与网页智能体 :agentic(title,abstract);planning(abstract)
AI总结 提出 Qwen-RobotNav 可扩展导航模型,通过参数化接口支持多种任务模式和可调观测参数,在15.6M样本上训练,联合视觉语言数据防止行为坍缩,在多个导航基准上取得新最优结果,并展示零样本泛化能力。
HANSEL: 从Web智能体轨迹中提取面包屑用于交互式验证
专题命中 GUI与网页智能体 :agent(title,abstract);AI agent(abstract)
AI总结 提出HANSEL系统,从AI智能体轨迹中提取可交互验证的证据,减少用户审查负担,在基准测试中达到83.7%精确率和88.9%召回率,用户研究显示显著降低任务完成时间和感知努力。
Comments 13 pages, 6 figures
中间DPAgent:针对AI诱导欺骗模式的代理防御与修复
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)
AI总结 针对网络界面中的隐私欺骗模式,提出DPAgent框架,通过四个专门代理结合潜在空间净化与防御性提示,主动检测并修复欺骗性界面,检测率达90.98%,修复率77%。
基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注
专题命中 GUI与网页智能体 :workflow(title,abstract);agent(abstract)
AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。
ChatMOSP:基于化学的移动智能体用于工作状态催化剂模拟
专题命中 GUI与网页智能体 :agent(title,abstract);workflow(abstract)
AI总结 提出ChatMOSP,一个基于化学的移动科学智能体,通过多尺度操作模拟包将自然语言和语音表达的催化请求转化为参数验证的模拟,实现催化剂工作状态的可访问和可解释模拟。
Comments 26 pages, 5 figures
MementoGUI: 学习代理多模态记忆控制以实现长周期GUI代理
机构 * University of Rochester(罗切斯特大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)
AI总结 本文提出MementoGUI,一种学习代理多模态记忆控制框架,用于提升长周期GUI代理的任务状态维持能力,通过模块化记忆控制和可扩展的数据管道提高记忆检索和决策效率。
Comments Preprint, 15 pages, 4 figures, 5 tables
Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; The University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。
Comments Accepted at ICML 2026
WAAA! 网络对抗与代理浏览器
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)
AI总结 本文提出首个针对代理浏览器的网络威胁模型,识别20种攻击类型,展示代理浏览器在传统和LLM威胁下的五种主要失效模式,强调需重新设计代理浏览器。
增强型文献计量框架:基于代理AI的范式转变用于动态、片段式研究分析
专题命中 GUI与网页智能体 :agentic(title,abstract);AI agent(abstract)
AI总结 本文提出一个生成式多代理AI框架,通过自然语言指令实现动态代码基文献计量分析,无需专业编程技能,支持多模态全文检索、代理探索和动态指标创建,突破传统工具的限制。
MobiFlow: 通过轨迹融合实现真实世界移动代理基准测试
机构 * Institute of Parallel and Distributed Systems (IPADS), Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所(IPADS)) ; Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) ; National Innovation Institute of High-end Smart Appliances(国家高端智能家电创新研究院)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 MobiFlow通过轨迹融合算法构建任务,覆盖20个常用第三方应用,提供240种真实任务,提升模型在真实负载下的评估精度。
从噪声受损观测中推断动态博弈中被遮挡行为
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
AI总结 本文提出一种考虑遮挡的博弈推理方法,用于估计可能被遮挡的智能体位置,并推断可见和被遮挡智能体的意图,同时验证了在噪声观测下的导航安全性。
AgentVLN:迈向具有代理能力的视觉-语言导航
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Shandong University(山东大学) ; Zhejiang University(浙江大学)
专题命中 GUI与网页智能体 :agentic(title);agent(abstract);planning(abstract)
AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。
Comments 19pages, 4 figures
高效计算机使用代理的训练
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII ; GAIR
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出PC Agent-E,通过结合人类标注数据与Claude 3.7 Sonnet生成的数据,实现了计算机使用代理的高效训练,取得显著性能提升。
Comments ICLR 2026
全局指挥官与局部执行者:一种双智能体框架用于场景导航
机构 * National University of Singapore(新加坡国立大学) ; Simon Fraser University(西蒙弗雷泽大学) ; University of Oxford(牛津大学)
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
AI总结 DACo提出双智能体框架,通过解耦全局推理与局部执行,提升复杂环境中长时序导航的稳定性和性能。
Comments 18 pages, 9 figures
一个引导所有代理:通过显式世界表示增强多模态大语言模型用于视觉-语言导航
机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) ; The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学) ; Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
AI总结 通过显式世界表示增强多模态大语言模型,实现视觉-语言导航的解耦框架,提升导航性能与现实应用能力。
机构 * McGill University(麦吉尔大学) ; Mila Quebec AI Institute(魁北克AI研究院) ; Google DeepMind(谷歌DeepMind) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) ; Polytechnique Montréal(蒙特利尔理工学院) ; ServiceNow Research(ServiceNow研究)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) ; Alibaba Group(阿里巴巴集团)
专题命中 GUI与网页智能体 :planning(title,abstract);agent(abstract)
Comments Under Review
机构 * Department of Computer Science, University of Illinois Chicago, Chicago, IL 60607, USA ; Department of Computer Science \& Engineering, IIT Madras, Chennai 600036, India ; Security Research Unit, Indian Statistical Institute, Kolkata, 700108, India ; Department of Computer Science, Kent State University, Kent, OH 44242, USA
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)
Comments 42 pages, 3 figures,3 tables, 8 pseudocodes; some overlaps with arXiv:2403.13716v2
专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract)
Comments 23 pages, 16 figures, the project resources are available at https://lgy0404.github.io/LearnAct
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)
Comments 14 pages, 6 figures