Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents
你是谁的代理?自主网络代理的多层指纹识别与归因
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
AI总结 针对AI网络代理的隐私与安全挑战,提出基于网络层和浏览器交互行为的多层指纹识别方法,通过决策树分类器实现97%准确率的代理识别与归因。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
你是谁的代理?自主网络代理的多层指纹识别与归因
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
AI总结 针对AI网络代理的隐私与安全挑战,提出基于网络层和浏览器交互行为的多层指纹识别方法,通过决策树分类器实现97%准确率的代理识别与归因。
FraudSMSWalker: 用于短信到网页欺诈检测的智能体大语言模型基准测试
机构 * Baimaohui(白猫汇) ; PPSUC(中国人民公安大学)
专题命中 GUI与网页智能体 :agentic(title);agent(abstract);分类 cs.CL
AI总结 提出FraudSMSWalker基准,通过屏蔽URL的短信-网页对评估智能体大语言模型在跨渠道欺诈检测中的证据推理能力,发现模型能检测可疑线索但难以保持良性召回。
WebChallenger: 一个可靠且高效的通用型Web智能体
机构 * ML Collective ; longsurf.ai ; Independent(独立研究者)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。
人机协调区域:设计具有代理性AI的人机协同体验框架
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。
带有单调规划代价的潜在世界模型用于图像目标导航
机构 * Drexel University(卓克索大学)
专题命中 GUI与网页智能体 :planning(title,abstract)
AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。
RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。
Comments 15 pages, 9 figures, and 6 tables. Includes appendices
混合智能体博物馆导游设计提升性别化学习成果及游客偏好
机构 * University of Michigan(密歇根大学) ; Incheon National University(仁川国立大学)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 研究博物馆中机器人导游,提出结合实体与虚拟智能体的混合导游系统,经30人受试者内研究验证,发现其提升女性学习表现,各条件下参与度和体验质量一致,且无论性别参与者都更偏好混合智能体团队。
Comments Accepted on IROS 2026, 8 pages
EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应
机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) ; Department of Computer Science, University of Southern California(南加州大学计算机科学系)
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。
RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障
机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)
专题命中 GUI与网页智能体 :agentic(title);planning(abstract)
AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。
“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。
基于预测导航的深度研究预训练
机构 * Tencent(腾讯) ; Hunyuan Team(混元团队)
专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL
AI总结 提出Deep Research Pretraining(DRP)离线框架,在学术引用图和维基百科超链接上预训练Qwen3-14B-Base模型,可提升智能体在多个基准任务上的表现,是轨迹智能体训练的补充方法。
Comments working in progress; correspondence to {ucaswu,maxwellyu}@tencent.com or wuxing@iie.ac.cn
LabOSBench: 科学仪器控制的计算机使用智能体基准测试
机构 * Shenzhen Loop Area Institute(深圳河套学院) ; Dalian University of Technology(大连理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 提出LabOSBench基准,基于Web科学仪器模拟器评估多模态GUI智能体在仪器控制中的表现,揭示现有智能体在反馈驱动操作和长流程执行上的不足。
DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距
机构 * University of California, Berkeley(加州大学伯克利分校) ; Technical University of Munich(慕尼黑工业大学)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL
AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。
Syll: 开源个人自动化与跨界面执行
机构 * Adobe Systems Inc.(Adobe系统公司) ; Stardew Valley(《星露谷物语》) ; macOS ; University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。
Comments Code: https://github.com/THU-SAGE/syll
Chai:加密误用漏洞的智能发现
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI
AI总结 提出Chai系统,利用AI改进差分测试,从库级缺陷出发沿依赖图传播,发现并验证加密误用漏洞,在X.509、JWT、SAML库中发现超100个漏洞。
CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准
机构 * Macau University of Science and Technology(澳门科技大学) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; FellouAI ; ARGUS Lab(ARGUS实验室) ; The University of Edinburgh(爱丁堡大学)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。
Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/
JaleesBench:AI助手能否成为良好的精神陪伴?
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。
Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb
Qwen-CUA:面向几乎所有场景的原生计算机使用智能体
机构 * Qwen Team(通义千问团队) ; Xlang Lab(Xlang实验室)
专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);分类 cs.CL、cs.LG
AI总结 本文提出原生计算机使用智能体Qwen-CUA,采用397B-A17B Qwen混合专家主干,经大规模训练后在多基准测试中性能优于Qwen3.7,为通用能力智能体奠定基础。
Comments 24 pages, 10 figures. Technical report
超越GUI范式:移动代理是否需要手机屏幕?
机构 * Mila – Québec AI Institute(魁北克人工智能研究所) ; Concordia University(康科迪亚大学) ; University of Toronto(多伦多大学) ; McMaster University(麦马斯特大学)
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.CL、cs.SE
AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。
LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.SE
AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。
Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。
Comments 17 pages, 3 figures. Supplementary material is included in the main PDF
StepReflect:面向移动GUI智能体的结构化UI过渡反射
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。
重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡
机构 * Hanyang University(汉阳大学)
专题命中 GUI与网页智能体 :planning(abstract);agentic(abstract);分类 cs.AI
AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。
RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别
机构 * University of Sydney(悉尼大学) ; Curtin University(科廷大学) ; Colorado State University(科罗拉多州立大学)
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.LG
AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。
Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)
HARP:人机人工智能研究平台
机构 * BTPX Innovation Lab(BTPX创新实验室)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究旨在设计人机人工智能研究平台(HARP),通过让参与者在可控模拟场景中与可配置实时人工智能代理互动,研究人员可控制多种因素并记录相关数据,能系统测试人工智能设计选择对用户的影响。
Comments 5 pages, 3 figures, SAP Academic Community Conference North America, 2026
EvoGUI:用于GUI状态转换理解的进化感知基准测试
机构 * Tsinghua University(清华大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。
通过强化学习在非定常流中进行流量感知最优导航
机构 * Politecnico di Milano(米兰理工大学) ; MOX(数学优化与工程计算实验室)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.LG
AI总结 研究在非定常流中自主机器人导航问题,用TD3算法训练智能体在双涡旋流中到达目标。评估五种生物启发观测策略及全局流参数影响,发现速度感知与涡度传感器效用有权衡,明确参数会降性能,为机器人导航从模拟到现实提供见解。
SCALECUA:通过可验证任务合成和高效在线强化学习扩展计算机使用代理
机构 * Tsinghua University(清华大学)
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究针对计算机使用代理扩展能力受限问题,提出ScaleCUA框架,通过可验证任务合成及高效训练实现。包括设计VeriGen生成任务、前沿采样提高效率、视觉上下文分割加速训练,在相关平台取得新的最优性能。
从被动检索到主动记忆导航:学习将记忆用作结构化动作空间
机构 * Alibaba(阿里巴巴) ; ShanghaiTech University(上海科技大学) ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。
具备安全保证的Web智能体不可信内容掩码技术
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; ISTA(瑞士信息科学与技术学院) ; Anthropic(Anthropic公司)
专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);分类 cs.LG
AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。