arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 177 篇

2606.20910 2026-06-23 cs.CR cs.AI 新提交 79%

Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents

你是谁的代理?自主网络代理的多层指纹识别与归因

Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 针对AI网络代理的隐私与安全挑战,提出基于网络层和浏览器交互行为的多层指纹识别方法,通过决策树分类器实现97%准确率的代理识别与归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16659 2026-06-16 cs.CL 新提交 79%

FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection

FraudSMSWalker: 用于短信到网页欺诈检测的智能体大语言模型基准测试

Y. H. Zhou, Z. M. Ma, Y. J. Zhou, Y. T. Li, H. X. Xiang, Y. M. Cheng, T. L. Chen, K. J. Zhang, Z. H. Nan, J. H. Ni, Z. Wu, Q. Y. Pan, S. Zhang, S. Cheng, M. Y. Luo

机构 * Baimaohui(白猫汇) PPSUC(中国人民公安大学)

专题命中 GUI与网页智能体 :agentic(title);agent(abstract);分类 cs.CL

AI总结 提出FraudSMSWalker基准,通过屏蔽URL的短信-网页对评估智能体大语言模型在跨渠道欺诈检测中的证据推理能力,发现模型能检测可疑线索但难以保持良性召回。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10423 2026-06-10 cs.CL 新提交 79%

WebChallenger: A Reliable and Efficient Generalist Web Agent

WebChallenger: 一个可靠且高效的通用型Web智能体

Jayoo Hwang, Xiaowen Zhang, Vedant Padwal

机构 * ML Collective longsurf.ai Independent(独立研究者)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09848 2026-06-10 cs.HC cs.AI cs.CY 新提交 79%

Human-AI Coordination Zones: A Framework for Designing Human-in-the-Loop Experiences with Agentic AI

人机协调区域:设计具有代理性AI的人机协同体验框架

James Pierce, Vaiva Kalnikaitė, Siddharth Gupta, Brian Granger

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09073 2026-08-11 cs.RO 新提交 78%

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

带有单调规划代价的潜在世界模型用于图像目标导航

Amirhosein Chahe, Siwei Cai, Lifeng Zhou

机构 * Drexel University(卓克索大学)

专题命中 GUI与网页智能体 :planning(title,abstract)

AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00335 2026-08-04 cs.AI cs.CL cs.LG 新提交 78%

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS

Chengbo Liu, Lifang Zhou, Ruijie Yan, Pei Tan, Ao Sun, Haojun Huang, Guichun Hua, Sining Wei, Yining Chen, Yingying He, Yutao Xie

专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。

Comments 15 pages, 9 figures, and 6 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14468 2026-07-17 cs.RO cs.MA cs.SY eess.SY 新提交 78%

Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences

混合智能体博物馆导游设计提升性别化学习成果及游客偏好

Annette M. Masterson, Wonse Jo, Helena C. Sieh, Lionel P. Robert,, Dawn Tilbury

机构 * University of Michigan(密歇根大学) Incheon National University(仁川国立大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 研究博物馆中机器人导游,提出结合实体与虚拟智能体的混合导游系统,经30人受试者内研究验证,发现其提升女性学习表现,各条件下参与度和体验质量一致,且无论性别参与者都更偏好混合智能体团队。

Comments Accepted on IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12050 2026-07-15 cs.RO 新提交 78%

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs

EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应

Jinyuan Zhang, Yuwei Wu, Guangyao Shi, Jonathan Diller, Gaurav S. Sukhatme, Vijay Kumar

机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09716 2026-07-14 cs.RO 新提交 78%

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments

RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障

Aachal Sharma, Narendra Kumar Dhar

机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)

专题命中 GUI与网页智能体 :agentic(title);planning(abstract)

AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24870 2026-06-24 cs.HC 新提交 78%

"Zooming In" on Agentic Web Browsers as Assistive Technologies: A Case Study with a Low-Vision Technology Expert

“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究

Laura Colazzo, Giuseppe Anzillotti

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00432 2026-08-04 cs.CL 新提交 77%

Deep Research Pretraining via Predictive Navigation

基于预测导航的深度研究预训练

Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang

机构 * Tencent(腾讯) Hunyuan Team(混元团队)

专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 提出Deep Research Pretraining(DRP)离线框架,在学术引用图和维基百科超链接上预训练Qwen3-14B-Base模型,可提升智能体在多个基准任务上的表现,是轨迹智能体训练的补充方法。

Comments working in progress; correspondence to {ucaswu,maxwellyu}@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16802 2026-06-16 cs.AI 新提交 77%

LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

LabOSBench: 科学仪器控制的计算机使用智能体基准测试

Anqi Zou, Han Deng, Chengyu Zhang, Junquan Hu, Yu Wang, Yuxiang Xing, Aokai Zhang, Hanling Zhang, Zhaoyang Liu, Ben Fei, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 提出LabOSBench基准,基于Web科学仪器模拟器评估多模态GUI智能体在仪器控制中的表现,揭示现有智能体在反馈驱动操作和长流程执行上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31980 2026-07-02 cs.CL cs.AI cs.HC 新提交 76%

DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching

DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距

Meng Chen, Anya Ji, Tsung-Han Wu, Tobias Maringgele, David M. Chan, Alane Suhr, Amy Pavel

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学)

专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL

AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07594 2026-06-09 cs.AI cs.HC cs.LG cs.SE 新提交 75%

Syll: Open-Source Personal Automation with Cross-Surface Execution

Syll: 开源个人自动化与跨界面执行

Bo Zhang, Borui Zhang, Chenghao Jiang, Minglei Shi, Xiaofeng Wang, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Adobe Systems Inc.(Adobe系统公司) Stardew Valley(《星露谷物语》) macOS University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。

Comments Code: https://github.com/THU-SAGE/syll

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26933 2026-06-26 cs.CR cs.AI 新提交 74%

Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities

Chai:加密误用漏洞的智能发现

Corban Villa, Sohee Kim, Austin Chu, Alon Shakevsky, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI

AI总结 提出Chai系统,利用AI改进差分测试,从库级缺陷出发沿依赖图传播,发现并验证加密误用漏洞,在X.509、JWT、SAML库中发现超100个漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 73%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07508 2026-08-11 cs.HC cs.AI cs.CL 新提交 73%

JaleesBench: Are AI Assistants Good Spiritual Company?

JaleesBench:AI助手能否成为良好的精神陪伴?

M. Waleed Kadous, Benjamin Olsen

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。

Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02352 2026-08-04 cs.LG cs.CL 新提交 73%

Qwen-CUA: Native Computer Use for (almost) Everything

Qwen-CUA:面向几乎所有场景的原生计算机使用智能体

Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que Shen, Bowen Wang, Junli Wang, Chencan Wu, Rui Xie, Tianbao Xie, Zhihui Xie, Haiyang Xu, An Yang, Tao Yu, Wenzhen Yuan, Xi Zhang, Zhenru Zhang, Mingkang Zhu, Zhaoqing Zhu, Yizhong Cao, Kai Dang, Binyuan Hui, Kaixin Li, Junyang Lin, Haiquan Wang, Zekun Wang, Yiheng Xu, Fan Yan, Mengqi Yuan, Danyang Zhang, Jiajun Zhang, Zhipeng Zhang, Fan Zhou, Fan Zhou

机构 * Qwen Team(通义千问团队) Xlang Lab(Xlang实验室)

专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文提出原生计算机使用智能体Qwen-CUA,采用397B-A17B Qwen混合专家主干,经大规模训练后在多基准测试中性能优于Qwen3.7,为通用能力智能体奠定基础。

Comments 24 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交 73%

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.CL、cs.SE

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 70%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06474 2026-08-10 cs.AI 新提交 70%

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型

Boshui Chen, Huiping Liu, Shaolei Zhang

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。

Comments 17 pages, 3 figures. Supplementary material is included in the main PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 70%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28573 2026-07-31 cs.AI 新提交 70%

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

Woongkyu Lee, Jungwook Choi

机构 * Hanyang University(汉阳大学)

专题命中 GUI与网页智能体 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26631 2026-07-30 cs.LG cs.IR 新提交 70%

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Curtin University(科廷大学) Colorado State University(科罗拉多州立大学)

专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。

Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20773 2026-07-24 cs.HC cs.AI 新提交 70%

HARP: The Human--AI Research Platform

HARP:人机人工智能研究平台

Zeshu Zhu, Natalie Friedman, Kevin Weatherwax, Emily Eiben

机构 * BTPX Innovation Lab(BTPX创新实验室)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究旨在设计人机人工智能研究平台(HARP),通过让参与者在可控模拟场景中与可配置实时人工智能代理互动,研究人员可控制多种因素并记录相关数据,能系统测试人工智能设计选择对用户的影响。

Comments 5 pages, 3 figures, SAP Academic Community Conference North America, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 70%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13553 2026-07-16 cs.RO cs.LG cs.SY eess.SY 新提交 70%

Flow-aware Optimal Navigation in Unsteady Flows through Reinforcement Learning

通过强化学习在非定常流中进行流量感知最优导航

Andrea Maria Braghin, Nicolò Botteghi, Matteo Tomasetto, Andrea Manzoni, Gabriele Cazzulani

机构 * Politecnico di Milano(米兰理工大学) MOX(数学优化与工程计算实验室)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 研究在非定常流中自主机器人导航问题,用TD3算法训练智能体在双涡旋流中到达目标。评估五种生物启发观测策略及全局流参数影响,发现速度感知与涡度传感器效用有权衡,明确参数会降性能,为机器人导航从模拟到现实提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11185 2026-07-14 cs.AI 新提交 70%

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

SCALECUA:通过可验证任务合成和高效在线强化学习扩展计算机使用代理

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对计算机使用代理扩展能力受限问题,提出ScaleCUA框架,通过可验证任务合成及高效训练实现。包括设计VeriGen生成任务、前沿采样提高效率、视觉上下文分割加速训练,在相关平台取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05794 2026-07-08 cs.AI 新提交 70%

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

从被动检索到主动记忆导航:学习将记忆用作结构化动作空间

Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang

机构 * Alibaba(阿里巴巴) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交 70%

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

专题命中 GUI与网页智能体 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏