arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-13 至 2026-05-13 共收录 4 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 4 篇

2605.12294 2026-05-13 cs.AI 88%

Executable Agentic Memory for GUI Agent

可执行代理记忆用于GUI代理

Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

机构 * Tsinghua University, China(清华大学, 中国) Sun Yat-sen University, China(中山大学, 中国)

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(title);planning(abstract);分类 cs.AI

AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12460 2026-05-13 cs.LG cs.CL 79%

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈

Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) University Hospital Tübingen(图宾根大学医院) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。

Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12481 2026-05-13 cs.AI 77%

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

ToolCUA:迈向计算机使用代理的最优GUI工具路径协调

Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ToolCUA,通过分阶段训练范式学习最优GUI-工具路径选择,利用交互式轨迹缩放管道和工具引导的GUI RFT提升关键切换点决策,实验显示其在OSWorld-MCP上准确率达46.85%,优于基线模型66%,证明了有效的GUI-工具协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 50%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏