arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-09 至 2026-06-09 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 8 篇

2606.07594 2026-06-09 cs.AI cs.HC cs.LG cs.SE 新提交 75%

Syll: Open-Source Personal Automation with Cross-Surface Execution

Syll: 开源个人自动化与跨界面执行

Bo Zhang, Borui Zhang, Chenghao Jiang, Minglei Shi, Xiaofeng Wang, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Adobe Systems Inc.(Adobe系统公司) Stardew Valley(《星露谷物语》) macOS University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。

Comments Code: https://github.com/THU-SAGE/syll

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17245 2026-06-09 cs.AI 版本更新 70%

Web Agents Should Use Typed Actions Instead of Click-Based Browsing

Web 智能体应使用类型化动作而非基于点击的浏览

Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出通过语义层支持的类型化动作(web verbs)替代低层交互原语,以构建可靠、可审计的Web智能体,并通过案例展示其优势。

Comments Accepted to the ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09447 2026-06-09 cs.AI 新提交 57%

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

AliyunConsoleAgent:通过蒸馏和强化学习在真实云环境中训练Web智能体

Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

机构 * Alibaba Cloud China(阿里云中国)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出AliyunConsoleAgent框架,通过蒸馏前沿模型轨迹进行监督微调,再结合GRPO和双通道结果奖励模型在真实云环境中强化学习,实现文档验证自动化,以低成本达到接近前沿专有模型的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 57%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04627 2026-06-09 cs.AI 版本更新 57%

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE: 具有隐式推理和生成世界模型的移动智能体

Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 50%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02519 2026-06-09 cs.RO 版本更新 50%

IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes?

IMAC-AgriVLN:农业视觉与语言导航智能体能否意识到指令错误?

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学) China Agricultural University-Sichuan Advanced Agricultural & Industrial Institute(中国农业大学-四川先进农业与工业研究院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业VLN中指令可能错误的问题,提出A2A-MI基准和IMAC模块,通过分析指令与前方图像判断并纠正错误,显著提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏