arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 177 篇

2608.01802 2026-08-04 cs.AI cs.RO 新提交 57%

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29320 2026-08-03 cs.AI 新提交 57%

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

MAGA:基于结构化动作蒸馏的GUI智能体多平台自融合

Hang Yan, Zhangxuan GU, Beitong Zhou, Jiaxuan Chen, Runze Li, Yusong Hu, Shuheng Shen, Changhua Meng

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对GUI智能体跨平台部署受限问题,提出MAGA方法优化训练信号分配,在8B参数规模下性能优于基准模型,与教师模型表现接近。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28399 2026-07-31 cs.LG 新提交 57%

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees

为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试

Zihan Dong, Rui Qian, Qishi Zhan, Dongshen Peng, Kaixin Li, Yu Li

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26385 2026-07-30 cs.GT cs.AI cs.CR 新提交 57%

Collusion with Competitive Marginals: Price-Level Audits Are Blind by Construction

具有竞争性边际的合谋:价格水平审计天生具有盲目性

Xin Xu, Chengrui Wu, Jiayu Lu, Kaizhen Tan, Siru Tao, Hanzhe Hong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。

Comments 11 pages, 4 figures, includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26464 2026-07-30 cond-mat.mtrl-sci cs.AI 新提交 57%

PUDA: An AI-Native Hardware Harness for Self-Driving Laboratories

PUDA:面向自动驾驶实验室的AI原生硬件控制框架

Zekun Ren, Hongzhao Tan, Jiaen Yee, Kedar Hippalgaonkar

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23842 2026-07-28 cs.NE cs.AI 新提交 57%

Limbomorphs

肢体形态

Alex Alvarez, Michael Levin

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究人工生命系统中Gifbreeder的肢体形态,通过用户审美选择进化时空场产生类似生物的形态,用输入空间扰动评估其行为,探讨其反应是否反映目标导向行为及类似智能体动力学如何在无明确规则系统中出现。

Comments 3 pages, 3 figures. Extended abstract accepted as a Late Breaking Abstract at the Artificial Life Conference (ALIFE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22689 2026-07-28 cs.AI 新提交 57%

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

超越顺序交互:GUI 智能体并行执行与协调的基准测试

Zedong Yu, Qianxing Li, Zhi Gao, Liuyu Xiang, Chenrui Shi, Yang Liu, Huiming Wu, Yujie Wei, Yuhao Fei, Yubo Fu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) China University of Geosciences (Beijing)(中国地质大学(北京)) Beijing Institute of Technology(北京理工大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。

Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 57%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15550 2026-07-20 cs.AI 新提交 57%

SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

机构 * JIUTIAN Research(九天研究)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14443 2026-07-17 cs.AI 新提交 57%

Tactile: Giving Computer-Using Agents Hands and Feet

触觉:赋予使用计算机的智能体双手和双脚

Yong Liu, Zhenyi Zhong, Zhanpeng Shi

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12811 2026-07-15 cs.RO cs.AI 新提交 57%

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops

PixelLoop:具有像素级环路的捷径拓扑导航

Sarthak Chittawar, Vansh Garg, Aditya Vadali, Krish Pandya, Rohit Jayanti, Sourav Garg, Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(国际信息技术学院海得拉巴分校机器人研究中心)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究拓扑映射和导航中环路闭合作用,提出PixelLoop方法在像素空间引入环路闭合,充当密集拓扑捷径,经模拟实验和真实机器人部署验证,相比基线在成功率和SPL上有显著提升,为拓扑视觉导航提供基础。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS); 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交 57%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05106 2026-07-07 cs.SE 新提交 57%

RepoTrace: Browser-Assisted Evidence Collection for GitHub Research Datasets

RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集

Xue Yao, Zehua Zhang, Jiatong Liu, Yongqiang Tian

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE

AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01754 2026-07-03 cs.AI 新提交 57%

Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation

路径级事后指令用于视觉语言导航中的语义探索

Sung June Kim, Sangpil Kim, Honglak Lee

机构 * Korea University(高丽大学) University of Michigan(密歇根大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出Phi-Nav框架,通过事后推理将指令与智能体实际探索轨迹对齐,利用三阶段双监督循环将语义未标记的运动转化为密集训练信号,在R2R-CE和RxR-CE基准上以少量专家演示取得竞争性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00056 2026-07-03 cs.IT cs.AI cs.MA cs.NI math.IT 新提交 57%

Active Sensing for RIS-Aided Tracking and Power Control: A Hybrid Neuroevolution and Supervised Learning Approach

面向RIS辅助跟踪与功率控制的主动感知:一种混合神经进化与监督学习方法

George Stamatelis, Hui Chen, Henk Henk Wymeersch, George C. Alexandropoulos

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出双智能体深度学习框架,结合神经进化与监督学习,联合优化RIS相位和用户发射功率,实现高精度鲁棒跟踪,优于扩展卡尔曼滤波和粒子滤波。

Comments Submitted to an IEEE journal, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00502 2026-07-02 cs.CL 新提交 57%

A Task-State Representation for Long-Horizon Mobile GUI Agents

面向长时程移动GUI代理的任务状态表示

Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。

Comments Preprint. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 57%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20045 2026-06-19 cs.CV cs.AI 新提交 57%

See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View

See-and-Reach: 视场内的精确视觉语言导航用于无人机

Fanfu Xue, En Yu, Yantian Shen, Zhikun Hu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

机构 * School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) School of Computer Science and Artificial Intelligence, Shandong Normal University(山东师范大学计算机科学与人工智能学院) Interdisciplinary Research Center of General Artificial Intelligence, Shandong Normal University(山东师范大学通用人工智能跨学科研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对无人机视觉语言导航中目标可见后精确到达能力评估不足的问题,提出UAV-VLN-FOV任务和3DG-VLN框架,通过动态3D方向线索增强细粒度视觉定位与空间对齐,在基准和真实实验中显著提升成功率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18235 2026-06-17 cs.AI 新提交 57%

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17929 2026-06-17 cs.AI 新提交 57%

PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

PreAct:在重复任务上加速的计算机使用代理

Bojie Li

机构 * Pine AI

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12666 2026-06-17 cs.CR cs.AI 新提交 57%

CAPED: Context-Aware Privacy Exposure Defense for Mobile GUI Agents

CAPED:面向移动GUI代理的上下文感知隐私暴露防御

Siyu Shen, Fenghao Xu, Wenrui Diao, Kehuan Zhang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对移动GUI代理截图上传导致的附带视觉隐私暴露问题,提出上下文感知的预上传暴露控制层CAPED,通过任务需求提取、屏幕上下文隐私先验和UI元素解析,选择性暴露任务所需内容,在保持高任务效用的同时显著降低隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16902 2026-06-16 cs.RO cs.AI 新提交 57%

Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models

基于开放视觉语言模型的空间问答与导航的二值追踪

Dongbin Na, Chanwoo Kim, Soonbin Rho, Giyun Choi, Gangbok Lee, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出BinTrack,一种全开源的空间定位代理,通过二值搜索轨迹段,在SpaceLocQA基准上准确率提升22.8%,推理速度提升1.5倍,并发布多行程室外数据集GangnamLoop。

Comments 21 pages, 4 figures, 15 tables. Project page: https://ndb796.github.io/BinaryTracking ; Code and dataset: https://github.com/ndb796/BinaryTracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15017 2026-06-16 cs.CL 新提交 57%

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

在线技能与记忆模块是否总是值得其令牌消耗?Web代理的预算约束研究

Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

机构 * ServiceNow AI Research(ServiceNow AI 研究院) ÉTS Montreal(蒙特利尔高等技术学院) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.CL

AI总结 在固定推理预算下,对比三种在线增强模块与令牌匹配的基线,发现基线在总成功率上匹配或超越所有增强方法,且常使用更少令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14832 2026-06-16 cs.CL 新提交 57%

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness: 通过混合GUI、CLI和工具操作利用手机使用代理

Chenxin Li, Zhengyao Fang, Zhengyang Tang, Pengyuan Lyu, Xingran Zhou, Xin Lai, Fei Tang, Liang Wu, Yiduo Guo, Weinong Wang, Junyi Li, Yi Zhang, Yang Ding, Huawen Shen, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出PhoneHarness,一个混合动作基准和执行框架,用于评估手机代理在可验证移动工作流中的表现,通过GUI、CLI和工具动作的组合,达到75.0%通过率,比最强基线高12.9个百分点。

Comments Project Page: https://phoneharness.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10742 2026-06-10 cs.CR cs.LG 新提交 57%

MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents

MemVenom:网络代理中多模态记忆的触发式投毒

Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tianjin University(天津大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出MemVenom框架,针对网络代理的外部记忆系统,通过触发条件检索和攻击诱导,实现黑盒多模态记忆投毒,达到高成功率且不影响良性性能。

Comments Preprint. 27 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09447 2026-06-09 cs.AI 新提交 57%

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

AliyunConsoleAgent:通过蒸馏和强化学习在真实云环境中训练Web智能体

Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

机构 * Alibaba Cloud China(阿里云中国)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出AliyunConsoleAgent框架,通过蒸馏前沿模型轨迹进行监督微调,再结合GRPO和双通道结果奖励模型在真实云环境中强化学习,实现文档验证自动化,以低成本达到接近前沿专有模型的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 57%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏