arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 185 篇

2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 57%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 57%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08617 2026-08-11 cs.AI cs.HC 新提交 57%

Walking through Discussions: A Mobile Visual Analytics System for In-Situ Group Discussion Analysis

穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统

Yiping Sun, Ziyao Kang, Wei Zeng, Minli Wu, Jiazhi Xia

机构 * Central South University(中南大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。

Comments Accepted by IEEE VIS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08545 2026-08-11 cs.RO cs.LG 新提交 57%

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

结构化参数环境下用于鲁棒导航策略的课程生成

Prishita Ray

机构 * Cornell University(康奈尔大学)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.LG

AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07775 2026-08-11 cs.AI 新提交 57%

AndroidReality: How Far Are Mobile Agents from the Real World?

AndroidReality:移动智能体距离真实世界还有多远?

Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于扰动的框架AndroidReality,构建含可控扰动的移动基准测试,揭示移动智能体的鲁棒性差距,提出TTIR机制缓解故障,确立基准扰动的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07751 2026-08-11 cs.RO cs.LG 新提交 57%

CoCoNav: Conformal Control for Safe Robot Navigation in Crowds

CoCoNav:面向人群环境中安全机器人导航的保形控制

Cheng Guo, Mingzhe Ni, Zheng Liang, Yihu Ling, Yuan Hu, Michele Caprio, Daniele Pucci, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) Italian Institute of Technology(意大利技术研究院) Genisom AI University of Warwick(华威大学) Newcastle University(纽卡斯尔大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07079 2026-08-10 cs.RO cs.AI 新提交 57%

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆

Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01802 2026-08-04 cs.AI cs.RO 新提交 57%

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29320 2026-08-03 cs.AI 新提交 57%

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

MAGA:基于结构化动作蒸馏的GUI智能体多平台自融合

Hang Yan, Zhangxuan GU, Beitong Zhou, Jiaxuan Chen, Runze Li, Yusong Hu, Shuheng Shen, Changhua Meng

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对GUI智能体跨平台部署受限问题,提出MAGA方法优化训练信号分配,在8B参数规模下性能优于基准模型,与教师模型表现接近。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28399 2026-07-31 cs.LG 新提交 57%

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees

为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试

Zihan Dong, Rui Qian, Qishi Zhan, Dongshen Peng, Kaixin Li, Yu Li

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26385 2026-07-30 cs.GT cs.AI cs.CR 新提交 57%

Collusion with Competitive Marginals: Price-Level Audits Are Blind by Construction

具有竞争性边际的合谋:价格水平审计天生具有盲目性

Xin Xu, Chengrui Wu, Jiayu Lu, Kaizhen Tan, Siru Tao, Hanzhe Hong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。

Comments 11 pages, 4 figures, includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26464 2026-07-30 cond-mat.mtrl-sci cs.AI 新提交 57%

PUDA: An AI-Native Hardware Harness for Self-Driving Laboratories

PUDA:面向自动驾驶实验室的AI原生硬件控制框架

Zekun Ren, Hongzhao Tan, Jiaen Yee, Kedar Hippalgaonkar

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23842 2026-07-28 cs.NE cs.AI 新提交 57%

Limbomorphs

肢体形态

Alex Alvarez, Michael Levin

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究人工生命系统中Gifbreeder的肢体形态,通过用户审美选择进化时空场产生类似生物的形态,用输入空间扰动评估其行为,探讨其反应是否反映目标导向行为及类似智能体动力学如何在无明确规则系统中出现。

Comments 3 pages, 3 figures. Extended abstract accepted as a Late Breaking Abstract at the Artificial Life Conference (ALIFE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22689 2026-07-28 cs.AI 新提交 57%

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

超越顺序交互:GUI 智能体并行执行与协调的基准测试

Zedong Yu, Qianxing Li, Zhi Gao, Liuyu Xiang, Chenrui Shi, Yang Liu, Huiming Wu, Yujie Wei, Yuhao Fei, Yubo Fu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) China University of Geosciences (Beijing)(中国地质大学(北京)) Beijing Institute of Technology(北京理工大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。

Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 57%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15550 2026-07-20 cs.AI 新提交 57%

SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

机构 * JIUTIAN Research(九天研究)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14443 2026-07-17 cs.AI 新提交 57%

Tactile: Giving Computer-Using Agents Hands and Feet

触觉:赋予使用计算机的智能体双手和双脚

Yong Liu, Zhenyi Zhong, Zhanpeng Shi

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12811 2026-07-15 cs.RO cs.AI 新提交 57%

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops

PixelLoop:具有像素级环路的捷径拓扑导航

Sarthak Chittawar, Vansh Garg, Aditya Vadali, Krish Pandya, Rohit Jayanti, Sourav Garg, Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(国际信息技术学院海得拉巴分校机器人研究中心)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究拓扑映射和导航中环路闭合作用,提出PixelLoop方法在像素空间引入环路闭合,充当密集拓扑捷径,经模拟实验和真实机器人部署验证,相比基线在成功率和SPL上有显著提升,为拓扑视觉导航提供基础。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS); 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交 57%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01754 2026-07-03 cs.AI 新提交 57%

Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation

路径级事后指令用于视觉语言导航中的语义探索

Sung June Kim, Sangpil Kim, Honglak Lee

机构 * Korea University(高丽大学) University of Michigan(密歇根大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出Phi-Nav框架,通过事后推理将指令与智能体实际探索轨迹对齐,利用三阶段双监督循环将语义未标记的运动转化为密集训练信号,在R2R-CE和RxR-CE基准上以少量专家演示取得竞争性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00056 2026-07-03 cs.IT cs.AI cs.MA cs.NI math.IT 新提交 57%

Active Sensing for RIS-Aided Tracking and Power Control: A Hybrid Neuroevolution and Supervised Learning Approach

面向RIS辅助跟踪与功率控制的主动感知:一种混合神经进化与监督学习方法

George Stamatelis, Hui Chen, Henk Henk Wymeersch, George C. Alexandropoulos

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出双智能体深度学习框架,结合神经进化与监督学习,联合优化RIS相位和用户发射功率,实现高精度鲁棒跟踪,优于扩展卡尔曼滤波和粒子滤波。

Comments Submitted to an IEEE journal, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00502 2026-07-02 cs.CL 新提交 57%

A Task-State Representation for Long-Horizon Mobile GUI Agents

面向长时程移动GUI代理的任务状态表示

Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。

Comments Preprint. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 57%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20045 2026-06-19 cs.CV cs.AI 新提交 57%

See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View

See-and-Reach: 视场内的精确视觉语言导航用于无人机

Fanfu Xue, En Yu, Yantian Shen, Zhikun Hu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

机构 * School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) School of Computer Science and Artificial Intelligence, Shandong Normal University(山东师范大学计算机科学与人工智能学院) Interdisciplinary Research Center of General Artificial Intelligence, Shandong Normal University(山东师范大学通用人工智能跨学科研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对无人机视觉语言导航中目标可见后精确到达能力评估不足的问题,提出UAV-VLN-FOV任务和3DG-VLN框架,通过动态3D方向线索增强细粒度视觉定位与空间对齐,在基准和真实实验中显著提升成功率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18235 2026-06-17 cs.AI 新提交 57%

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏