arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2960 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2960 篇

0903.5267 2009-12-01 cs.RO 67%

Equitable Partitioning Policies for Mobile Robotic Networks

Marco Pavone, Alessandro Arsie, Emilio Frazzoli, Francesco Bullo

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

Comments Paper submitted to IEEE Transactions on Automatic Control in December 2008

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18279 2025-05-07 cs.AI cs.CL cs.HC 66%

Large Language Model-Brained GUI Agents: A Survey

Chaoyun Zhang, Shilin He, Jiaxu Qian, Bowen Li, Liqun Li, Si Qin, Yu Kang, Minghua Ma, Guyue Liu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

机构 * Microsoft(微软公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI、cs.CL

Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02219 2024-01-05 cs.MA 64%

A Decentralized Multiagent-Based Task Scheduling Framework for Handling Uncertain Events in Fog Computing

Yikun Yang, Fenghui Ren, Minjie Zhang

专题命中 GUI与网页智能体 :agent(abstract,comments);autonomous agent(comments);multi-agent(comments)

Comments 9 pages, 5 figures. The extended abstract of this paper has been published in the proceedings of the Autonomous Agents and Multi-Agent Systems (AAMAS) 2023 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 62%

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 62%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11191 2026-08-12 cs.CV cs.AI cs.CL 新提交 62%

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位

Shiyu Xuan, Zechao Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04412 2026-08-11 cs.AI cs.CL cs.HC 版本更新 62%

Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents

超越像素:探索面向基于大语言模型的智能体的DOM下采样

Thassilo M. Schiepanski, Nicholas Piël

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。

Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20482 2026-08-05 cs.AI cs.CL 版本更新 62%

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对用户指令不明确时网络代理需从浏览历史推断上下文的问题,引入PersonaTrail基准及偏好感知上下文记忆框架PACMem,利用浏览轨迹评估代理,实验证明PACMem优于现有基于记忆的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15673 2026-08-05 cs.AI cs.LG 版本更新 62%

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 62%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17760 2026-07-21 cs.LG cs.AI cs.RO 新提交 62%

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

泛化与引导:用于少样本逆强化学习的奖励分解

Ziyi Liu, Grace Zhang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25170 2026-07-17 cs.LG cs.AI cs.ET cs.RO 版本更新 62%

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术

Kordel K. France, Ovidiu Daescu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。

Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 62%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03394 2026-07-07 cs.AI cs.CY cs.LG 新提交 62%

From Mobile Data to Business Insights: An End-to-End Analytics Framework for Large-Scale Urban Mobility Analysis and Decision Support

从移动数据到商业洞察:用于大规模城市交通分析和决策支持的端到端分析框架

Thiago Andrade, Shazia Tabassum, Miguel E. P. Silva, Ricardo Dinis, Joao Gama

机构 * LIAAD INESC-TEC Mobile Network Analytics NOS SGPS

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过调查城市环境中智能手机用户行为模式应对多领域挑战。开发数据平台,采用先进技术,构建模块化架构,应用可视化技术,模型可处理多种交通分析任务,为城市规划和商业决策提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25127 2026-06-25 cs.LG cs.AI math.OC 新提交 62%

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知

Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi, Aissa Boulmerka

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23189 2026-06-23 cs.AI cs.CL 新提交 62%

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

有能力但粗心:计算机使用代理是否遵循情境完整性?

Anmol Goel, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18212 2026-06-23 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

SCoTT: Strategic Chain-of-Thought Tasking for Wireless-Aware Robot Navigation in Digital Twins

SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划

Aladin Djuhera, Amin Seffo, Vlad C. Andrei, Holger Boche, Walid Saad

机构 * Technical University of Munich(慕尼黑技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。

Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07332 2026-06-11 cs.LG cs.AI 版本更新 62%

Grounding Computer Use Agents on Human Demonstrations

基于人类演示的计算机使用智能体基础构建

Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究) University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11078 2026-06-10 cs.AI cs.CL cs.CV 新提交 62%

A History-Aware Visually Grounded Critic for Computer Use Agents

面向计算机使用代理的历史感知视觉基础批评家

Jaewoo Lee, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Supriyo Chakraborty, Kartik Balasubramaniam, Sambit Sahu, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Capital One University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。

Comments Code: https://github.com/G-JWLee/HiViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29532 2026-05-29 cs.SE cs.AI 62%

GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing

GUITestScape:面向探索性GUI测试的开放集评估

Xiaoyi Chen, Yifei Gao, Yang Xu, Xingxing Song, Yi Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Independent Researcher(独立研究者)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出GUITestScape基准和GUIJudge评估器,通过覆盖交互与显示缺陷的508个预设缺陷及过程感知评估方法,解决现有GUI测试评估局限于预定义标注和交互缺陷的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18847 2026-05-29 cs.AI cs.CL 62%

Human-Guided Harm Recovery for Computer Use Agents

面向计算机使用代理的人类引导式危害恢复

Christy Li, Sky CH-Wang, Andi Peng, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28116 2026-05-28 cs.CR cs.AI cs.CL 62%

MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content

MIRAGE:通过用户生成内容对移动GUI代理的上下文感知提示注入

Ruoqi Guo, Yi Liu, Gelei Deng, Yiheng Xiong, Yuekang Li, Ying Zhang, Leo Yu Zhang, Lida Zhao, Ji Jie, Yuxiao Lu

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) University of New South Wales(新南威尔士大学) Wake Forest University(威克森林大学) Independent Researcher(独立研究者)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MIRAGE管道,通过将攻击者控制的文本嵌入用户生成内容区域,在不修改代理、应用或操作系统的情况下,对视觉语言模型驱动的移动GUI代理实现高成功率的提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01576 2026-05-26 cs.LG cs.AI cs.CV 62%

Generative Visual Code Mobile World Models

生成式视觉代码移动世界模型

Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

机构 * Trillion Labs(万亿实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出通过单一视觉语言模型预测可执行网页代码来生成移动GUI下一状态,结合文本和视觉世界模型优势,实现高保真视觉生成与精确文本渲染。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20299 2026-05-21 cs.LG cs.AI cs.RO 62%

Mechanisms of Misgeneralization in Physical Sequence Modeling

物理序列建模中泛化错误的机制

Kento Nishi, Raphael Tang, Karun Kumar, Core Francisco Park, Hidenori Tanaka

机构 * Harvard College(哈佛大学) Harvard John A. Paulson School of Engineering and Applied Sciences(哈佛大学约翰·A·保罗森工程与应用科学学院) Comcast AI CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能计划) Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(人工智能物理研究组,NTT研究公司,美国加利福尼亚州山景城) Microsoft(微软)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了物理序列建模中由于局部误差传播导致的物理泛化错误,提出了一种数据偏差核来预测物理量的质量变化,并提出了基于核的干预策略。

Comments Preprint. kentonishi.com/physical-misgeneralization

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17439 2026-05-20 cs.SE cs.AI 62%

DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

DiagEval: 用于通过GUI代理进行可靠软件评估的轨迹条件诊断

Sirui Hong, Zhijie Liu, Tengfei Li, Wei Tao, Yifan Wu, Chenglin Wu

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出DiagEval,一种基于轨迹的诊断评估协议,用于在GUI代理评估交互式软件后失败时进行诊断。通过重用失败轨迹选择针对性的诊断探针,并将结果聚合为内部归因信号,从而提高准确性,优于基于重试的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06807 2026-05-19 cs.RO cs.AI cs.LG 62%

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav:基于超像素图的约束放松用于过约束环境中的导航

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park

机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SuReNav方法,通过超像素图构建区域约束,利用图神经网络实现安全高效导航,适用于半静态环境中过约束规划问题,提升导航的人类类比性能。

Comments Accepted by ICRA 2026. Code and videos are available at https://sure-nav.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 62%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV 62%

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV 62%

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09317 2026-05-12 cs.CL cs.CV cs.LG 62%

Mem-W: Latent Memory-Native GUI Agents

Mem-W: 基于潜在记忆的原生GUI代理

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 Mem-W通过将记忆作为连续上下文的一部分,改进GUI代理的长期任务执行能力,实验证明其在多个导航基准测试中提升了性能,最高提升达+30.0。

详情

展开后加载摘要…

URL PDF HTML 收藏