Equitable Partitioning Policies for Mobile Robotic Networks
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
Comments Paper submitted to IEEE Transactions on Automatic Control in December 2008
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
Comments Paper submitted to IEEE Transactions on Automatic Control in December 2008
机构 * Microsoft(微软公司) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.AI、cs.CL
Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration
专题命中 GUI与网页智能体 :agent(abstract,comments);autonomous agent(comments);multi-agent(comments)
Comments 9 pages, 5 figures. The extended abstract of this paper has been published in the proceedings of the Autonomous Agents and Multi-Agent Systems (AAMAS) 2023 conference
VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示
机构 * Peking University(北京大学) ; PrimeBot
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。
Comments accepted by ACM MM 2026
代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。
Comments 27 pages, 5 figures, 15 tables
基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。
超越像素:探索面向基于大语言模型的智能体的DOM下采样
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。
Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results
PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对用户指令不明确时网络代理需从浏览历史推断上下文的问题,引入PersonaTrail基准及偏好感知上下文记忆框架PACMem,利用浏览轨迹评估代理,实验证明PACMem优于现有基于记忆的基线。
哪里出错了?基于语义状态追踪的Web智能体过程级评估
机构 * Yonsei University(延世大学) ; Microsoft Research(微软研究院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。
Journal ref COLM 2026
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
泛化与引导:用于少样本逆强化学习的奖励分解
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。
生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。
Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference
零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。
从移动数据到商业洞察:用于大规模城市交通分析和决策支持的端到端分析框架
机构 * LIAAD ; INESC-TEC ; Mobile Network Analytics ; NOS SGPS
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究通过调查城市环境中智能手机用户行为模式应对多领域挑战。开发数据平台,采用先进技术,构建模块化架构,应用可视化技术,模型可处理多种交通分析任务,为城市规划和商业决策提供见解。
奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知
机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) ; Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。
有能力但粗心:计算机使用代理是否遵循情境完整性?
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。
SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划
机构 * Technical University of Munich(慕尼黑技术大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。
Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025
基于人类演示的计算机使用智能体基础构建
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; ServiceNow Research(ServiceNow研究) ; University of Waterloo(滑铁卢大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; École de Technologie Supérieure(高级技术学院) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。
Comments Accepted at ICLR 2026
面向计算机使用代理的历史感知视觉基础批评家
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Capital One ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.CL
AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。
Comments Code: https://github.com/G-JWLee/HiViG
GUITestScape:面向探索性GUI测试的开放集评估
机构 * Beijing Jiaotong University(北京交通大学) ; Independent Researcher(独立研究者)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出GUITestScape基准和GUIJudge评估器,通过覆盖交互与显示缺陷的508个预设缺陷及过程感知评估方法,解决现有GUI测试评估局限于预定义标注和交互缺陷的问题。
面向计算机使用代理的人类引导式危害恢复
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。
MIRAGE:通过用户生成内容对移动GUI代理的上下文感知提示注入
机构 * Griffith University(格里菲斯大学) ; Quantstamp ; Nanyang Technological University(南洋理工大学) ; Singapore Management University(新加坡管理学院) ; University of New South Wales(新南威尔士大学) ; Wake Forest University(威克森林大学) ; Independent Researcher(独立研究者)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出MIRAGE管道,通过将攻击者控制的文本嵌入用户生成内容区域,在不修改代理、应用或操作系统的情况下,对视觉语言模型驱动的移动GUI代理实现高成功率的提示注入攻击。
生成式视觉代码移动世界模型
机构 * Trillion Labs(万亿实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出通过单一视觉语言模型预测可执行网页代码来生成移动GUI下一状态,结合文本和视觉世界模型优势,实现高保真视觉生成与精确文本渲染。
Comments ICML 2026
物理序列建模中泛化错误的机制
机构 * Harvard College(哈佛大学) ; Harvard John A. Paulson School of Engineering and Applied Sciences(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Comcast AI ; CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能计划) ; Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(人工智能物理研究组,NTT研究公司,美国加利福尼亚州山景城) ; Microsoft(微软)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了物理序列建模中由于局部误差传播导致的物理泛化错误,提出了一种数据偏差核来预测物理量的质量变化,并提出了基于核的干预策略。
Comments Preprint. kentonishi.com/physical-misgeneralization
DiagEval: 用于通过GUI代理进行可靠软件评估的轨迹条件诊断
机构 * DeepWisdom(深智科技) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出DiagEval,一种基于轨迹的诊断评估协议,用于在GUI代理评估交互式软件后失败时进行诊断。通过重用失败轨迹选择针对性的诊断探针,并将结果聚合为内部归因信号,从而提高准确性,优于基于重试的基线方法。
SuReNav:基于超像素图的约束放松用于过约束环境中的导航
机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SuReNav方法,通过超像素图构建区域约束,利用图神经网络实现安全高效导航,适用于半静态环境中过约束规划问题,提升导航的人类类比性能。
Comments Accepted by ICRA 2026. Code and videos are available at https://sure-nav.github.io/
以行为识别LLM浏览器代理:通过UI轨迹指纹化
机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。
什么是限制视觉-语言导航的因素?
机构 * HKUST(GZ)(香港科技大学(广州)) ; JD Explore Academy(京东探索研究院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。
拆解与构建:基于技能的视觉-语言导航代理混合
机构 * Michigan State University(密歇根州立大学) ; ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。
Comments Accepted by ACL 2026 Main Conference
Mem-W: 基于潜在记忆的原生GUI代理
机构 * LV-NUS Lab(LV-NUS实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG
AI总结 Mem-W通过将记忆作为连续上下文的一部分,改进GUI代理的长期任务执行能力,实验证明其在多个导航基准测试中提升了性能,最高提升达+30.0。