All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation
全天多场景终身视觉-语言导航与Tucker适应
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。
Comments ICLR 2026
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
全天多场景终身视觉-语言导航与Tucker适应
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。
Comments ICLR 2026
自适应视觉-语言模型路由用于计算机使用代理
机构 * vLLM Semantic Router Project(vLLM语义路由项目) ; MBZUAI ; McGill University(麦吉尔大学) ; AMD ; Red Hat(红帽公司)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。
PM-Nav:基于先验图的功能性建筑中具身导航
机构 * Faculty of Robot Science and Engineering at Northeastern University(东北大学机器人科学与工程学院) ; Foshan Graduate School of Innovation at Northeastern University(东北大学佛山创新研究生学院) ; School of Aeronautic Science and Engineering at Beihang University(北航航空科学与工程学院)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 PM-Nav通过构建先验图和多模型协作机制,提升了功能性建筑中的导航精度和效率。
Comments 6 pages, 4 figures
R2F:利用射线前沿进行无需大语言模型的对象导航
机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) ; Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) ; International University of Rome UNINT, Rome(罗马国际大学UNINT)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。
PIRA-Bench: 从反应式 GUI 代理到基于 GUI 的主动意图推荐代理的转变
机构 * Nankai University(南开大学) ; Huawei Research(华为研究)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 PIRA-Bench通过引入主动意图推荐代理基准,推动GUI代理从反应式向主动式转变,评估多模态大语言模型在连续弱监督视觉输入中的能力。
持续性具身导航学习
机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) ; Shenyang Institute of Automation(沈阳自动化研究所) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。
Comments 24 pages, 7 figures
Go-Browse: 通过结构化探索训练网络代理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 Go-Browse通过结构化探索方法,利用大规模网络环境数据训练代理,提升任务解决成功率。
赋予具身体验智能体空间推理能力以实现视觉-语言导航
机构 * Southwestern University of Finance(西南财经大学) ; Department of Informatics,Universitat Hamburg, Hamburg, Germany(汉堡大学信息学院) ; University of Electronic Science(电子科技大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 BrainNav通过模仿生物认知功能,提升具身体验智能体的空间推理能力,实现更高效的视觉-语言导航。
代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。
时空令牌剪枝用于高效高分辨率GUI代理
机构 * Tsinghua University(清华大学) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 GUIPruner通过时空令牌剪枝技术,实现高分辨率GUI导航的高效处理,显著提升性能并降低资源消耗。
仅凭像素能走多远?对商业3DARPG中纯屏幕导航的初步研究
机构 * McGill University(麦吉尔大学) ; Connecticut College(康奈尔学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出纯屏幕导航代理,通过视觉可能性探索3DARPG关卡,初步实验显示其导航能力,但受限于视觉模型的不足,无法实现全面自动导航。
利用离线知识提升网络代理适应性的JEF-Hinter
机构 * ServiceNow AI Research(ServiceNow AI研究机构) ; Chandar Research Lab(Chandar研究实验室) ; Mila -- Quebec AI Institute(魁北克人工智能研究院) ; Dalhousie University(达尔豪斯大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI
AI总结 JEF-Hinter通过提炼离线轨迹生成上下文感知提示,提升网络代理在陌生领域的适应能力,实验显示其优于多种基线方法。
探查-然后承诺多目标老虎机:有限多臂反馈的理论优势
机构 * Department of Electrical Engineering, University at Buffalo(电气工程系,布法罗大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出PtC-P-UCB算法,通过有限探查提升多目标老虎机的性能,实现$1/\sqrt{q}$的加速效果。
连续环境中视觉语言导航的视角不变学习
机构 * Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学) ; Department of Civil and Environmental Engineering, University of Waterloo(土木与环境工程系,滑铁卢大学) ; Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出VIL框架,通过对比学习和教师-学生机制提升连续环境中视觉语言导航的视角鲁棒性,实验表明其在多个基准数据集上性能优越。
Comments This paper is accepted to RA-L 2026
MolmoSpaces: 一个大规模的开放式生态系统用于机器人导航与操作
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 MolmoSpaces是一个大规模开放式生态系统,用于支持机器人导航与操作的大规模基准测试,包含230k多样化的室内环境和130k丰富标注的物体资产,通过8个任务的基准测试验证了其在仿真到现实中的强相关性。
通过联邦分裂决策变换器进行边缘学习以实现元宇宙资源分配
机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出FSDT框架,通过联邦学习与强化学习结合,解决异构多无线电接入环境下的元宇宙资源分配问题,提升QoE并减少计算负担。
Comments 6 pages, 4 figures, Accepted paper at IEEE International Conference on Communications (ICC) 2026
一种统一的跨平台框架,用于结构生物信息学及其他领域的自动GUI和插件生成
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出了一种统一的跨平台框架,用于自动化生成结构生物信息学及其他领域的GUI和插件,通过MVP模式实现可重用性和跨平台兼容性。
Comments 10 pages, 4 figures
学习高效视觉-语言导航中的可导航候选检索
机构 * University of New South Wales, Sydney, Australia(新南威尔士大学) ; Macquarie University, Sydney, Australia(麦考瑞大学) ; Data61, CSIRO, Sydney, Australia(Data61, CSIRO) ; The School of Computer Science(计算机科学学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出检索增强框架,通过指令级示例检索和候选剪枝提升LLM在视觉-语言导航中的效率和稳定性。
PATHWAYS:评估人工智能网络代理中的调查与上下文发现
机构 * Robotics and Mechatronics Engineering, University of Dhaka, Dhaka, Bangladesh(机器人与机电工程系,达卡大学,达卡,孟加拉国)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 PATHWAYS评估了人工智能网络代理在多步骤任务中发现和利用隐藏上下文的能力,揭示了当前架构在适应性调查和判断覆盖方面的不足。
Comments 35 pages, 13 figures
Journal ref Under Review in ICML 2026
具有不定因果顺序的量子集成传感与计算
机构 * Signal Processing Systems Group, Department of Electrical Engineering, Eindhoven University of Technology, Eindhoven, 5612 AP, The Netherlands(埃因霍温理工大学电气工程系信号处理系统组)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种在量子不定因果顺序框架下集成传感与计算的方案,通过量子代理同时执行状态观测和计算任务,实现了在磁导航任务中的高效性能。
Comments Submitted for publication
SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE
AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。
从障碍到礼仪:基于VLM引导路径选择的机器人社交导航
机构 * School of Computing(计算机学院) ; Smart Systems Institute(智能系统研究所)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L)
GUI知识基准:揭示VLMs在GUI任务中的知识差距
机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) ; Beijing University of Posts(北京邮电大学) ; Tsinghua University, Beijing, China(清华大学) ; Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。
DECEPTICON:暗模式如何操纵网络代理
机构 * Stanford University(斯坦福大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。
基于用户反馈的视觉-语言导航适应
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) ; School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) ; University of Science and Technology of China(中国科学技术大学) ; School of Computer Science, The University of Adelaide(计算机科学学院,阿德莱德大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出基于用户反馈的视觉-语言导航适应方法,通过拓扑感知轨迹构建和持久记忆库机制,提升代理对用户指令的响应能力,实现高效模仿学习和跨指令风格的强适应性。
道路网络中的交通感知导航
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Queen’s University(女王大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本研究比较了三种图搜索方法在Kingston道路网络中交通感知导航中的性能,发现Dijkstra和A*在交通感知最优解方面表现最佳,而Yen's算法在预处理和运行效率上取得平衡。
MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; University of Southern California(南加州大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。
SIA:符号可解释性用于网络控制中的前瞻性深度强化学习
机构 * IMDEA Networks Institute(IMDEA网络研究所) ; Northeastern University(东北大学) ; Universidad Carlos III de Madrid(马德里卡洛斯三世大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 SIA通过融合符号AI与知识图谱,实现前瞻性深度强化学习的实时可解释性,提升网络控制的透明度和效率。
Comments 10 pages, 12 figures, accepted at IEEE INFOCOM 2026
SymbXRL:符号可解释深度强化学习用于移动网络
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 SymbXRL通过符号AI生成可解释的DRL解释,提升网络决策的透明度和可控性。
Comments 10 pages, 9 figures, published in IEEE INFOCOM 2025
Journal ref IEEE INFOCOM 2025 - IEEE Conference on Computer Communications, London, United Kingdom, 19-22 May 2025, pp. 1-10
工业互联网机器人协作系统与边缘计算优化
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本文提出一种基于边缘计算的工业机器人协作系统,通过三层神经网络和模拟退火算法优化全局路径规划,提升机器人在随机环境下的导航鲁棒性。