Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents
专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.AI
Comments 5 Pages, 10 figures, Presented in; Interdisciplinary Conference on Mechanics, Computers and Electrics ANKARA/TURKEY 27-28 November 2021
Journal ref Interdisciplinary Conference on Mechanics, Computers and Electrics, 27-28 Nov. 2021, Ankara
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
Comments Accepted by TPAMI 2023
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI,2023)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
Comments 4 pages, 2 figures
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
专题命中 GUI与网页智能体 :AI agent(title,abstract);分类 cs.AI
Comments 18 pages, 9 figures, under review
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
Comments Website: https://osu-nlp-group.github.io/Mind2Web. Updated with supplementary material. NeurIPS'23 Spotlight
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.LG
Comments 8 pages, 7 figures, and two tables. The paper is in submission
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
Comments 8 pages, 5 figures, 1 table
专题命中 GUI与网页智能体 :planning(title);agent(abstract);分类 cs.LG
多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tübingen AI Center(图宾根人工智能中心) ; ETH Zurich(苏黎世联邦理工学院) ; University Hospital Tübingen(图宾根大学医院) ; University of Tübingen(图宾根大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。
Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/
WebXSkill:自主网页代理的技能学习
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft(微软)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。
Comments 21 pages
机构 * Apple(苹果公司)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL、cs.LG
机构 * Ukrainian Catholic University(乌克兰天主教大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
带有单调规划代价的潜在世界模型用于图像目标导航
机构 * Drexel University(卓克索大学)
专题命中 GUI与网页智能体 :planning(title,abstract)
AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。
Comments 15 pages, 9 figures, and 6 tables. Includes appendices
混合智能体博物馆导游设计提升性别化学习成果及游客偏好
机构 * University of Michigan(密歇根大学) ; Incheon National University(仁川国立大学)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 研究博物馆中机器人导游,提出结合实体与虚拟智能体的混合导游系统,经30人受试者内研究验证,发现其提升女性学习表现,各条件下参与度和体验质量一致,且无论性别参与者都更偏好混合智能体团队。
Comments Accepted on IROS 2026, 8 pages
EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应
机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) ; Department of Computer Science, University of Southern California(南加州大学计算机科学系)
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。
RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障
机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)
专题命中 GUI与网页智能体 :agentic(title);planning(abstract)
AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。
“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。
HeRo: 异构移动SoC上智能体RAG的自适应编排
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 提出HeRo框架,通过基于性能分析的在线调度器,结合形状感知子阶段划分、关键性加速器映射和带宽感知并发控制,在异构移动SoC上实现低延迟智能体RAG,端到端延迟降低达10.94倍。
Comments Will appear in DAC'2026, Camera Ready
协同移动代理网络中的同时定位与同步
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 本文提出基于时间飞行测量的协同定位与同步框架CoSLAS,采用分布式信念传播算法处理时变局部时钟参数,结合粒子实现与参数信息表示提升精度与效率。
Comments 13 pages, 6 figures, 3 tables; manuscript submitted to IEEE Transaction on Signal Processing
分布式网络中基于信息寻求控制的估计
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 本文提出了一种分布式协作框架,结合信念传播与共识进行联合状态估计,并通过梯度上升最大化后验联合熵以优化信息寻求控制,实现了非线性和非高斯问题中的高效估计与控制。
Comments 17 pages, 10 figures
X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互
机构 * OPPO AI Center(OPPO人工智能中心)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。
Comments 12 pages, 7 figures
SecAgent:基于语义上下文的高效移动GUI代理
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。
DreamToNav: 通过生成式视频规划实现通用机器人导航
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)
专题命中 GUI与网页智能体 :planning(title,abstract)
AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。
Comments Submitted to conference
代理自进化重规划用于具身导航
机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; SIAT, Chinese Academy of Sciences(中国科学院上海技术物理研究所) ; Department of Computer Science, University of Hong Kong(香港大学计算机科学系) ; Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) ; Department of EEE, Southern University of Science and Technology(南方科技大学电子工程系)
专题命中 GUI与网页智能体 :agentic(title,abstract)
AI总结 SERP通过自进化动作模型和图链式思考重规划,提升具身导航在复杂环境中的鲁棒性和效率。
Comments 8 pages, 10 figures, 4 tables, submitted to IEEE for possible publication
MMNavAgent: 多倍率WSI导航代理用于临床一致的全滑片分析
机构 * Institute of Pathology, Technical University of Munich, Germany(慕尼黑技术大学病理研究所) ; Munich Data Science Institute (MDSI), Munich, Germany(慕尼黑数据科学研究所) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) ; Computer Aided Medical Procedures (CAMP), TU Munich, Munich, Germany(计算机辅助医疗程序(CAMP),慕尼黑技术大学) ; Dalian University of Technology(大连理工大学) ; Cancer Hospital of Dalian University of Technology, Shenyang(大连理工大学肿瘤医院) ; Department of Human Pathology, Juntendo University Graduate School of Medicine(立命大学医学研究生院人类病理部门) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) ; Northwest University of China(中国西北大学)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 MMNavAgent通过多倍率交互建模和自适应倍率选择,提升全滑片图像诊断性能,实验显示AUC和BACC均有所提升。