Collaborative Visual Navigation
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
DataClaw0: 从原始流中智能定制多模态数据
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Tsinghua University(清华大学)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.LG
AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。
Comments add base model: Qwen3.5-27B
DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距
机构 * University of California, Berkeley(加州大学伯克利分校) ; Technical University of Munich(慕尼黑工业大学)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL
AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。
MobileGym: 一个可验证且高度并行的移动GUI智能体研究仿真平台
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL
AI总结 提出MobileGym,一个基于浏览器的轻量级、完全可控的移动环境,通过结构化JSON状态实现可验证结果信号和低成本并行强化学习,并附带包含416个参数化任务模板的基准测试集。
Comments Project page: https://mobilegym.github.io
Prune4Web: 面向Web代理的DOM树剪枝编程
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL
AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。
Comments Paper accepted to AAAI 2026
机构 * The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Southern University of Science and Technology(南方科技大学) ; The Hong Kong University of Science and Technology(香港科学大学)
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.SE
机构 * East China Normal University(东华大学) ; Alibaba Group(阿里巴巴集团) ; University of Electronic Science and Technology of China(电子科技大学) ; Wuhan University(武汉大学) ; Sun Yat-sen University(中山大学)
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.LG
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Oxford(牛津大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL
Comments ACL 2025 Camera Ready
机构 * Aim Intelligence ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL
Comments Accepted ACL 2025 Industry track
专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL
Comments 19 pages, 4 figures, 18 tables. Accepted to EMNLP 2024
专题命中 GUI与网页智能体 :autonomous agent(title);分类 cs.AI、cs.LG
Journal ref Sensors 2023, 23(2), 614
专题命中 GUI与网页智能体 :planning(title);分类 cs.AI、cs.CL
6G:从连接基础设施到有保障的数字服务
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract)
AI总结 研究6G网络转折点问题,提出重新排列控制优先等五个优先事项的观点,通过控制契约、保障经济、网络MCP平台及标准化阐述等成果实践该观点,并给出三阶段路线图区分标准与部署目标等。
Comments Submitted to IEEE Access (Manuscript ID: Access-2026-37371). 29 pages, 20 figures, 92 references
人群中的自主导航:基于不变集的方法
机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出了一种基于不变集的自主导航方法,通过输入受限反馈控制器和规划策略,实现非协调拥挤环境中安全快速的多智能体导航。
平面跟踪中的反馈速度控制
机构 * Department of Mechanical and Aerospace Engineering, University of South Florida(南佛罗里达大学机械与航空航天工程系)
专题命中 GUI与网页智能体 :agent(summary_cn,abstract)
AI总结 针对领航-跟随平面跟踪问题,提出一种反馈速度控制律与恒定方位角转向策略,实现并排编队并证明渐近稳定性,扩展至N-agent链网络。
Syll: 开源个人自动化与跨界面执行
机构 * Adobe Systems Inc.(Adobe系统公司) ; Stardew Valley(《星露谷物语》) ; macOS ; University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。
Comments Code: https://github.com/THU-SAGE/syll
网络代理应采用计划-然后执行范式
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出网络代理应默认采用计划-然后执行范式,而非ReAct架构。该范式通过预先制定任务特定程序,避免运行时网页内容的干扰,提升安全性和效率。
AutoGUI-v2:一个全面的多模态GUI功能理解基准
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; New Laboratory of Pattern Recognition(模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation(香港科学创新研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);autonomous agent(abstract)
AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。
Comments Technical Report
VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架
机构 * UC Santa Cruz ; CMU(卡内基梅隆大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Salesforce ; UC Berkeley(伯克利加州大学)
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。
Comments The first two authors contribute equally
面向无人机的视觉与语言导航:进展、挑战与研究路线图
机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) ; School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) ; School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) ; Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) ; The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) ; School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。
GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准
机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。
Comments accepted by CVPR 2026
SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。
无死锁的混合式RL-MAPF框架用于零样本多机器人导航
机构 * Department of Mechanical Engineering University of California Riverside CA USA(加州大学河滨分校机械工程系) ; Department of Electrical and Systems Engineering Washington University in St. Louis MO USA(华盛顿大学圣路易斯分校电气与系统工程系)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出一种无死锁的混合RL-MAPF框架,通过整合反应性RL导航与按需MAPF干预,实现零样本多机器人导航的鲁棒性能。
Comments 18 pages (including appendix), 3 figures. Project page (videos, animations, additional resources): https://wanghaoyi518.github.io/rl-mapf-project-page/
机构 * FAIR at Meta(Meta 的 FAIR 研究组) ; Meta Reality Labs(Meta 现实实验室) ; University of Southern California(南加州大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Website: https://facebookresearch.github.io/DigiData
机构 * Department of Industrial Engineering, Clemson University(工业工程系,克莱姆森大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化所模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(中国科学院多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation, CASIA(中国科学院香港创新科学研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);planning(abstract)
Comments Accepted to ICCV 2025
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; OPPO AI Center(OPPO AI中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
Comments ACL 2025 (Oral)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);planning(abstract)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG