arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2960 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2960 篇

2510.21850 2026-01-28 cs.CV cs.CL 57%

SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models

SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing

Gyubeum Lim, Yemo Koo, Vijay Krishna Madisetti

机构 * Georgia Institute of Technology(佐治亚理工学院) Konkuk University(韩国康克伦大学)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.CL

AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16424 2026-01-26 cs.RO cs.AI 57%

RENEW: Risk- and Energy-Aware Navigation in Dynamic Waterways

RENEW: 动态水道中风险和能耗感知的导航

Mingi Jeong, Alberto Quattrini Li

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 RENEW通过结合风险和能耗感知策略,实现动态水道中自主水面车辆的稳健导航,首次解决自适应不可航行性和拓扑路径多样性问题。

Comments 9 pages, 10 figure, 4 tables, AAAI 2026 (main track; oral acceptance)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04083 2026-01-21 cs.NI cs.LG 57%

Cells on Autopilot: Adaptive Cell (Re)Selection via Reinforcement Learning

Cells on Autopilot: 通过强化学习实现自适应的细胞(重新)选择

Marvin Illian, Ramin Khalili, Antonio A. de A. Rocha, Lin Wang

机构 * Paderborn University, Germany(帕德博恩大学) Huawei Technologies, Germany(华为技术有限公司) Fluminense Federal University, Brazil(弗鲁米嫩塞联邦大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出CellPilot框架,通过强化学习自动学习并优化细胞(重新)选择参数,实验证明其在提升网络性能方面优于传统方法。

Comments 11 pages, 13 figures, 3 tables, v3: Added analysis of heuristic tuning trade-offs (Config-A vs Config-B) across scenarios with corresponding reference-value table; corrected performance numbers in the conclusion; no change to methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12538 2026-01-21 cs.RO cs.LG 57%

EmoBipedNav: Emotion-aware Social Navigation for Bipedal Robots with Deep Reinforcement Learning

EmoBipedNav:基于深度强化学习的具有情绪感知的双足机器人社交导航

Wei Zhu, Abirath Raju, Abdulaziz Shamsah, Anqi Wu, Seth Hutchinson, Ye Zhao

机构 * Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(智能决策与自主机器人实验室,伍德鲁夫机械工程学院,佐治亚理工学院) College of Engineering and Petroleum, Kuwait University(工程与石油学院,科威特大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Khoury College of Computer Sciences, Northeastern University(计算机科学学院,东北大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 EmoBipedNav通过深度强化学习实现双足机器人在社交环境中的情绪感知导航,结合运动约束与社交动态,提升安全性和交互效率。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10911 2026-01-19 cs.LG 57%

Realistic Curriculum Reinforcement Learning for Autonomous and Sustainable Marine Vessel Navigation

现实课程强化学习用于自主可持续海洋船舶导航

Zhang Xiaocai, Xiao Zhe, Liang Maohan, Liu Tao, Li Haijiang, Zhang Wenbin

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出基于现实课程强化学习的框架,结合数据驱动的海洋模拟和机器学习预测模块,以实现自主且可持续的船舶导航。

Comments Present in The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 57%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09248 2026-01-15 cs.CV cs.AI 57%

Hybrid guided variational autoencoder for visual place recognition

混合引导变分自编码器用于视觉地点识别

Ni Wang, Zihan You, Emre Neftci, Thorben Schoepe

机构 * Amazon Development Center Germany GmbH, Berlin, Germany(亚马逊德国开发中心) Southeast University, Nanjing, China(东南大学) Forschungszentrum Jülich GmbH, Aachen, Germany(尤利希研究中心) imec, Luven, Belgium(imec)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI

AI总结 本文提出一种混合引导变分自编码器用于视觉地点识别,结合事件视觉传感器和脉冲神经网络,实现紧凑、鲁棒且具有泛化能力的模型,提升移动机器人导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08868 2026-01-15 cs.CV cs.AI cs.RO 57%

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

残差跨模态融合网络用于音频视觉导航

Yi Wang, Yinfeng Yu, Bin Ren

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。

Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06806 2026-01-13 cs.CV cs.AI cs.RO 57%

SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

SpatialNav: 利用空间场景图进行零样本视觉-语言导航

Jiwen Zhang, Zejun Li, Siyuan Wang, Xiangyu Shi, Zhongyu Wei, Qi Wu

机构 * Fudan University, Shanghai, China(复旦大学) University of Southern California, Los Angeles, USA(南加州大学) Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 SpatialNav通过构建空间场景图,利用全局空间表示提升零样本视觉-语言导航的效率与性能。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00116 2026-01-05 cs.LG cs.RO 57%

GRL-SNAM: Geometric Reinforcement Learning with Path Differential Hamiltonians for Simultaneous Navigation and Mapping in Unknown Environments

GRL-SNAM:基于路径微分哈密顿量的几何强化学习用于未知环境中的同时导航与建图

Aditya Sai Ellendula, Yi Wang, Minh Nguyen, Chandrajit Bajaj

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 GRL-SNAM通过局部能量优化实现未知环境中的同时导航与建图,利用受控哈密顿优化提升导航质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI 57%

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 57%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00162 2025-12-23 cs.LG cs.NA math.NA 57%

Modeling Large-Scale Walking and Cycling Networks: A Machine Learning Approach Using Mobile Phone and Crowdsourced Data

对大规模步行和骑行网络建模:一种利用移动电话和众包数据的机器学习方法

Meead Saberi, Tanapon Lilasathapornkit

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本研究采用机器学习方法,利用移动电话和众包数据对澳大利亚新南威尔士州大规模步行和骑行网络进行建模,以提高主动交通规划的准确性。

Comments 22 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14014 2025-12-17 cs.AI 57%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11147 2025-12-15 cs.CR cs.AI 57%

MiniScope: A Least Privilege Framework for Authorizing Tool Calling Agents

MiniScope: 一种基于最小特权原则的工具调用代理授权框架

Jinhao Zhu, Kevin Tseng, Gil Vernik, Xiao Huang, Shishir G. Patil, Vivian Fang, Raluca Ada Popa

机构 * University of California, Berkeley(加州大学伯克利分校) IBM Research(IBM研究院)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 MiniScope通过重建权限层次结构和移动式权限模型,实现最小特权原则,以平衡安全性和易用性,同时在权限最小化和成本控制方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10934 2025-12-12 cs.RO cs.LG 57%

Curriculum-Based Reinforcement Learning for Autonomous UAV Navigation in Unknown Curved Tubular Conduit

基于课程的学习强化学习用于自主无人机在未知弯曲管状通道中的导航

Zamirddine Mari, Jérôme Pasquet, Julien Seinturier

机构 * DGA Techniques Navales - Direction Générale de l’Armement(法国国防总局海军技术部) LIRMM, TETIS, CNRS, Université de Montpellier Paul-Valéry(蒙彼利埃大学保罗-瓦莱里耶大学) LIS, CNRS, Université de Toulon(土伦大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出基于课程学习的强化学习方法,使无人机在未知弯曲管状环境中实现自主导航,通过结合激光雷达和视觉信息,克服部分可观测性挑战,提升导航稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09920 2025-12-11 cs.RO cs.AI cs.CV 57%

LISN: Language-Instructed Social Navigation with VLM-based Controller Modulating

LISN: 基于VLM控制器的指令引导社交导航

Junting Chen, Yunchuan Li, Panfeng Jiang, Jiacheng Du, Zixuan Chen, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * RoboScience Co.(RoboScience公司) ShanghaiTech University(上海科技大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 LISN通过VLM控制器实现指令引导的社交导航,提出首个标准化基准并提升动态避障能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06912 2025-12-10 cs.RO cs.LG 57%

Khalasi: Energy-Efficient Navigation for Surface Vehicles in Vortical Flow Fields

Khalasi:在涡流流场中表面车辆的节能导航

Rushiraj Gadhvi, Sandeep Manjanna

机构 * Plaksha University(普拉克斯大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的端到端方法,用于在涡流流场中实现表面车辆的节能导航,通过局部速度测量学习流感知的导航策略,显著提升能源效率和泛化能力。

Comments Under Review for International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06490 2025-12-09 cs.LG 57%

Optimizing LLMs Using Quantization for Mobile Execution

用量化优化LLMs在移动执行中的应用

Agatsya Yadav, Renta Chintala Bhargavi

机构 * School of Computer Science(计算机科学学院) Engineering(工程学院) Vellore Institute of Technology(韦洛雷理工学院) Chennai, India(印度钦奈)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.LG

AI总结 本文通过4位后训练量化和GGUF格式优化,实现Llama 3.2 3B模型在移动设备上的高效部署。

Comments 11 pages, 1 equation, 2 tables. Author Accepted Manuscript (AAM) of a paper published in Springer LNNS, ICT4SD 2025. DOI: 10.1007/978-3-032-06697-8_33

Journal ref Fong, S., Dey, N., Joshi, A. (eds) ICT Analysis and Applications. ICT4SD 2025. Lecture Notes in Networks and Systems, vol 1654. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04105 2025-12-05 cs.CY cs.AI cs.HC 57%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03429 2025-12-04 cs.RO cs.AI 57%

World Models for Autonomous Navigation of Terrestrial Robots from LIDAR Observations

基于LIDAR观测的地面机器人自主导航的World Models

Raul Steinmetz, Fabio Demo Rosa, Victor Augusto Kich, Jair Augusto Bottega, Ricardo Bedin Grando, Daniel Fernando Tello Gamarra

机构 * Universidade Federal de Santa Maria, Brazil(巴西联邦大学圣玛利亚分校) University of Tsukuba, Japan(日本筑波大学) Universidade Federal de Rio Grande(巴西联邦大学里约格兰德分校) Universidad Tecnológica del Uruguay, Uruguay(乌拉圭技术大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出基于DreamerV3算法的模型驱动强化学习框架,通过整合MLP-VAE实现高维LIDAR数据的高效编码与潜在表示学习,提升地面机器人自主导航的效率与鲁棒性。

Comments Accepted for publication in the Journal of Intelligent and Fuzzy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00049 2025-12-02 cs.RO cs.AI 57%

Socially aware navigation for mobile robots: a survey on deep reinforcement learning approaches

面向移动机器人的社会感知导航:深度强化学习方法的综述

Ibrahim Khalil Kabir, Muhammad Faizan Mysorewala

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文综述了深度强化学习在社会感知导航中的应用,分析了关键技术和挑战,提出未来需结合多种方法并建立平衡的评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17532 2025-11-26 cs.NI cs.AI 57%

Denoising Refinement Diffusion Models for Simultaneous Generation of Multi-scale Mobile Network Traffic

去噪细化扩散模型用于多尺度移动网络流量的同时生成

Xiaoqian Qi, Haoye Chai, Sichang Liu, Lei Yue, Raoyuan Pan, Yue Wang, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) China Mobile Communications Group Guangxi Co., Ltd.(中国移动通信集团广西有限公司)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 ZoomDiff通过多阶段去噪细化扩散模型实现多尺度移动网络流量的同时生成,提升了流量预测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19477 2025-11-26 cs.SE 57%

Building Browser Agents: Architecture, Security, and Practical Solutions

构建浏览器代理:架构、安全与实用解决方案

Aram Vardanyan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。

Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 57%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17225 2025-11-24 cs.RO cs.AI cs.CV 57%

TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making

TP-MDDN:任务优先的多需求驱动导航与自主决策

Shanshan Li, Da Huang, Yu He, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新机构)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 TP-MDDN通过引入任务优先的多需求驱动导航与自主决策系统,提升复杂任务下的导航性能与环境理解能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15567 2025-11-20 cs.CV cs.CL cs.HC 57%

Computer-Use Agents as Judges for Generative User Interface

计算机使用代理作为生成用户界面的法官

Kevin Qinghong Lin, Siyuan Hu, Linjie Li, Zhengyuan Yang, Lijuan Wang, Philip Torr, Mike Zheng Shou

机构 * University of Oxford(牛津大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室) Microsoft(微软公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出Coder-CUA协作框架,通过代理作为法官与编码模型协作,提升自动GUI设计的效率和可靠性。

Comments Project: https://showlab.github.io/AUI Github: https://github.com/showlab/AUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23452 2025-11-20 cs.IR cs.SE 57%

What About Emotions? Guiding Fine-Grained Emotion Extraction from Mobile App Reviews

Quim Motger, Marc Oriol, Max Tiessler, Xavier Franch, Jordi Marco

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.SE

Comments Accepted at the 33rd IEEE International Requirements Engineering 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11845 2025-11-18 cs.RO cs.AI cs.AR 57%

Autonomous Underwater Cognitive System for Adaptive Navigation: A SLAM-Integrated Cognitive Architecture

K. A. I. N Jayarathne, R. M. N. M. Rathnayaka, D. P. S. S. Peiris

机构 * Department of Computational Mathematics University of Moratuwa(计算数学系大学莫图瓦)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏