arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 12 篇

2602.09012 2026-06-23 cs.LG cs.AI cs.CL 版本更新 87%

Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense

下一代验证码:利用认知差距实现可扩展且多样化的GUI智能体防御

Jiacheng Liu, Yaxin Luo, Jiacheng Cui, Xinyi Shang, Xiaohan Zhao, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) MetaAgentX University College London(伦敦大学学院)

专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Next-Gen CAPTCHAs框架,通过利用人机在交互感知、记忆、决策和行动上的认知差距,设计动态任务以区分生物用户与AI智能体,实现可扩展的防御。

Comments Project page at https://greenoso.github.io/NextGen-CAPTCHAs_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20622 2026-06-23 cs.AI cs.LG 新提交 81%

Darwin Mobile Agent: A Roadmap for Self-Evolution

Darwin移动智能体:自我进化路线图

Daniel Beechey, Derek Yuen, Jianheng Liu, Dezhao Luo, Tiantian He, Weilin Luo, Jun Wang, Kun Shao

机构 * University College London(伦敦大学学院)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出通过移动GUI环境实现智能体自我进化,利用异步并行架构解决数据瓶颈,并规划从任务课程、结果验证和记忆管理三方面去除人类先验的路线图。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20910 2026-06-23 cs.CR cs.AI 新提交 79%

Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents

你是谁的代理?自主网络代理的多层指纹识别与归因

Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 针对AI网络代理的隐私与安全挑战,提出基于网络层和浏览器交互行为的多层指纹识别方法,通过决策树分类器实现97%准确率的代理识别与归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23189 2026-06-23 cs.AI cs.CL 新提交 62%

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

有能力但粗心:计算机使用代理是否遵循情境完整性?

Anmol Goel, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18212 2026-06-23 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

SCoTT: Strategic Chain-of-Thought Tasking for Wireless-Aware Robot Navigation in Digital Twins

SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划

Aladin Djuhera, Amin Seffo, Vlad C. Andrei, Holger Boche, Walid Saad

机构 * Technical University of Munich(慕尼黑技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。

Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 57%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21216 2026-06-23 cs.RO 新提交 50%

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

来自预训练ViT的每补丁标量实现现实世界快速移动导航

Steeven Janny, Leonid Antsfeld, Christian Wolf

机构 * NaverLabs Europe(NaverLabs欧洲)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 通过大规模真实世界导航实验,研究预训练视觉编码器在机器人导航中的关键组件,提出异构多教师蒸馏和瓶颈策略,发现可解释特征与可供性关联,并证明仅用RGB训练非最优。

Comments European Conference on Computer Vision -- ECCV 2026

Journal ref European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20755 2026-06-23 cs.RO 新提交 50%

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

机构 * University of Trento(特伦托大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 50%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17525 2026-06-23 cs.RO 版本更新 50%

HumanHalo -- Safe and Efficient 3D Navigation Among Humans via Minimally Conservative MPC

HumanHalo -- 通过最小保守MPC实现安全高效的三维人群导航

Simon Schaefer, Helen Oleynikova, Sandra Hirche, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出HumanHalo框架,结合可达性安全保证与数据驱动人体运动预测,通过仅约束初始控制输入实现安全高效的3D MAV人群导航,在仿真和真实实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新 50%

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16000 2026-06-23 cs.CV 版本更新 50%

SenseExpo: Spatial Exploration and Navigation via Scene Estimation from Expeditious Predictive Operators

SenseExpo: 通过快速预测算子的场景估计进行空间探索与导航

Haojia Gao, Haohua Que, Mingkai Liu, Jiayue Xie, Hoiian Au, Yusen Qin, Qian Zhang, Jiajun Sun, Weihao Shan, Tianle Zhu, Handong Yao, Fei Qiao

机构 * Tsinghua University(清华大学) University of Georgia(佐治亚大学) Peking University(北京大学) D-Robotics(D-机器人) Infinity Robotics(Infinity机器人)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出轻量级单机器人探索框架SenseExpo,结合紧凑地图预测网络与前沿策略,以709K参数实现优于U-Net和LaMa的预测性能,并在探索实验中显著加速目标覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏