arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-10 至 2026-04-10 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 10 篇

2604.07929 2026-04-10 cs.IR cs.AI 79%

Same Outcomes, Different Journeys: A Trace-Level Framework for Comparing Human and GUI-Agent Behavior in Production Search Systems

相同结果,不同旅程:一种基于轨迹层面的框架,用于比较人类和GUI代理在生产搜索系统中的行为

Maria Movin, Claudia Hauff, Aron Henriksson, Panagiotis Papapetrou

机构 * Spotify, Sweden(Spotify瑞典) Spotify, Netherlands(Spotify荷兰) Stockholm University, Sweden(斯德哥尔摩大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一个基于轨迹的评估框架,比较人类和GUI代理在任务结果、努力、查询构建和界面状态导航中的行为差异,通过实验证明代理行为与人类不同,强调轨迹层面诊断的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07776 2026-04-10 cs.LG 79%

Structured Distillation of Web Agent Capabilities Enables Generalization

结构化蒸馏Web代理能力以实现泛化

Xing Han Lù, Siva Reddy

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.LG

AI总结 通过结构化轨迹生成框架,利用Gemini 3 Pro生成3000条轨迹并微调学生模型,实现WebArena 41.5%的性能,超越其他模型,且能力迁移至未见环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11724 2026-04-10 cs.SE 79%

WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements

WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试

Xiwen Teoh, Yun Lin, Duc-Minh Nguyen, Ruofei Ren, Wenjie Zhang, Jin Song Dong

专题命中 GUI与网页智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08516 2026-04-10 cs.CV 71%

MolmoWeb: Open Visual Web Agent and Open Data for the Open Web

MolmoWeb:开放视觉网络代理和开放数据用于开放网络

Tanmay Gupta, Piper Wolters, Zixian Ma, Peter Sushko, Rock Yuren Pang, Diego Llanes, Yue Yang, Taira Anderson, Boyuan Zheng, Zhongzheng Ren, Harsh Trivedi, Taylor Blanton, Caleb Ouellette, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 GUI与网页智能体 :agent(title)

AI总结 本文提出MolmoWeb,一个开放的多模态网络代理,通过公开的浏览器任务演示和网页GUI感知数据,实现状态-of-the-art的网络代理性能,促进开放研究。

Comments https://allenai.org/blog/molmoweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI 70%

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 67%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI 57%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 57%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08292 2026-04-10 cs.RO 50%

EMMa: End-Effector Stability-Oriented Mobile Manipulation for Tracked Rescue Robots

EMMa:面向履带救援机器人的末端稳定性导向移动操作

Yifei Wang, Hao Zhang, Jidong Huang, Shuohang Fang, Haoyao Chen

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种面向履带救援机器人的移动操作框架,通过协调路径优化模型和紧凑成本/约束表示,提高末端操作的稳定性和任务成功率。

Comments 14 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05351 2026-04-10 cs.RO cs.CV 50%

AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation

AnyImageNav: 任意视角几何用于精确最后一步图像目标导航

Yijie Deng, Shuaihang Yuan, Yi Fang

机构 * NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) New York University Abu Dhabi, Electrical Engineering(纽约大学阿布扎比分校电气工程系) Embodied AI and Robotics (AIR) Lab, NYU Abu Dhabi(纽约大学阿布扎比分校具身人工智能与机器人实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出AnyImageNav,通过语义到几何的级联方法实现精确6自由度相机姿态恢复,提升导航成功率和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏