arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-19 至 2026-03-19 共收录 6 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 6 篇

2603.17670 2026-03-19 cs.RO 82%

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :agentic(title);agent(abstract);planning(abstract)

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17420 2026-03-19 cs.AI 77%

From Digital Twins to World Models:Opportunities, Challenges, and Applications for Mobile Edge General Intelligence

从数字孪生到世界模型:移动边缘通用智能的机会、挑战与应用

Jie Zheng, Dusit Niyato, Changyuan Zhao, Jiawen Kang, Jiacheng Wang

机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer, Northwest University(高级网络与智能信息服务省州联合工程研究中心,计算机学院,西北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Automation of School, Guangdong University of Technology(自动化学院,广东工业大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了从数字孪生到世界模型的转变,分析了其在移动边缘通用智能中的作用,涵盖概念差异、设计原则、关键组件及应用挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13615 2026-03-19 cs.AI cs.CL cs.HC 62%

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17441 2026-03-19 cs.CV cs.AI 57%

AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement

AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化

Siqi Pei, Liang Tang, Tiaonan Duan, Long Chen, Shuxian Li, Kaer Huang, Yanzhe Jing, Yiqiang Yan, Bo Zhang, Chenghao Jiang, Borui Zhang, Jiwen Lu

机构 * Lenovo Research(联想研究院) Tsinghua University(清华大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17056 2026-03-19 cs.CV cs.LG 57%

DesertFormer: Transformer-Based Semantic Segmentation for Off-Road Desert Terrain Classification in Autonomous Navigation Systems

DesertFormer:基于Transformer的语义分割用于自动驾驶导航系统中的沙漠地形分类

Yasaswini Chebolu

机构 * Department of Computer Science \& Engineering (AI \& ML) Gayatri Vidya Parishad College of Engineering for Women Visakhapatnam, India

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 DesertFormer基于SegFormer B2与层次化Mix Transformer(MiT-B2)架构,针对沙漠地形的低对比度、强光照变化和稀疏植被挑战,实现10类生态意义地形分类,提升地面机器人与自动驾驶车辆的安全路径规划能力。

Comments 10 pages, 6 figures, 3 tables. Preprint also available on Zenodo (DOI: 10.5281/zenodo.19053085)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24910 2026-03-19 cs.CV 50%

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

基于大规模自改进演示的目标导向视觉-语言导航学习

Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The University of Adelaide(阿德莱德大学) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SID方法,通过自改进演示提升导航能力,实现高效探索和泛化,显著提升导航性能,达到新状态的SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏