arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-10 至 2026-03-10 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 11 篇

2603.05069 2026-03-10 cs.AI cs.HC cs.MA 70%

Jagarin: A Three-Layer Architecture for Hibernating Personal Duty Agents on Mobile

Jagarin:一种用于移动设备上休眠个人责任代理的三层架构

Ravi Kiran Kadaboina

机构 * Independent Researcher(独立研究者)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Jagarin通过三层架构解决移动设备上个人责任代理的休眠与唤醒问题,利用启发式引擎、身份代理和协议框架实现高效的责任管理。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06918 2026-03-10 cs.RO 67%

T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation

T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航

Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen, Tung Doan, Tuan Dang

机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)

专题命中 GUI与网页智能体 :autonomous agent(abstract);planning(abstract)

AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。

Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07432 2026-03-10 cs.CV cs.CL cs.HC cs.LG 62%

Generalization in Online Reinforcement Learning for Mobile Agents

移动端智能体在线强化学习中的泛化能力

Li Gu, Zihuan Jiang, Zhixiang Chi, Huan Liu, Ziqiang Wang, Yuanhao Yu, Glen Berseth, Yang Wang

机构 * Mila – Québec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能主席) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AndroidWorld-Generalization基准,通过整合GRPO与可扩展回放系统,评估移动端智能体在未见任务实例、模板和应用上的泛化能力,并展示RL在提升性能上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 57%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08013 2026-03-10 cs.AI 57%

PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents

PIRA-Bench: 从反应式 GUI 代理到基于 GUI 的主动意图推荐代理的转变

Yuxiang Chai, Shunye Tang, Han Xiao, Rui Liu, Hongsheng Li

机构 * Nankai University(南开大学) Huawei Research(华为研究)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 PIRA-Bench通过引入主动意图推荐代理基准,推动GUI代理从反应式向主动式转变,评估多模态大语言模型在连续弱监督视觉输入中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08086 2026-03-10 cs.CV 50%

From Reactive to Map-Based AI: Tuned Local LLMs for Semantic Zone Inference in Object-Goal Navigation

从反应式到基于地图的AI:针对目标导航的语义区域推断的调优本地LLM

Yudai Noda, Kanji Tanaka

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种基于地图的AI方法,利用调优的本地LLM进行语义区域推断,以提升对象-目标导航任务中的成功率和路径效率。

Comments 6 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 50%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07644 2026-03-10 cs.RO 50%

PanoDP: Learning Collision-Free Navigation with Panoramic Depth and Differentiable Physics

PanoDP:利用全景深度与可微物理学习无碰撞导航

Hao Zhong, Pei Chi, Jiang Zhao, Shenghai Yuan, Xuyang Gao, Thien-Minh Nguyen, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Beihang University, Beijing, China(北京航空航天大学) The University of Queensland, Australia(昆士兰大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 PanoDP通过结合全景深度感知与可微物理训练信号,提升在杂乱环境中无碰撞导航的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07586 2026-03-10 cs.HC 50%

AiRWeb: Using AR to Extend Web Browsing Beyond Handheld Screens

AiRWeb:利用AR扩展网页浏览超越手持屏幕

Mengfei Gao, Caroline Appert, Ludovic David, Emmanuel Pietriga

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 AiRWeb通过AR技术扩展网页浏览,允许用户灵活卸载内容到周围空间,实现个性化组织,提升移动浏览体验。

Comments CHI EA '26: Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06927 2026-03-10 cs.RO 50%

A Contrastive Fewshot RGBD Traversability Segmentation Framework for Indoor Robotic Navigation

一种用于室内外机器人导航的对比式少样本RGBD可 traversability 分割框架

Qiyuan An, Tuan Dang, Fillia Makedon

机构 * Department of Computer Science and Engineering, University of Texas at Arlington(计算机科学与工程系,德克萨斯大学阿灵顿分校) Uber(优步) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas(认知机器人实验室,电气工程与计算机科学系,阿肯色大学)

专题命中 GUI与网页智能体 :autonomous agent(abstract)

AI总结 本文提出了一种基于对比学习的少样本RGBD分割框架,利用负例原型和稀疏深度信息提升室内机器人导航的可 traversability 分割性能。

Journal ref IEEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏