arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3128 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 109 篇

2606.05597 2026-08-10 cs.LG 版本更新 57%

AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents

AsyncWebRL: 面向视觉网页智能体的高效多步强化学习

Hao Bai, Rui Yang, Chenlu Ye, Spencer Whitehead, Aviral Kumar, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) CMU(卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。

Comments Updated logo and code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26041 2026-07-31 cs.AI cs.CV 版本更新 57%

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 57%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14925 2026-07-23 cs.LG cs.NI 版本更新 57%

Self-Explaining Reinforcement Learning for Mobile Network Resource Allocation

用于移动网络资源分配的自解释强化学习

Konrad Nowosadko, Franco Ruggeri, Ahmad Terra

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 研究移动网络资源分配问题,核心方法是用自解释神经网络参数化PPO智能体策略并聚合局部解释为全局解释,主要贡献是性能接近最优深度学习方法且显著优于启发式方法,全局解释相关性强,在高风险强化学习中有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11063 2026-07-22 cs.AI 版本更新 57%

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。

Comments ACM International Conference on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14079 2026-07-22 cs.AI 版本更新 57%

FormGym: Doing Paperwork with Agents

FormGym:用智能体完成文书工作

Matthew Toles, Rattandeep Singh, Isaac Song, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :tool-use(abstract);分类 cs.AI

AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 57%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04334 2026-07-21 cs.AI 版本更新 57%

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖

Guijia Zhang, Yuxun Chen, Yuheng Qi, Harry Yang

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12625 2026-07-16 cs.CL cs.CV 版本更新 57%

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

KnowAct-GUIClaw:深度理解、完美执行,具有自我进化记忆和技能的个人GUI助手

Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 针对OpenClaw的不足,提出深度理解、完美执行范式,介绍KnowAct-GUIClaw框架,通过多系统实验验证其在效率、准确性和跨平台适应性方面的优势,且知识记忆和执行技能可跨基础模型迁移。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新 57%

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09046 2026-07-03 cs.CR cs.LG cs.OS 版本更新 57%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种适用于移动设备的高效且安全的LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出FlexServe,一种适用于移动设备的高效且安全的LLM服务系统,通过灵活的资源隔离机制提升推理速度和安全性,采用多模型调度器优化多模型工作流,实验显示在TTFT和多模型工作流中均取得显著加速效果。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新 57%

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18197 2026-06-29 cs.AI 版本更新 57%

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25160 2026-06-19 cs.AI 版本更新 57%

ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis

SimuWoB: 模拟真实世界移动应用以实现快速且保真的GUI智能体基准测试

Guohong Liu, Jialei Ye, Pengzhi Gao, Wei Liu, Jian Luan, Yunxin Liu, Yuanchun Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对现有移动GUI智能体基准测试与现实应用之间的差距,提出全合成基准SimuWoB,通过鲁棒的虚拟环境生成框架合成高保真任务和环境,自动提供有效奖励,实现对复杂长程交互的高效可重复评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14418 2026-06-16 cs.CL 版本更新 57%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08211 2026-06-11 cs.LG 版本更新 57%

MobileFineTuner: A Mobile-Native Framework for On-Device LLM Fine-Tuning in Real-World Embedded AI Applications

MobileFineTuner:面向真实世界嵌入式AI应用中设备端大语言模型微调的移动原生框架

Jiaxiang Geng, Lunyu Zhao, Yiyi Lu, Bing Luo

机构 * Duke Kunshan University(Duke昆山大学) The University of Hong Kong(香港大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出移动原生框架MobileFineTuner,通过C++实现资源感知训练运行时(内存高效注意力、激活检查点等),在商用手机上实现端到端LLM微调,显著降低内存压力并提升可执行性。

Comments 26 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04627 2026-06-09 cs.AI 版本更新 57%

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE: 具有隐式推理和生成世界模型的移动智能体

Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22649 2026-07-23 cs.CV 版本更新 56%

Interactive Medical-SAM2 GUI: A Napari-based semi-automatic annotation tool for medical images

交互式医学-SAM2 GUI:基于Napari的半自动标注工具用于医学图像

Woojae Hong, Jong Ha Hwang, Jiyong Chung, Joongyeon Choi, Hyunggun Kim, Yong Hwy Kim

机构 * Department of Biomechatronic Engineering, Sungkyunkwan University(生物机电工程系,全州大学) Department of Neurosurgery, Seoul National University Hospital, Seoul National University College of Medicine(神经外科,首尔国立大学医院,首尔国立大学医学院)

专题命中 GUI与网页智能体 :workflow(abstract);planning(comments)

AI总结 交互式医学-SAM2 GUI 提供基于Napari的本地工作流,实现高效的3D医学图像半自动标注与导出功能。

Comments Planning to submit JOSS (Journal of Open Source Software)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06075 2026-08-12 cs.DC 版本更新 50%

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

MemGUI-Bench: 动态环境中移动GUI代理内存能力的基准测试

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang Chai, Weifeng Lin, Han Xiao, WenHao Wang, Siheng Chen, Zhengxi Lu, Gao Wu, Hao Wang, Liang Liu, Yong Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 MemGUI-Bench提出一个综合的内存导向基准测试,通过128个任务评估移动GUI代理的内存能力,揭示了各系统中的显著内存缺陷并提出5种设计改进措施。

Comments Accepted to ACM MM 2026. Project page: https://memgui-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06833 2026-08-11 cs.RO 版本更新 50%

Unordered Landmark Visual Navigation

无序地标视觉导航

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。

Comments ECCV2026 Oral & Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04276 2026-08-11 econ.TH 版本更新 50%

The Fallback as Signal: Preserved Human Skill, Liability, and Competence Signaling in Credence-Good Markets under Improving AI

作为信号的弃权:AI不断改进下的信任品市场中保留的人类技能、责任与能力信号

Andreas Bauer

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对AI改进但仍不完善时企业的人类员工参与决策问题,构建基于主体的市场模型再现相关分析阈值,揭示信任品市场中人类技能等信号的保留机制。

Comments v2: Corrects the author first names in the Singh, Ghosh and Dai reference (verified against the arXiv listing). Typography: Latin Modern replaces bitmap-rendered T1 Computer Modern and all figures are re-exported without Type-3 fonts; no content changes, no number changes. 49 pages, 7 figures. Replication code and seeds in the ancillary files. Also SSRN 7198738. JEL: D82, D86, J24, K13, L15, O33

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19930 2026-08-10 cs.HC 版本更新 50%

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配

Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Jiangning Zhang, Yong Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。

Comments Project page: https://mobile-forge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19499 2026-08-10 cs.RO 版本更新 50%

Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning

强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人

Mehdi Heydari Shahna, Jouni Mattila

机构 * Faculty of Engineering(工程学院) Natural Sciences(自然科学) Tampere University(塔尔库大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 50%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新 50%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20429 2026-08-03 stat.AP 版本更新 50%

Design and Validation of a Grid-based Home Detection via Stay-Time (GHOST) Software for Mobile Location Data

基于停留时间的网格化家庭检测(GHOST)软件的设计与验证:用于移动定位数据

Alessandra Recalde, Mustafa Sameen, Xiaojian Zhang, Xilei Zhao

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究提出了一种基于网格和停留时间的家庭检测算法GHOST,通过定制的空间和时间过滤器识别最频繁访问的夜间或周末白天网格单元,以推断代理家庭位置,并在大规模数据集上验证其在噪声数据中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 50%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏