arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2965 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2965 篇

2608.16886 2026-08-18 cs.HC 新提交 50%

Evaluating Beyond the Screen: Collective Assessment of AI-Generated Business Plans with Resource-Constrained Entrepreneurs

屏幕之外的评估:与资源受限创业者共同评估AI生成的商业计划书

Qi Zhao, Marjory Pineda, Ketul Chhaya, Aakash Gautam, Yasmine Kotturi

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究针对资源受限创业者,将BizChat工具扩展出评估模块,通过小组讨论让14名参与者集体评估AI生成的商业计划,发现该方式能提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16476 2026-08-18 cs.RO 新提交 50%

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

通过从野外视频进行可扩展学习揭示具身城市导航中的长尾分布

Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出可扩展框架,从网络规模野外 egocentric 视频学习点目标城市导航策略,自动注释视频并训练视觉-语言-动作策略,表征并诊断导航长尾分布与失败模式,验证了知识迁移效果并揭示长尾结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16703 2026-08-18 cs.RO 50%

VLM-Empowered Multi-Mode System for Efficient and Safe Planetary Navigation

Sinuo Cheng, Ruyi Zhou, Wenhao Feng, Huaiguang Yang, Haibo Gao, Zongquan Deng, Liang Ding

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 GUI与网页智能体 :planning(abstract)

Comments accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14531 2026-08-17 cs.RO cs.SY eess.SY 新提交 50%

Spatiotemporal Tube-Based Safety-Certificate for Autonomous Navigation of Articulated Vehicles

铰接式车辆自主导航的基于时空管的安全证书

Mohd. Faizuddin Faruqui, Ratnangshu Das, Ravi Kumar L, Pushpak Jagtap

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对铰接式车辆自主导航的狭窄路线机动挑战,提出基于时空管的规划方法,确保挂车处于道路走廊内,经仿真验证可提供路线安全证书。

Comments Accepted for presentation at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14273 2026-08-17 cs.HC 新提交 50%

Designing Mobile and Wearable Sensor-Fused Conversational Agents for Health and Wellbeing

面向健康与福祉的移动及可穿戴传感器融合对话智能体设计

Hansoo Lee, Pablo Fonseca, Md Haseen Akhtar

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。

Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)

Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06990 2026-08-14 eess.SY cs.SY 50%

Koopman-Based Dynamic Environment Prediction for Safe UAV Navigation

Vitor Bueno, Ali Azarbahram, Marcello Farina, Lorenzo Fagiano

专题命中 GUI与网页智能体 :planning(abstract)

Journal ref 2026 European Control Conference (ECC), IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11901 2026-08-13 cs.RO 新提交 50%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06075 2026-08-12 cs.DC 版本更新 50%

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

MemGUI-Bench: 动态环境中移动GUI代理内存能力的基准测试

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang Chai, Weifeng Lin, Han Xiao, WenHao Wang, Siheng Chen, Zhengxi Lu, Gao Wu, Hao Wang, Liang Liu, Yong Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 MemGUI-Bench提出一个综合的内存导向基准测试,通过128个任务评估移动GUI代理的内存能力,揭示了各系统中的显著内存缺陷并提出5种设计改进措施。

Comments Accepted to ACM MM 2026. Project page: https://memgui-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09196 2026-08-11 cs.RO 新提交 50%

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot

SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航

Yuhao Cao, Xiao Liu, Yang Xie, Lu Liu, Haoyao Chen

机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。

Comments 8 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08981 2026-08-11 cs.DC 新提交 50%

Universal Rendezvous of Anonymous Agents with Footprints

带足迹的匿名智能体的通用会合算法

Bibhuti Das

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对带足迹模型中所有连通(有限或可数无限)底层图的会合实例,提出通用会合算法,解决了Das和Pelc提出的开放问题,给出该模型所有实例存在通用算法的肯定答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 50%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07797 2026-08-11 cs.RO cs.CV 新提交 50%

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain

无人机辅助的无人机-无人车协同积雪覆盖地形自主导航

Shreyam Gupta, P. Agrawal, Priyam Gupta, R. Gautam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对积雪覆盖地形传统导航方法失效的问题,提出无人机-无人车协同导航框架,采用定制U-Net、EKF、YOLOv5等技术实现高分割精度与低定位误差,可在遮挡环境中完成自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06833 2026-08-11 cs.RO 版本更新 50%

Unordered Landmark Visual Navigation

无序地标视觉导航

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。

Comments ECCV2026 Oral & Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04276 2026-08-11 econ.TH 版本更新 50%

The Fallback as Signal: Preserved Human Skill, Liability, and Competence Signaling in Credence-Good Markets under Improving AI

作为信号的弃权:AI不断改进下的信任品市场中保留的人类技能、责任与能力信号

Andreas Bauer

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对AI改进但仍不完善时企业的人类员工参与决策问题,构建基于主体的市场模型再现相关分析阈值,揭示信任品市场中人类技能等信号的保留机制。

Comments v2: Corrects the author first names in the Singh, Ghosh and Dai reference (verified against the arXiv listing). Typography: Latin Modern replaces bitmap-rendered T1 Computer Modern and all figures are re-exported without Type-3 fonts; no content changes, no number changes. 49 pages, 7 figures. Replication code and seeds in the ancillary files. Also SSRN 7198738. JEL: D82, D86, J24, K13, L15, O33

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29029 2026-08-11 cond-mat.mtrl-sci 50%

Geometry-based Discovery of Calcium Battery Cathodes Accelerated by Foundational Machine-Learned Models

基于几何学的钙电池正极发现加速于基础机器学习模型

Dereje Bekele Tekliye, Achinthya Krishna Bheemaguli, Gopalakrishnan Sai Gautam

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 通过几何和化学设计原则,结合机器学习模型,从材料项目数据库中筛选出37种有前景的钙电池正极候选材料,其中两种具有极低的Ca²⁺迁移势垒,四种具有热力学稳定的充电态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06482 2026-08-10 cs.DC 新提交 50%

Rendezvous of Mobile Deterministic Automata in Graphs

图中移动确定自动机的会合问题

Bibhuti Das, Andrzej Pelc

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究图中移动确定自动机的会合问题,证明固定小卵石无法实现树的RV-通用DFA,而配备单个可移动小卵石的DFA可成为树的RV-通用DFA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07123 2026-08-10 cs.HC cs.PF physics.data-an 新提交 50%

Thermodynamic Human-Computer Interaction

热力学人机交互

Uzafir Ahmad Rafaq, Muaz Hassan, Ali Muzaffar

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出一种基于热力学的人机交互统一框架,可跨交互模态扩展、无需训练数据且评估时间为O(1),在网页预取任务中取得1.37的预取点击比和98.1%的目标预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19930 2026-08-10 cs.HC 版本更新 50%

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配

Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Jiangning Zhang, Yong Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。

Comments Project page: https://mobile-forge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19499 2026-08-10 cs.RO 版本更新 50%

Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning

强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人

Mehdi Heydari Shahna, Jouni Mattila

机构 * Faculty of Engineering(工程学院) Natural Sciences(自然科学) Tampere University(塔尔库大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07554 2026-08-10 cs.RO 50%

Efficient Swept Volume-Based Trajectory Generation for Arbitrary-Shaped Ground Robot Navigation

高效扫掠体积基轨迹生成用于任意形状地面机器人导航

Yisheng Li, Longji Yin, Yixi Cai, Jianheng Liu, Fangcheng Zhu, Mingpu Ma, Siqi Liang, Haotian Li, Fu Zhang

机构 * Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(皇家理工学院机器人、感知与学习 division)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种高效扫掠体积基轨迹生成方法,通过粗到细的框架提升任意形状地面机器人在复杂环境中的导航效率和碰撞避免能力。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 50%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05078 2026-08-06 cs.RO 新提交 50%

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04825 2026-08-06 cs.RO 新提交 50%

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04741 2026-08-06 cs.CR 新提交 50%

LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents

LoginTrap:针对基于大语言模型的Web智能体的任务无关型钓鱼式间接提示注入攻击的发现

Longtao Guo, Zelin Zhang, Kaifeng Huang, Yang Shi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出LoginTrap攻击,是针对基于LLM的Web智能体的任务无关型登录诱导攻击,在黑盒威胁模型下可达到86%的平均端到端攻击成功率,揭示了登录诱导的认证边界风险并推动相关防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 50%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03313 2026-08-05 cs.NI cs.MM eess.IV 新提交 50%

ProCAVE: A Self-Adaptive, Full-Lifecycle Edge Caching Framework for Video Streaming via Predictive Bandwidth Estimation and Preference-Aware Deep Reinforcement Learning

ProCAVE:基于预测带宽估计与偏好感知深度强化学习的自适应全生命周期视频流边缘缓存框架

Yeganeh Chatri, Behzad Akbari, Foad Ghaderi, Pejman Goudarzi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对现有边缘缓存方法在无线动态环境下响应与协调不足的问题,提出ProCAVE框架,结合轻量Transformer、PPO、DDPG实现预测带宽建模与偏好感知缓存控制,实验表明其在字节命中率、回传负载、QoE上优于FlyCache等基线。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏