arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2965 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2965 篇

2608.03143 2026-08-05 cs.CV cs.RO 新提交 50%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00721 2026-08-04 cs.RO 新提交 50%

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction

OmniAI:一种面向人机交互的表面自适应空中投影界面

Nikita Kuzmin, Yuhua Jin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Ivan Valuev, Nikolai Lutsenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OmniAI是一种具现化空中智能体,通过自适应投影实现人机交互,采用RGB-D与RANSAC检测投影表面,支持语音、手势控制,为情境感知人机交互提供移动空间AR界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新 50%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20429 2026-08-03 stat.AP 版本更新 50%

Design and Validation of a Grid-based Home Detection via Stay-Time (GHOST) Software for Mobile Location Data

基于停留时间的网格化家庭检测(GHOST)软件的设计与验证:用于移动定位数据

Alessandra Recalde, Mustafa Sameen, Xiaojian Zhang, Xilei Zhao

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究提出了一种基于网格和停留时间的家庭检测算法GHOST,通过定制的空间和时间过滤器识别最频繁访问的夜间或周末白天网格单元,以推断代理家庭位置,并在大规模数据集上验证其在噪声数据中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28474 2026-07-31 cs.RO 新提交 50%

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

TEA-AgriVLN:面向农业视觉语言导航的可通行性估计告警

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业场景可通行性模糊问题,提出TEA模块并集成至AgriVLN构建TEA-AgriVLN,在A2A基准上将SR提至0.54、NE降至2.70米,实现农业VLN-CE领域最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27812 2026-07-31 cs.NI 新提交 50%

Localization and Pursuit of a Mobile Target using Distance-only Measurements

仅利用距离测量的移动目标定位与追踪

Nabarupa Das, Suvadip Batabyal

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种无需GPS、角度传感或多锚节点的方法,通过距离测量实现二维平面内移动目标的定位与追踪,最多13步即可完成定位,智能体可从搜索顺利过渡到追踪并保持有界误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 50%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 50%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10348 2026-07-30 cs.RO 版本更新 50%

Semantic Evidence Regulation via Relational Bias for Zero-Shot Object Navigation

通过关系归纳偏差重新思考具身导航

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新 50%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21409 2026-07-29 cs.RO 版本更新 50%

DSCD-Nav: Dual-Stance Cooperative Debate for Object Navigation

DSCD-Nav: 双视角协作辩论用于物体导航

Weitao An, Qi Liu, Chenghao Xu, Jiayi Chai, Xu Yang, Kun Wei, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24230 2026-07-28 cs.DL 新提交 50%

Umulsai: A Plain-Text Format and In-Browser Engraving System for Jeongganbo, Korean Mensural Notation

Umulsai:一种用于朝鲜正谱记谱法的纯文本格式和浏览器内排版系统

Danbinaerin Han

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 研究针对朝鲜正谱记谱法与西方排版系统不兼容且缺乏实用数字工具的问题,提出了Umulsai编辑器,其核心包含特定纯文本格式、排版引擎和无依赖实现,经专家主导的AI辅助工作流程开发并验证,可实现高质量输出与多种功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 50%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 50%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 GUI与网页智能体 :agentic(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20801 2026-07-24 cs.RO quant-ph 版本更新 50%

Q-SpiRL: Quantum Spiking Reinforcement Learning for Adaptive Robot Navigation

Q-SpiRL:量子脉冲强化学习用于自适应机器人导航

Mohamed Khair Altrabulsi, Nouhaila Innan, Alberto Marchisio, Muhammad Kashif, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出Q-SpiRL框架,结合量子增强的脉冲神经网络,实现了在动态环境中高效稳定的机器人导航,通过实验验证了其在任务完成、轨迹效率和运动平滑度之间的最佳平衡。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05442 2026-07-23 cs.DM 版本更新 50%

Broadcast via Mobile Agents in a Dynamic Network: Interplay of Graph Properties & Agents

动态网络中通过移动代理进行广播:图属性与代理的相互作用

William K. Moses, Amanda Redlich, Frederick Stock

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 重新审视动态网络中广播问题,原研究认为边密度是区分解决问题所需代理数量的关键属性,本文通过构造不同边密度的图及算法,表明边密度并非正确区分属性,揭示其与代理数量关系较弱。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17527 2026-07-21 cs.HC 新提交 50%

Sidekick: Designing Communication for Effective Multitasking with Computer Use Agents

Sidekick:与计算机使用代理进行有效多任务通信的设计

Ruei-Che Chang, Wenqian Xu, Dingzeyu Li, Bryan Wang, Anhong Guo

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究针对计算机使用代理文本反馈问题,开发Sidekick原型系统,在不同交互阶段用多模态反馈传达其状态,经30人参与的研究验证其能显著提升多任务性能,有效支持进度感知等,还展示了应用前景及对人机协作的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16956 2026-07-21 cs.RO 新提交 50%

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图

Yuwen Liao, Yihang Lan, Yizhuo Yang, Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 50%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 50%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00877 2026-07-21 cs.RO 50%

Learning When to Jump for Off-road Navigation

在越野导航中学习何时跳跃

Zhipeng Zhao, Taimeng Fu, Shaoshu Su, Qiwei Du, Ehsan Tarkesh Esfahani, Karthik Dantu, Souma Chowdhury, Chen Wang

机构 * University at Buffalo(布法罗大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出Motion-aware Traversability方法,通过建模实际机器人运动动态,提升越野导航的实时性和安全性,减少75%的路径绕行。

Journal ref Robotics: Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15974 2026-07-20 cs.RO cs.CV 新提交 50%

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection

在有限标注和导航预算下用于目标检测的具身主动学习

Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza, Joni Pajarinen, Riad Akrour

机构 * LAAS-CNRS, Universite de Toulouse, CNRS(法国国家科学研究中心图卢兹分部LAAS、图卢兹大学、法国国家科学研究中心) Department of Electrical Engineering and Automation at Aalto University(阿尔托大学电气工程与自动化系)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究在机器人导航和标注预算有限时,如何让目标检测器适应未知环境。核心方法是利用空间一致性选择样本重训检测器,实验表明该方法能在无外部监督下选图,相同预算下适应结束时检测精度最高。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13154 2026-07-20 cs.RO 版本更新 50%

Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation

世界合一演示:用于学习开放世界移动操作的合成数据引擎

Lingxiao Guo, Huanyu Li, Guanya Shi

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究如何通过合成数据引擎WANDA从单个演示学习开放世界移动操作策略,利用重建背景、重排交互片段、校正状态扩展等方法,实现长期鲁棒性、空间泛化和跨环境泛化,还支持跨实体数据生成。

Comments Project website: https://wanda.lecar-lab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 50%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 50%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13369 2026-07-16 cs.CR cs.CY 新提交 50%

xChk: Bring Your Own Identity -- Heterogeneous Assurance with Verifier-Determined Sufficiency

xChk:自带身份——基于验证者确定充分性的异构认证

Sean MacGuire

专题命中 GUI与网页智能体 :AI agent(abstract)

AI总结 xChk作为自带身份的参考身份提供商,让用户通过异构证明注册并在OIDC令牌中披露声明,依赖方应用自身策略,支持人工参与高风险操作认证,生产部署实现双边RP评估及特定依赖方登录。

Comments 19 pages, 4 figures. Reference implementation at https://in.xchk.io; one documented RP (crabbyed.com, Appendix B)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20001 2026-07-16 econ.TH 版本更新 50%

Allocating Common-Value Goods

分配共同价值物品

Hiroto Sato, Ryo Shirakawa

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究了在无货币交易情况下最大化共同价值物品分配的问题,通过机制筛选代理人私有信息并影响其对物品价值的学习,最优机制由两个参数决定,可能排除部分代理人并导致即使所有代理人愿意接收时也 withholding 分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20652 2026-07-15 physics.soc-ph cs.SY eess.SY 版本更新 50%

Mobility-Informed Coupling of ABM, PDE, and ODE Models for Pandemic Simulation in Germany

面向德国大流行模拟的移动性信息耦合ABM、PDE和ODE模型

Kristina Kehrer, Tim O. F. Conrad

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出混合建模框架,耦合高分辨率ABM与PDE/ODE模型,利用手机移动数据实现跨区域个体转移,平衡精度与效率,并在全德仿真中评估旅行限制和防控策略。

详情

展开后加载摘要…

URL PDF HTML 收藏