arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 177 篇

2606.31410 2026-07-02 cs.AI 新提交 70%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 70%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24551 2026-06-24 cs.AI 新提交 70%

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

GUI vs. CLI:纯屏幕与技能中介计算机使用代理的执行瓶颈

Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(上海纽约大学) Yale NLP Lab(耶鲁大学自然语言处理实验室)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 通过匹配基准测试,发现GUI代理在长流程任务中表现优于CLI代理,但CLI代理通过技能增强可超越GUI,揭示两者执行瓶颈分别在于可靠交互与技能覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18634 2026-06-18 cs.RO cs.AI 新提交 70%

EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation

EffiNav: 融合深度与视觉语言实现高效物体目标导航

Zecheng Yin, Benedict Jun Ma

机构 * Systems Hub of Intelligence Transportation HKUST(GZ)(香港科技大学(广州)智能交通系统中心)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出EffiNav框架,融合深度信息与视觉语言模型,通过预测探索边界和语义先验指导导航,在HM3D和OVON数据集上匹配或超越基线,提升路径效率与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18448 2026-06-18 cs.CL 新提交 70%

VISUALSKILL: Multimodal Skills for Computer-Use Agents

VISUALSKILL:面向计算机使用智能体的多模态技能

Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 提出VISUALSKILL分层多模态技能库,通过结合文档与UI探索构建,使智能体在CUA基准上平均得分提升15.3点,且多模态优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13949 2026-06-15 cs.AI 新提交 70%

Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization

Minim: 通过可信本地净化实现代理的隐私感知最小化视图

Hexuan Yu, Chaoyu Zhang, Heng Jin, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 针对LLM代理传输完整UI状态导致隐私泄露的问题,提出MINIM框架,在客户端基于上下文完整性学习双重分数(敏感性和必要性),通过三元披露策略实现隐私感知的最小化视图,在减少敏感泄露的同时保留任务关键信息。

Comments Accepted at ICML 2026 (43rd International Conference on Machine Learning, Seoul, South Korea). Code available at https://github.com/yyyyhx/MINIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-17 cs.AI cs.CL cs.LG cs.MA cs.MM 新提交 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14548 2026-07-17 cs.CV 新提交 67%

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

HyMobileAgent:用于高效GUI代理的数据-环境协同扩展

Hy Vision Team, Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, Chengquan Zhang

机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31612 2026-07-03 cs.CV 新提交 67%

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态

Chen Liu, Ling Chen, Hanzhang Zhou, Xu Zhang, Quyu Kong, Panrong Tong, Wenhao Wang, Xin Yu, Steven Hoi, Yue Wang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) University of Technology Sydney(悉尼科技大学) Adelaide University(阿德莱德大学)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract)

AI总结 提出主动任务驱动记忆(ATMem),将GUI代理的记忆从被动存储转变为主动维护的执行状态,并引入STR-GRPO强化学习方法,通过对比记忆开启和关闭的轨迹来选择性使用记忆,以提升长周期任务执行的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 67%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 62%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11191 2026-08-12 cs.CV cs.AI cs.CL 新提交 62%

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位

Shiyu Xuan, Zechao Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17760 2026-07-21 cs.LG cs.AI cs.RO 新提交 62%

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

泛化与引导:用于少样本逆强化学习的奖励分解

Ziyi Liu, Grace Zhang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03394 2026-07-07 cs.AI cs.CY cs.LG 新提交 62%

From Mobile Data to Business Insights: An End-to-End Analytics Framework for Large-Scale Urban Mobility Analysis and Decision Support

从移动数据到商业洞察:用于大规模城市交通分析和决策支持的端到端分析框架

Thiago Andrade, Shazia Tabassum, Miguel E. P. Silva, Ricardo Dinis, Joao Gama

机构 * LIAAD INESC-TEC Mobile Network Analytics NOS SGPS

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过调查城市环境中智能手机用户行为模式应对多领域挑战。开发数据平台,采用先进技术,构建模块化架构,应用可视化技术,模型可处理多种交通分析任务,为城市规划和商业决策提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25127 2026-06-25 cs.LG cs.AI math.OC 新提交 62%

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知

Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi, Aissa Boulmerka

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23189 2026-06-23 cs.AI cs.CL 新提交 62%

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

有能力但粗心:计算机使用代理是否遵循情境完整性?

Anmol Goel, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11078 2026-06-10 cs.AI cs.CL cs.CV 新提交 62%

A History-Aware Visually Grounded Critic for Computer Use Agents

面向计算机使用代理的历史感知视觉基础批评家

Jaewoo Lee, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Supriyo Chakraborty, Kartik Balasubramaniam, Sambit Sahu, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Capital One University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。

Comments Code: https://github.com/G-JWLee/HiViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06171 2026-08-07 cs.CL 新提交 61%

Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

路由在最具价值处最不可学习:Web智能体的表示路由边界

Jiaming Wei, Zekun Wu, Adriano Koshiyama, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI

专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.CL

AI总结 该研究针对Web智能体的观察模式路由问题,发现路由在智能体最需处因标签不足而不可学,固定合适模式的效果优于多数路由策略,仅稀疏单元有例外。

Comments Preprint. Under review at the Second Workshop for Research on Agent Language Models (REALM), EMNLP 2026 (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 57%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 57%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 57%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08617 2026-08-11 cs.AI cs.HC 新提交 57%

Walking through Discussions: A Mobile Visual Analytics System for In-Situ Group Discussion Analysis

穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统

Yiping Sun, Ziyao Kang, Wei Zeng, Minli Wu, Jiazhi Xia

机构 * Central South University(中南大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI

AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。

Comments Accepted by IEEE VIS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08545 2026-08-11 cs.RO cs.LG 新提交 57%

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

结构化参数环境下用于鲁棒导航策略的课程生成

Prishita Ray

机构 * Cornell University(康奈尔大学)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.LG

AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07775 2026-08-11 cs.AI 新提交 57%

AndroidReality: How Far Are Mobile Agents from the Real World?

AndroidReality:移动智能体距离真实世界还有多远?

Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于扰动的框架AndroidReality,构建含可控扰动的移动基准测试,揭示移动智能体的鲁棒性差距,提出TTIR机制缓解故障,确立基准扰动的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07751 2026-08-11 cs.RO cs.LG 新提交 57%

CoCoNav: Conformal Control for Safe Robot Navigation in Crowds

CoCoNav:面向人群环境中安全机器人导航的保形控制

Cheng Guo, Mingzhe Ni, Zheng Liang, Yihu Ling, Yuan Hu, Michele Caprio, Daniele Pucci, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) Italian Institute of Technology(意大利技术研究院) Genisom AI University of Warwick(华威大学) Newcastle University(纽卡斯尔大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-10 cs.AI cs.CV cs.RO 新提交 57%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07079 2026-08-10 cs.RO cs.AI 新提交 57%

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆

Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏