Xiaomi-GUI-0 Technical Report
Xiaomi-GUI-0 技术报告
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Xiaomi-GUI-0 技术报告
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。
它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用
机构 * Fudan University(复旦大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。
Comments work in progress
GUI vs. CLI:纯屏幕与技能中介计算机使用代理的执行瓶颈
机构 * NYU Shanghai(上海纽约大学) ; Yale NLP Lab(耶鲁大学自然语言处理实验室)
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 通过匹配基准测试,发现GUI代理在长流程任务中表现优于CLI代理,但CLI代理通过技能增强可超越GUI,揭示两者执行瓶颈分别在于可靠交互与技能覆盖。
EffiNav: 融合深度与视觉语言实现高效物体目标导航
机构 * Systems Hub of Intelligence Transportation HKUST(GZ)(香港科技大学(广州)智能交通系统中心)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出EffiNav框架,融合深度信息与视觉语言模型,通过预测探索边界和语义先验指导导航,在HM3D和OVON数据集上匹配或超越基线,提升路径效率与泛化性。
VISUALSKILL:面向计算机使用智能体的多模态技能
机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.CL
AI总结 提出VISUALSKILL分层多模态技能库,通过结合文档与UI探索构建,使智能体在CUA基准上平均得分提升15.3点,且多模态优于纯文本技能。
Minim: 通过可信本地净化实现代理的隐私感知最小化视图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 针对LLM代理传输完整UI状态导致隐私泄露的问题,提出MINIM框架,在客户端基于上下文完整性学习双重分数(敏感性和必要性),通过三元披露策略实现隐私感知的最小化视图,在减少敏感泄露的同时保留任务关键信息。
Comments Accepted at ICML 2026 (43rd International Conference on Machine Learning, Seoul, South Korea). Code available at https://github.com/yyyyhx/MINIM
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)
HyMobileAgent:用于高效GUI代理的数据-环境协同扩展
机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。
GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态
机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; University of Technology Sydney(悉尼科技大学) ; Adelaide University(阿德莱德大学)
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract)
AI总结 提出主动任务驱动记忆(ATMem),将GUI代理的记忆从被动存储转变为主动维护的执行状态,并引入STR-GRPO强化学习方法,通过对比记忆开启和关闭的轨迹来选择性使用记忆,以提升长周期任务执行的准确性和效率。
计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Intel Labs(英特尔实验室) ; Capital One AI Labs(Capital One AI实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。
代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。
Comments 27 pages, 5 figures, 15 tables
基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。
泛化与引导:用于少样本逆强化学习的奖励分解
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。
从移动数据到商业洞察:用于大规模城市交通分析和决策支持的端到端分析框架
机构 * LIAAD ; INESC-TEC ; Mobile Network Analytics ; NOS SGPS
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究通过调查城市环境中智能手机用户行为模式应对多领域挑战。开发数据平台,采用先进技术,构建模块化架构,应用可视化技术,模型可处理多种交通分析任务,为城市规划和商业决策提供见解。
奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知
机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) ; Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。
有能力但粗心:计算机使用代理是否遵循情境完整性?
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。
面向计算机使用代理的历史感知视觉基础批评家
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Capital One ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI、cs.CL
AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。
Comments Code: https://github.com/G-JWLee/HiViG
路由在最具价值处最不可学习:Web智能体的表示路由边界
机构 * University College London(伦敦大学学院) ; Holistic AI
专题命中 GUI与网页智能体 :agent(abstract,comments);分类 cs.CL
AI总结 该研究针对Web智能体的观察模式路由问题,发现路由在智能体最需处因标签不足而不可学,固定合适模式的效果优于多数路由策略,仅稀疏单元有例外。
Comments Preprint. Under review at the Second Workshop for Research on Agent Language Models (REALM), EMNLP 2026 (non-archival track)
Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。
SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。
RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。
MELLON——面向在线导航的多模态增强型大语言模型
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。
穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统
机构 * Central South University(中南大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI
AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。
Comments Accepted by IEEE VIS'26
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.LG
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
AndroidReality:移动智能体距离真实世界还有多远?
机构 * Arizona State University(亚利桑那州立大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出基于扰动的框架AndroidReality,构建含可控扰动的移动基准测试,揭示移动智能体的鲁棒性差距,提出TTIR机制缓解故障,确立基准扰动的实用价值。
CoCoNav:面向人群环境中安全机器人导航的保形控制
机构 * The University of Manchester(曼彻斯特大学) ; Italian Institute of Technology(意大利技术研究院) ; Genisom AI ; University of Warwick(华威大学) ; Newcastle University(纽卡斯尔大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG
AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。
UniNav:用于视觉导航的统一世界-动作扩散模型
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。