UniNav: A Unified World-Action Diffusion Model for Visual Navigation
UniNav:用于视觉导航的统一世界-动作扩散模型
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
UniNav:用于视觉导航的统一世界-动作扩散模型
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。
CUADebug:计算机使用智能体故障的诊断与修复
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。
Comments 23 pages, 10 figures, 6 tables
儿童步态行为解码
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; PediaMed AI ; Shenzhen Children’s Hospital(深圳市儿童医院) ; Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。
Journal ref ECCV 2026
稳健导航
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 研究旨在解决大规模导航系统部署问题,提出Robostral Navigate模型,仅用单目RGB图像流预测路点,具鲁棒性。通过模拟场景减少对真实数据依赖,用前缀缓存训练等方法,在基准测试中达新最优,提升导航系统性能。
EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。
FBFM:一种用于世界-动作模型执行中流匹配的无训练异步反馈机制
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究针对世界-动作模型分块反馈时间粒度粗、无法逐时间步纠错的问题,提出无训练异步反馈机制FBFM,在两类WAM上使LIBERO等任务成功率提升超5%,实现开环流生成与闭环真实世界动力学的桥接。
Comments 29 pages, 5 figures. Preprint
看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。
ContactFlow:一种可跨 embodiment 迁移的视频动作条件模型
机构 * University of Bonn(波恩大学) ; Lamarr Institute(拉马尔研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 Contact Flow 是一种与 embodiment 无关的动作表示,可跨人类演示与不同机器人 embodiment 迁移,用于构建能预测合理操纵结果的世界模型,集成到 pipeline 后在相关任务上表现良好。
AdaMARP: 一种自适应多智能体交互框架用于通用沉浸式角色扮演
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 AdaMARP提出了一种自适应多智能体交互框架,通过沉浸式信息格式和显式场景管理器提升角色扮演的沉浸感和适应性,实验表明其在角色一致性、环境基础性和场景转换等方面优于现有系统。
Comments ACL2026 Findings
StateAct:在像素之前的程序状态,用于长期计算机使用代理
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 研究针对计算机使用代理,提出基于程序状态的StateAct多代理框架,主要代理用代码处理状态,GUI子代理辅助,支持验证,在OSWorld 2.0上提升了Claude Opus 4.8的成功率,且成本降低,实现从感知到推理的瓶颈转移。
UAV-ON:用于空中智能体的开放世界目标导航基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。
Comments Accepted to ACM MM 2025
SciExplore:评估从科学导航到信息整合的自主智能体
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 介绍用于评估大语言模型和智能体科学信息检索与推理能力的基准SciExplore,包含四类任务,在其上评估多个先进模型和智能体,发现随着任务复杂度增加性能差距大,凸显当前模型在实际科学信息检索场景中的局限。
Comments 25 pages, 13 figures. Submitted to ACL 2026
学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Amazon(亚马逊) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance Douyin Content Group(字节跳动抖音内容部)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。
Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future
SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用
机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) ; Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。
Comments Accepted by ACM International Conference on Multimedia 2026 (ACM MM 2026)
图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖
机构 * Shenzhen University(深圳大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。
Comments 17 pages, 3 figures
触觉:赋予使用计算机的智能体双手和双脚
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。
DiMaS:用于引导视觉-语言-动作模型的分布匹配
机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。
MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Monash University(莫纳什大学) ; Pusan National University(釜山国立大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。
Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released
用于可泛化机器人控制的原生视频动作预训练
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。
超越描述:为具身智能体进行细粒度动作的认知基准测试
机构 * Zhejiang University(浙江大学) ; Wolf 1069 b(沃尔夫1069b) ; Sany Group(三一集团) ; The Hong Kong Polytechnic University(香港理工大学) ; Imperial College London(帝国理工学院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。
Comments Accepted to ECCV2026
APPLV: 从视觉-语言-动作模型中自适应学习规划器参数
机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) ; Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) ; Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。
MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI
AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。
从更少中学习更多:事后诸葛亮式强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Stanford University(斯坦福大学) ; University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。
FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模
机构 * Pengcheng Laboratory(鹏城实验室) ; Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。
生成式动作叙事:评估合成视频中的人体运动
机构 * Boston University(波士顿大学) ; Belmont High School(贝利蒙高中) ; Canyon Crest Academy(坎波尔峡谷学院) ; Runway
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。
GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰
机构 * SAIS, UCAS(中国科学院大学人工智能学院) ; SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。
Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection
GUI-AC:增强GUI代理的持续学习能力
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。
三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器
机构 * University of Southern California(南加州大学) ; NVIDIA Research(NVIDIA研究)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。
Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav
Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026
Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理
机构 * Southwestern University of Finance and Economics(西南财经大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central South University(中南大学) ; Hithink Research(Hithink研究) ; Westlake University(西湖大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Manchester(曼彻斯特大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Adelaide(阿德莱德大学) ; Fudan University(复旦大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。
Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner
MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) ; Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。