Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation
面向移动端检索增强生成的轻量级分块选择
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
面向移动端检索增强生成的轻量级分块选择
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。
Qwen-UI-Agent技术报告:面向下一代以真实世界为中心的基础图形用户界面智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究推出以真实世界为中心的基础GUI智能体Qwen-UI-Agent,结合多环境与数据飞轮等机制,在移动端基准达最优,在多类任务上表现具竞争力。
用于精神分裂症认知康复的交互式视觉语言平台
机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) ; RIIMA Laboratory(RIIMA实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。
用于视觉运动策略学习的有序动作令牌
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对动作令牌化存在的问题,提出有序动作令牌化(OAT)方法,利用带特定机制的变换器将动作块离散化,满足高压缩率等三个需求,在多种策略和任务中验证,能提升策略性能并增强推理灵活性。
HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型
机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。
Comments 20 pages with 13 figures
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。
TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。
Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
UI2App:可执行Web应用程序生成中视觉交互推理的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。
WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。
Comments Rejected by ECCV 2026, Arxiv Paper
Kairos: 面向物理AI的原生世界模型栈
机构 * Kairos Team(Kairos团队)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。
Comments Kairos Technical Report
EgoGapBench:多智能体场景中自我中心动作选择的基准测试
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Sogang University(成均馆大学) ; Ministry of Science and ICT(科学技术信息通信部)
专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。
Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench
MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑
机构 * Binghamton University(宾汉姆顿大学) ; Massachusetts General Hospital(马萨诸塞综合医院) ; Harvard Medical School(哈佛医学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。
LUMOS:面向无障碍AI代理的语义操作系统层
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出LUMOS语义层,将操作系统无障碍元数据转化为机器可读蓝图,使AI代理通过结构化UI原语而非截图进行观察-行动循环,降低视觉依赖和成本。
Comments The LUMOS repository is available at https://github.com/thotayogeswarreddy/Lumos.git
ComAct: 通过COM即行动范式重构专业软件操作
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出COM即行动范式,将专业软件交互转化为确定性程序合成,解决GUI代理的脆弱性和API代理的异构性问题;构建ComCADBench基准和ComActor自校正代理,在工业CAD软件上实现SOTA性能。
ASCII艺术将LLMs转化为VLA控制器
机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) ; Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) ; Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)
专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。
Video2Code: 通过动作感知重访从UI视频生成交互式网页
机构 * University of Waterloo(滑铁卢大学) ; Tsinghua University(清华大学) ; Zhipu AI(智谱AI) ; Beihang University(北京航空航天大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。
Comments 31 pages, 21 figures
See-and-Reach: 视场内的精确视觉语言导航用于无人机
机构 * School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) ; School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) ; School of Artificial Intelligence, Shandong University(山东大学人工智能学院) ; School of Computer Science and Artificial Intelligence, Shandong Normal University(山东师范大学计算机科学与人工智能学院) ; Interdisciplinary Research Center of General Artificial Intelligence, Shandong Normal University(山东师范大学通用人工智能跨学科研究中心)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对无人机视觉语言导航中目标可见后精确到达能力评估不足的问题,提出UAV-VLN-FOV任务和3DG-VLN框架,通过动态3D方向线索增强细粒度视觉定位与空间对齐,在基准和真实实验中显著提升成功率。
Comments 12 pages, 7 figures
MaskWAM:统一掩码提示与预测的世界-动作模型
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent Robotics X(腾讯机器人X实验室) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。
面向计算机使用代理的历史感知视觉基础批评家
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Capital One ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。
Comments Code: https://github.com/G-JWLee/HiViG
CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配
机构 * Li Gu(李谷(音译))
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。
HoosierHelp:面向社会服务导航的大语言模型智能体基准测试
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。
WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; EvoPhys AI(EvoPhys人工智能公司) ; Joy Future Academy, JD(京东探索研究院) ; The University of Sydney(悉尼大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。
Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/
基于OpenArm的实验室移动操作的表示交接
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。
Comments Robotics: Science and Systems (RSS) Workshop 2026
Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
世界到手腕:面向精细机器人操作的任务条件未来手腕建模
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学) ; Sun Yat-sen University(中山大学) ; Xidian University(西安电子科技大学) ; Southeast University(东南大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。
隐私保护动作识别:分类、方法与隐私-效用权衡
机构 * Chung-Ang University(中央大学) ; Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) ; College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。
UniNav:用于视觉导航的统一世界-动作扩散模型
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。
CUADebug:计算机使用智能体故障的诊断与修复
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。
Comments 23 pages, 10 figures, 6 tables